方法论包
方法论包是什么、内置的三个各做什么,以及一本叙事教材怎么被提炼成能参与生成与验证的规则。
方法论包是把一身叙事手艺变成流水线真能执行的规则:结构槽位、生成指令、 评审判据、节奏约束。
它不是模板库。 模板给你一个形状去填;包参与生成与验证—— 它的规则进 prompt,它的清单去过产出,它的节奏约束被机械地检查。
里面装什么
四个桶。装不进这四个桶的东西就不属于包:
| 桶 | 装什么 |
|---|---|
| 节拍原型 | 结构槽位:名称、职能、建议位置区间、情绪强度提示 |
| prompt 片段 | 按阶段注入的操作性规则——结构、角色、生产、评审 |
| 评审清单 | 判据 + rubric(怎么评一段给定的文本) |
| 节奏规则 | 可量化的约束,比如连续低强度节拍最多几个 |
行业轶事、历史背景、作者生平不进包。任何既不能改变生成什么、 也不能改变怎么评判的东西,同样不进。
今天的状况: 流水线自带三个包——三幕、Save the Cat、英雄之旅, 新项目用三幕。在它们之间挑选、以及装上你自己的包,应用里还没有做出来。 这一页仍然讲包是怎么做的,因为那决定了这个想法值不值钱; 但它现在还不是一个你能自助使用的功能。
一个包必须守的两条
提炼,不是灌入。 包里装的是你自己表述的规则,绝不是书的原文。 除了版权问题,原文本身对生成也是负资产:引擎要的是稳定的“遇到 X 就做 Y”, 不是论述性散文。判断标准很简单——包里的每一句,都该是你合上书之后能自己写出来的。
每条规则都必须可操作。 一条规则如果既不能改变生成什么、也不能改变怎么评判, 它就不是规则,是感慨。「叙事要打动人心」——删; 「每个主要角色必须在第一幕结束前做出一个揭示其核心缺陷的选择」——留。
一个包是怎么做出来的
1 · 通读,记操作性笔记。 在工具之外读。每当书里给出一条规则、模板、清单或公式, 用你自己的话记一条,并标注它属于哪个桶。页码是给你自己回查用的,不进包。
2 · 分桶去重。 已有的包已经说过的,删掉。一个包只该带这本书独有的那点增量—— 重复的规则在多包混用时只会稀释 prompt。
3 · 起草。 把你的笔记(不是书)转成包的格式。每条 prompt 片段必须是 祈使式、可执行的指令;每条 rubric 必须能让评审者对任意一段文本给出明确判定。
4 · 人工修订。 三遍:每条规则过不过“可操作”这一关;有没有哪句还读着像书的原文; 每条 rubric 到底评不评得出来——拿一段你自己的旧稿试着评一次。评不出来的 rubric 要重写。
5 · 校验与试跑。 先验包的格式,再拿它跑一个阶段,只看两件事: 抽查三到五条规则,产出里找不找得到痕迹;critic 报告里有没有出现这个包的清单项。
6 · Bake-off。 同一个项目跑两个包,比:一级验证通过率、收敛轮数、成本、质量评分。 数据不占优不代表这个包没价值——它可能适合另一类项目—— 但决策要靠数据,不靠口味。
多包混用
prompt 片段按包的声明顺序拼接,所以顺序即优先级:规则冲突时后声明的覆盖先声明的, 而且引擎会在 prompt 里写明这一点,不留给模型去猜。
节拍原型取并集,两个包抢同一个槽位名是一条验证错误——改名解决。 评审清单取并集并按判据去重。
实践上:结构类只激活一个包,别叠。结构框架彼此打架。生产与评审类可以叠。
常见的坑
| 症状 | 说明它出了什么事 | 修法 |
|---|---|---|
| 片段读起来像书 | 你在灌,不是在提炼 | 合上书重写;过不了“我自己能写出来”这一关就删 |
| 产出里看不出包的影响 | 规则太抽象 | 补上触发条件与动作:遇到 X 就做 Y |
| critic 对同一段文本反复给出不同判定 | rubric 评不出来 | 改写成一个可回答的问题 + 明确的判级条件 |
| prompt 被稀释、成本上升 | 包太大 | 一本书通常只值 5–15 条真正独有的规则,砍到这个量级 |
| bake-off 与基线没差别 | 去重没做净 | 只保留这本书的增量 |
版本与脏传播
包是有版本的。任何版本变更都会把用过这个包的产物在依赖图里标脏—— 这是预期行为,不是麻烦:规则变了,那么规则产出的东西现在就该被重新过问一遍。 之后由你决定是重生成,还是只重新验证。