四条原则 · 可迁移的部分
方法论
这套闭环不是从框架论文开始做的,而是从四条被实践检验过的原则推导出来的。 它们比任何具体实现都更可迁移。
四条落地原则
先流程后工具
引入 AI 前先完成流程梳理与标准化。跳过流程标准化直接买工具期待提效, 是多数 AI 项目失败的根因。这个场景在动手搭 Agent 前花了整整两个季度做编目 SOP 原子化。
先确定性后自动化
把复杂业务拆成清晰可控的步骤 —— 每个字段是一个原子技能, 职责单一、格式标准、模块解耦。确定性是自动化的前提,不是它的产物。
先试点后推广
规则生效走灰度(10% 流量),验证修正率真的下降再全量。 机制本身也一样:先在一个场景跑通闭环,再谈复制。
先能力后平台
不等自演进框架成熟。「字段级 diff → 聚合 → LLM 归纳 → 人工审核 → 入库生效」 这条土路能拿到 90% 的价值,一周可以做出第一版。
白盒优于黑盒
通用 Agent 缺乏企业级应用所需的确定性、可解释性与可审计性。这套闭环的每个环节都刻意保持白盒:
- 修正日志是可 grep 的 JSONL,规则库是可人工直接审阅的 JSON;
- 规则是「条件 + 动作 + 理由 + 样本证据」的显式文本,不是权重;
- 不做端到端微调 —— 数据量不足,且不可解释、不可审计,与白盒原则冲突;
- 效果验证是一个可复算的数字:生效日前后的修正率对比。
置信度检验:最容易被忽略的一步
diff 分析会输出置信度分箱,回答一个问题:AI 说自己没把握的时候,是不是真的容易错?
- 低置信度样本占修正量显著更高 → 置信度机制可信,可据此排人工复核优先级;
- 各箱分布均匀 → 置信度机制本身是坏的,先修它,再谈规则提取。
先跑这一项,再决定要不要投入规则提取 —— 否则整个闭环建立在一个不可信的信号上。
结构同构:一次攻坚,多处受益
「人工修正回收」这个问题在不同场景里结构完全同构:
| 场景 | 人工动作 | diff 单元 |
|---|---|---|
| 元数据编目 | 改字段值 | 字段级:原值 → 新值 + 原因 |
| 视频智能切片 | 候选切片留用/弃用/入出点微调 | 切片级:AI 建议 → 人工终审 + 原因 |
| 任何 AI 初筛 + 人工终审的流程 | 接受/修改/拒绝 | 决策级 diff |
规则提取管线(聚合 → 归纳 → 审核 → 灰度)对以上场景通用 —— 攻坚做一次,同构场景都受益。
一句提醒
人工修正日志就是「经验的代际沉淀」的载体。不埋点,经验就随着人走了 ——
而且并行期没埋点的数据,过去了就再也拿不回来。埋点永远是第一优先级。