内置票据 · 级联误差 · 单模块 Oracle

识别器很准,为什么最终字段还是错?

OCR 的每一级都在改写下一级看到的输入。检测漏掉一行以后,识别器和词典根本收不到那行像素;局部指标再漂亮,也不能替代端到端字段准确率。

先把输入和各模块调到一个真实的“不完美状态”

30%
35%
90%
5%
7%
15%
55%
端到端字段准确率
漏字 · 错字 · 顺序错误按最早可定位的失败阶段计数
当前真值替换收益点下面任一模块做天花板实验

只把一个模块换成真值,看看端到端上限能涨多少

模块按钮每次只激活一个 Oracle;再点一次或选择“当前流水线”即可退出。

  1. 结构化输出字段完全正确

对照中间证据,别让最终 JSON 掩盖失败来源

内置样本文档

蓝边=检出 · 橙边=漏检

当前结构化输出

错误预算:每个失败字段归给最早的可定位原因

    同一配置下,仅替换一个模块为真值的字段准确率上限。
    Oracle 模块字段准确率相对基线