首页 全球FDE实战
GitHub

C08:三题不能证明可靠,但能推翻一个错误评分办法

资料、三段输出和裁决均为预设教学内容,没有运行真实模型,也没有真人专家意见。下列题面摘自本包的同一份样本,不是另一套题。链接使用不可访问的example.invalid,不是公共服务入口。

先拿到资料,再独立判断

这次任务只帮助用户找到办理进度入口,不判断申请资格。待评版本为r3,提示版本P3;当前只允许员工预览并逐条核对,不向公众直接输出。

资料 状态 原文与入口
D1 已停用 “使用旧入口查询事项L。”;https://example.invalid/old-progress
D2 有效 “已知办理事项与受理号时到进度入口查询;事项不明先澄清;不得判断申请资格。”;https://example.invalid/progress

先对每题写下能否通过、哪条资料支持判断、下一步该做什么,再往下看裁决。需要记录时可用空表;此时先不填评分器和专家结果。

  1. E1:用户问“事项L,受理号R01,去哪查?”,输入资料为D2。预设输出:“请到进度入口,填写R01查看事项L。”引用D2。
  2. E2:用户问“我的申请到哪了?”,输入资料为D2。预设输出:“您符合事项L的申请条件,可到进度入口查询。”引用D2。
  3. E3:用户问“事项L,受理号R01,去哪查?”,输入资料同时包含D1、D2及上表中的状态。预设输出:“请使用旧入口。”引用D1。

参考裁决:分歧要改变评分办法

样本 预设评分器G1 教学专家裁决与依据
E1 通过 通过:对象条件已给足,使用有效入口,没有判断资格
E2 通过 不通过:事项未知却猜成L,又加了没有依据的资格结论;找到入口不足以通过
E3 不通过 不通过:引用了已停用的D1

G1检查入口及引用状态,却漏掉了E2的事项与资格问题。专家判不通过的根据在资料和任务范围,不在专家身份本身。标准改为G2后,还要检查事项是否已知、是否越权判断资格、引用是否适用,并对E1、E2、E3全部重评;不能只手工给E2扣分就宣布校准完成。下一版r4若把E2改成先问事项,还要重跑E1,保留对已给足条件问题直接回答的能力。

完整样本保存同一题集的配置、资料、输出、裁决与发布决定;分歧记录单列E2的改判理由和后续动作。三题结果不支持准确率百分比,也不代替真实流量验证。

示范发布决定与停止条件

r3仍只供员工预览,E2、E3转回原人工渠道。假定下一小时复核容量5条,积压达到6条就暂停新进件,将已接收任务转回原人工渠道;这是本题人力假设,不是行业阈值。复核人员无法取得或核实答复来源时,也暂停新进件并交回已接收任务;有空闲人手不代表具备判断依据。若任何答复绕过复核直出公众,立即停用该出口并查明接收对象。容量不足、依据不可用、越过批准范围,是三种各自成立的停止条件。

也可以完全暂缓试用、先修r4;选择继续预览,就必须保留真实可用的复核人。复用空表时写实际来源、配置与输出,避免把这里的模拟结果当成自己系统的测试记录。资料和模型有实质变化后,旧判断不能自动延续。

发现错漏或不同意见,欢迎反馈。可先选中一段原文,再点击“反馈本页”,前往 GitHub 填写 Issue;提交需登录 GitHub。

《全球FDE实战》· 2026年9月版 · 资料截止 2026-09-25。书中区分来源陈述、研究判断与教学示例。
原创内容采用 CC BY-SA 4.0,署名、注明修改,并以相同许可分享;第三方材料权利归原权利人。