研究中

R1 · 手写识别基准

用真实用户的手写作答图像(填空题与解答题,含数竞选手的难辨认字迹) 对多个手写识别模型做基准测试,衡量「读图 → 提取作答」的准确率。

首批基准结果将在此发布。

研究中

R2 · AI 批改&评分

一试解答题的 AI 批改与评分研究:以官方评分细则(每题 20 分、约 4 个采分点) 为基准,让不同模型对学生作答评分,迭代出更准、更便宜的评分提示词。

评分对比与提示词演进记录将在此发布。

研究中

R3 · AI 判题

填空题 AI 判题的正确性研究:用带用户反馈的真实作答样本, 比较不同模型的判定正确率,定位现有判题的问题。

判题正确率报告将在此发布。

研究中

R4 · 一试重标注

一试题库(3600+ 题)的更精确难度与标签重标注, 完成后重新导入题库,并在这里展示前后对照的样例。

重标注样例对照将在此发布。

研究中

R5 · 小奥重标注

小奥题库的更精确难度与标签重标注(研究机上进行中), 完成后重新导入题库,并在这里展示样例。

重标注样例对照将在此发布。

基线快照 AI4MO 生产数据 · 截至 2026-09-02

研究起步前对现行 AI 判题(填空)与 AI 批改(解答)的一次全量体检:规模、各模型判定分布、失败模式与用户反馈归类。研究结论发布后会替换/细化本节。

🔒 本页只发布汇总统计与匿名结论;用户名、内部 ID 与原始作答图像一律不公开,研究样本仅在内部分发。
854
作答记录
442
含手写/上传图片
688
AI 批改完成调用
3671
一试题库题目

填空题 AI 判题 · 各模型判定分布

已完成的 fill_grading 调用,按生产先后使用的两代判题模型拆分。

解答题 AI 批改 · 拟判分布

已完成的 other_grading 调用。拟判仅供参考,不改变学生自评;mo24 将升级为 20 分制采分点评分。

批改调用失败模式

85 次未完成调用的错误码分布——一半以上是上游可重试错误,属工程问题而非判题质量。

用户判题反馈归类

ai_grading 类反馈 6 条(措辞已改写归类,不引用原文)。

基线洞察

  • 手写辨认是当前判题的首要短板:可归因的判题投诉全部指向「手写/截图无法辨认 → 直接判错」,包括全屏作答缩屏后产生的空白图。R1 手写识别基准与 R3 判题对比都以这类难例优先。
  • 两代判题模型宽严差异明显:deepseek-v4-flash-vision 判正确率 67.7%(195/288),qwen3.7-flash 56.1%(201/358)。R3 将在同一样本集上做人工金标准对比后下结论。
  • 解答题拟判偏保守:gpt-5.6-sol 的 likely-correct 占 53.8%,deepseek-vision 37.5%,uncertain 占比高。R2 的 20 分制采分点评分提示词将替代这套输出。
  • 上游 4xx/5xx 占未完成调用 55%(47/85 为 upstream_403),是可重试的工程问题,属于工程侧优先修复项。

方法与数据说明

  • 数据来源:AI4MO 生产 D1(learnloops-ai4mo)与 R2 题库桶,导出于 2026-09-02。
  • 统计口径:fill_grading 完成 646 次、other_grading 完成 42 次;判定以 claim_responses.verdict 为准;非完成调用 85 次。
  • 匿名化:统计不区分用户;反馈为改写后的归类;本页不含原始作答图像或用户标识。