研究中

R1 · 手写识别基准

用真实用户的手写作答图像(填空题与解答题,含数竞选手的难辨认字迹) 对多个手写识别模型做基准测试,衡量「读图 → 提取作答」的准确率。

首批基准结果将在此发布。

研究中

R2 · AI 批改&评分

一试解答题的 AI 批改与评分研究:以官方评分细则(每题 20 分、约 4 个采分点) 为基准,让不同模型对学生作答评分,迭代出更准、更便宜的评分提示词。

评分对比与提示词演进记录将在此发布。

研究中

R3 · AI 判题

填空题 AI 判题的正确性研究:用带用户反馈的真实作答样本, 比较不同模型的判定正确率,定位现有判题的问题。

判题正确率报告将在此发布。

研究中

R4 · 一试重标注

一试题库(3600+ 题)的更精确难度与标签重标注, 完成后重新导入题库,并在这里展示前后对照的样例。

重标注样例对照将在此发布。

研究中

R5 · 小奥重标注

小奥题库的更精确难度与标签重标注(研究机上进行中), 完成后重新导入题库,并在这里展示样例。

重标注样例对照将在此发布。