某市教育考试院AI智能评卷与质量监控系统
项目背景
某市级教育考试院承担着全市中考、高中学业水平考试、教师资格考试等重大考试的命题、组考和评卷工作。中考每年考生规模超过 8 万人,语文作文和英语写作两道主观题共产生约 32 万份待评答卷。传统“双评+仲裁”模式需要组织 600 余名教师连续评卷 6 天,评卷成本高、周期长,而且不同评卷员之间的评分尺度差异是一大痛点——语文作文双评差异超过 5 分的比例约为 18%,需要第三位仲裁教师介入,进一步增加工作量和时间成本。
核心诉求
部署 AI 智能评卷系统,实现语文作文和英语写作两个科目的 AI 辅助评分,人机评分一致率达 90% 以上,评卷效率提升 40% 以上,同时建设评卷质量实时监控系统,保障考试公平公正。
方案设计
AI 评分模型训练
基于近 5 年共计 120 万份历史评卷数据(含每位考生的双评分数和仲裁结果)训练 AI 评分模型。对于语文作文,模型从内容(立意、选材、思想性)、表达(语言、结构、文体)和发展等级(深刻、丰富、有文采、有创新)四个维度综合评分。对于英语写作,模型从内容完整性、语言准确性、篇章连贯性三个维度评分。
人机协同评卷流程
设计“AI 初评+单人复核”的新评卷模式:AI 首先为每份答卷进行初评并给出分数和评分依据,评卷教师复核 AI 的评分是否合理,可以采纳、微调或退回。AI 与人工评分差异超过阈值(语文 5 分/英语 3 分)的答卷自动进入仲裁流程。系统还对每位评卷员的评分曲线进行实时监测,发现评分尺度漂移自动提醒。
评卷质量监控大屏
建设实时质量监控大屏,展示整体评卷进度、各题组评分分布、异常评分预警(如评分速度过快或过慢、评分分布异常的评卷员)、AI 与人工评分一致性趋势等关键指标,帮助评卷负责人实时掌握全局质量状况并快速响应异常。
公平性保障
AI 模型训练样本覆盖了城乡不同区域、不同层次学校的考生答卷,并经过偏见检测确保不对特定群体产生系统性偏差。模型输出为参考分数,最终成绩以人工复核结果为准。AI 评分不替代人工,而是辅助人工提升效率和一致性。
项目成效
客户评价
“引入 AI 评卷不是要替代教师,而是让教师的专业判断力发挥更大价值。AI 处理掉大量基础性评分工作后,教师可以把精力集中在有争议的答卷上。而且 AI 评分的一致性非常好——同一篇作文不会因为评卷员不同而产生 10 分以上的差异。”
—— 该市教育考试院副院长