自动作文评分

自动作文评分(,缩写为AES)是运用统计方法、机器学习和自然语言处理技术预测作文分数的教育评价方法。

自动作文评分系统通常以人工评定的作文为训练或校准资料,从作文中提取语言特征或学习文本表示,再预测整体分数或若干写作分项的得分。在高风险考试中,自动评分也可与人工评分共同使用,而不由计算机单独决定考生成绩。后来的综述将佩奇开发的作文评分计划()列为早期自动作文评分系统。

2003年,《底特律自由新闻》报道,采用e-rater的Criterion在线作文评价服务当时已在535所学校中供约10.4万名学生和2700名教师使用。该报道说明,e-rater并非实际“阅读”文章,而是依据高分作文中常见的语言特征估计分数。报道所述研究认为,在接受测试的年级、题目和评分条件下,自动分数与人工分数大体接近。2016年的一项研究使用长短期记忆网络学习作文表示并预测分数,另一项研究则以卷积层和递归网络自动学习作文的层次特征。

2020年,一项中文作文评分研究采用弱监督预训练、跨主题微调和目标题目微调三个阶段,在四个作文题目上测试模型。该研究报告,预训练方法提高了所比较神经评分器的评分效果和领域适应能力,但研究者也指出该方法仍有局限。

大语言模型
大语言模型可在不另行训练专门评分模型的情况下,根据提示词、评分量表或少量示例给作文评分。一项2024年研究比较零样本和少样本提示,结果显示联合执行作文评分和反馈生成能够改善其试验中的评分表现,但评分步骤对反馈质量的影响较小。该研究中的两种大语言模型在分数预测方面仍落后于所比较的专门评分模型,但能够同时生成作文反馈。该研究只测试了8篇中等职业学校学生作文,研究中的智能体评分在平均绝对误差、均方误差和均方根误差三项指标上低于未使用评分样本参照的ChatGPT-4o。

应用
自动作文评分可用于在线写作练习、低风险模拟测试和大规模考试评分。《波士顿环球报》2018年报道,马萨诸塞州教育部门研究过将自动评分用于马萨诸塞州综合评估系统作文,以缩短阅卷和公布成绩所需时间。该组织认为,机器难以评价事实准确性、推理、证据充分程度、伦理立场和论证说服力等方面。该研究通过另行建立局部连贯性模型,提高了系统识别这类输入的能力。一项包含阅卷评语的语料研究发现,阅卷员偏差会对依靠人工特征的自动评分模型产生显著影响。研究结果显示,只使用认知能力较高或较低学生的偏斜样本训练时,模型对训练样本以外学生的准确度很低,研究者因而主张训练资料应覆盖所有相关使用群体。该回顾主张研究还应处理数据集、评分分项、模型泛化和实际应用等问题,而不能只比较单一数据集上的平均评分表现。
参考资料

评论 (0)

  • 还没有评论,来抢沙发吧。