卡迪夫大学新研究:AI尚无法像人类教师一样可靠地批改作业
创始人
2026-08-24 22:38:31

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:IT之家)

IT之家 8 月 24 日消息,据外媒 Phys.org 今天(24 日)报道,卡迪夫大学和墨尔本大学的一项新研究发现,生成式人工智能(GenAI)目前还无法像人类教师一样可靠地评判学生的书面作业。

研究人员使用 ChatGPT 的两个版本,对 50 篇生物科学专业本科生论文进行评分,以测试大模型评估学生作业的能力。ChatGPT 需要按照 7 项标准批改这些论文,研究人员还采用了 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行比较。

图源:Pexels

卡迪夫大学生物科学学院威廉 · 凯博士指出:“研究结果显示,模型给出的分数波动很大,无法准确预测人工评分。生成式 AI 与人类批改同一批论文时存在明显差异。只看论文总分,两者给出的结果相对接近;一旦具体到每项评分标准和每一篇论文,大模型与人工评分之间的差距就相当明显。”

除一种情况外,AI 模型给出的平均分普遍高于人工评分。平均分方面,AI 模型与人工评分的最大差距达到 16.1 分;具体到单篇论文,最大差距达到 40 分

IT之家获悉,威廉 · 凯还发现,AI 往往会压低高分论文的成绩,又把低分作业的成绩抬高,最终使分数系统性地向中间集中。

研究结果说明,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数。“我们测试的大模型目前并不适合取代教师,为学生预测作业成绩。”

研究人员指出,高等教育领域确实很关注大模型能否利用模式识别能力,让学生作业评分更加客观,同时提高批改效率、减轻教职人员压力。但这项研究表明,目前并不适合这么做。

此外,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题;大模型也不能、也不应该被依赖来给学生的长篇书面作业评分。“随着大模型继续发展,未来模仿人类判断的能力可能会提高。但从这项研究来看,要让 AI 给出的分数与人工评分真正保持一致,恐怕并不容易。”

相关内容

热门资讯

沙棘育苗旺 农户增收忙 东门村村民在基地工作。 技术员现场查看沙棘长势。本报记者 刘祎 摄本报记者 刘 祎8月8日,晴...
电视剧《生命树》 斩获第33届... 本报讯(西海新闻记者 吴梦婷)8月25日,第33届中国电视金鹰奖提名名单公布。由青海省广播电视局联合...
哪款4/3卡口镜头划算 婚礼现... 当婚礼仪式在教堂穹顶下悄然开启,烛光摇曳间新人相视一笑的瞬间稍纵即逝;当户外草坪婚礼遭遇薄暮微光,快...
芜湖粟科商贸因违反广告法相关规... 8月26日,芜湖市弋江区市场监督管理局公开披露芜市监易处罚〔2026〕7-343号行政处罚决定书,对...
数码相机性能排行榜 学生党低门... 清晨六点的图书馆天台,阳光斜切过镜头光圈;傍晚操场边,用延时记录社团招新人流;期末小组作业需要一段质...