arXiv cs.CY· Xi Zhao, Xinyue Jiao, Zhen Xu·· 10 小时前精选AI 评分77
arXiv 研究:LLM 生成结构化评估在高等教育中的诊断质量分析
Beyond Score Accuracy: Examining the Diagnostic Quality of LLM-Generated Structured Assessment in Higher Education
AI 导读
该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。
推荐理由
研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。
来源:arXiv cs.CY · arxiv.org