Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
RUSPAN 提出一种将评分标准视为语义标签表示的简答题自动评分(ASAS)框架,通过单次 LM 推理对评分等级进行列表式打分。该框架在涵盖英语、德语和葡萄牙语的六个 ASAS 基准上,其单基准评分性能优于判别式和生成式基线模型。
该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。
推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。
该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。
针对自动作文评分系统对高熟练度 ESL 学习者的过度惩罚问题,研究提出双向对齐策略 CL-MEP。该方法将评分偏差降低 39.9% 并提升整体准确率,成功区分有效句法复杂度与表层语法错误。
该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。
欧盟委员会教育总司发布 EU PISA 2025 首批结果事实清单,该文件汇总了欧洲教育政策简报中的关键洞察。
研究分析了150组学生与AI的对话,发现相似的评估成绩可能对应截然不同的认知参与模式。基于认知所有权框架,作业分数仅反映评估结果,无法还原学生与AI之间认知工作的具体分配。该研究为评估体系纳入认知过程证据提供了实证基础。
针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。
该研究采用混合方法评估 GenAI 零样本提示在中国 EFL 完形填空文本生成中的应用。研究聚焦于语言评估场景,旨在验证生成式 AI 在构建完形填空测试题时的可行性与效果。
devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。