arXiv cs.CL· Zhifan Sun, Sebastian Gombert, Jannik Lossjew, Tobias Wyrwich, Berrit Katharina Czinczel, David Bednorz, Marcus Kubsch, Knut Neumann, Hendrik Drachsler·· 11 小时前AI 评分42
Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准
Alice: A Large-Scale German Benchmark for Rubric-Based Multi-Dimensional Automatic Short Answer Scoring
AI 导读
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
来源:arXiv cs.CL · arxiv.org