Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。
RUSPAN 提出一种将评分标准视为语义标签表示的简答题自动评分(ASAS)框架,通过单次 LM 推理对评分等级进行列表式打分。该框架在涵盖英语、德语和葡萄牙语的六个 ASAS 基准上,其单基准评分性能优于判别式和生成式基线模型。
该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。
推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。
该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。
Acadex-AI-Google-Deepmind 是一款开源教育 AI 助手,旨在通过生成式 AI 减少教师行政事务时间。该应用支持 Windows、macOS 和 Linux 系统,具备自动评分、自适应学习和云存储功能。软件基于 MIT 许可证发布,用户可自由使用、修改和分发。
IRT_Item-Response-Theory 是一个帮助理解项目反应理论(IRT)及自适应测试的应用程序。该工具面向 AI 工程师和数据科学家,提供 2PL 和 3PL 等 IRT 模型的可视化与实现。软件支持 Windows、macOS 和 Linux 系统,要求 Python 3.6 或更高版本。
针对自动作文评分系统对高熟练度 ESL 学习者的过度惩罚问题,研究提出双向对齐策略 CL-MEP。该方法将评分偏差降低 39.9% 并提升整体准确率,成功区分有效句法复杂度与表层语法错误。
该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。
Learning Commons 开源了 Evaluators 工具集,旨在通过教育科学视角衡量 LLM 生成文本的属性。该工具包含文本复杂度、反馈质量、学术标准对齐和持久技能四个评估器家族,提供 Python 和 TypeScript SDK 以及本地运行环境,支持优化 AI 内容、监控模型表现及对比候选模型。
VeriChalk 是一款面向小学数学教师的可验证命题 Agent,支持通过一句话或拍照生成经核验、不超纲的题目或整份试卷,并可导出 PDF 等格式。在 36 个出题用例评测中,其答案正确率为 0.945,超纲率为 0.048,但尚未达到公开发布的质量门槛。
随着 AI 在教育科技领域普及,学区需要可靠的方式来评估其购买的产品。 EdReports CEO Dr. Lewis Ferebee 在 This Week with EdSurge 中讨论了这一点。 🎧 收听:https://www.edsurge.com/news/can-schools-trust-ai-features-in-edtech-products
欧盟委员会教育总司发布 EU PISA 2025 首批结果事实清单,该文件汇总了欧洲教育政策简报中的关键洞察。
研究分析了150组学生与AI的对话,发现相似的评估成绩可能对应截然不同的认知参与模式。基于认知所有权框架,作业分数仅反映评估结果,无法还原学生与AI之间认知工作的具体分配。该研究为评估体系纳入认知过程证据提供了实证基础。
针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。
该研究采用混合方法评估 GenAI 零样本提示在中国 EFL 完形填空文本生成中的应用。研究聚焦于语言评估场景,旨在验证生成式 AI 在构建完形填空测试题时的可行性与效果。
差异化教学是否只有在拥有无限备课时间的情况下才可持续? 10 月 7 日美东时间下午 1 点,加入作者 Eric Carbaugh、Kristina Doubet 和 Jeannette Tejeda 的活动,了解 AI 如何帮助你构建灵活的评估、保持严谨性并节省时间。 注册:https://hubs.li/Q04yDfh_0
讯飞育星图平台内置500+活动与多套权威评价指标体系,覆盖品德、学业、身心健康、艺术素养及劳动实践等核心维度。学校可一键引用主题实践活动,将五育实践融入假期,实现综合素质评价可记录、可呈现、可落地。平台提供《AI美育拼图》等趣味AI活动,学生提交成果即可自动纳入综合素质档案,降低学校策划与归档成本。
devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。
Shake Up Learning 发布包含 400 多个可定制 AI 提示词的库,旨在帮助教师高效完成备课、差异化教学及家校沟通等任务。该资源库按实际教学任务分类,支持按学段筛选,并可直接在 ChatGPT、Gemini 或 Claude 中使用。此功能仅向 ALL ACCESS Teacher Membership 会员开放,同时提供自定步调的专业发展课程。
Khan Academy 指出评估系统应回答学生现状、困难原因及后续行动,而非仅监测表现。其 AI 增强功能 Explain Your Thinking 通过对话揭示学生思维过程,区分概念误解与计算错误。评估结果直接驱动个性化学习路径,形成“评估-理解-学习-再评估”的闭环,促进真实成长。
Taiwan Exam 发布了一款利用 AI 生成台湾学测原创模拟考的工具,支持 Claude、ChatGPT 和 Gemini 等平台。该工具能自动完成命题、解题验算及套用大考正式版面,最终交付题目 PDF 和答案详解 PDF。
推荐理由:提供了基于大模型的台湾学测模拟考生成工作流,包含多模型实测数据与详细部署指南,为教师利用 AI 辅助命题提供了可复用的参考。
希沃录播通过 AI 教评、智能巡课及无感考勤等能力,构建高校教学质量数据闭环。其 AI 教评报告涵盖 42 类指标与 100+ 观测点,支持多角色评价与四级报告生成。该方案已在山东政法学院、温州大学等多所高校落地,助力实现教学管理的科学化与精细化。
Grammarly Authorship 现已支持 Blackboard 集成,允许教师在作业设置中强制要求学生提交写作来源报告。该功能自动识别文档中人工输入、AI 生成、复制或改写的内容,学生可通过分享链接将报告附加至 Blackboard 提交,教师则能在班级视图中查看整体情况并深入分析个别学生的写作过程。
推荐理由:Grammarly Authorship 接入 Blackboard 后,教师可在作业中强制要求提交写作来源报告,为高校应对 AI 写作提供了可落地的透明化方案。
南澳州州长宣布成立澳大利亚首个 AI 皇家委员会,预计 2027 年 7 月 1 日前提交报告,预算约 300 万澳元。与此同时,新南威尔士州副州长致函 NESA,建议暂停高中 12 年级无监督的带回家评估任务,并要求在 2026 年第四学期前提供建议。作者分析指出,这两项举措反映了澳大利亚在 AI 监管上的不同策略:南澳采取先调查后行动,而新州则倾向于立即采取临时措施以保护学生利益。
推荐理由:文章对比了南澳州成立皇家委员会与新南威尔士州暂停无监督评估的不同路径,揭示了监管节奏与教育评估体系之间的深层张力。
Nearpod 推出 AI Create 工具,专为教师生成符合课程标准的 10 道多项选择题。该工具仅对学校和学区账户开放,且承诺不利用学生数据进行训练。教师可通过将学习目标转化为提示词(如“Create questions about...”)来快速创建评估内容,从而节省备课时间并提升教学针对性。
哈佛教育测量学者 Andrew Dean Ho 指出,NAEP 亟需改进,AI 技术可助力其升级。他强调在引入 AI 时必须保护趋势数据(Protect Trend)的完整性。