跳到正文
今天10月8日周四3 条
  1. arXiv cs.CL42

    Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准

    研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。

  2. arXiv cs.CY77

    arXiv 研究:LLM 生成结构化评估在高等教育中的诊断质量分析

    该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。

    推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。

10月7日周三
  1. Frontiers in Education52

    基于 AI 分析与专家评估同步的编程知识多因子评估模型研究

    该研究针对生成式 AI 普及带来的编程评估挑战,提出包含功能正确性、解释质量和 AI 使用水平的多因子评估模型。研究涉及哈萨克斯坦三所大学 187 名本科生,对比了 GPT-5.2、Claude Opus 4.5 和 Gemini 3 在基线(仅功能正确性)和多因子条件下的评估结果。

  2. arXiv cs.CL40

    AI 赋能选择题质量保障:自动化缺陷检测与评估综述

    该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。

  3. GitHub · AI in 教育52

    Learning Commons 开源 Evaluators 工具集

    Learning Commons 开源了 Evaluators 工具集,旨在通过教育科学视角衡量 LLM 生成文本的属性。该工具包含文本复杂度、反馈质量、学术标准对齐和持久技能四个评估器家族,提供 Python 和 TypeScript SDK 以及本地运行环境,支持优化 AI 内容、监控模型表现及对比候选模型。

10月6日周二
10月5日周一
  1. Frontiers in Education42

    马来西亚高校教师视角下 AI 时代学生评估重构的质性研究

    针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。

10月2日周五
10月1日周四
  1. ISTE/ASCD12

    ISTE 探讨 AI 助力差异化教学

    差异化教学是否只有在拥有无限备课时间的情况下才可持续? 10 月 7 日美东时间下午 1 点,加入作者 Eric Carbaugh、Kristina Doubet 和 Jeannette Tejeda 的活动,了解 AI 如何帮助你构建灵活的评估、保持严谨性并节省时间。 注册:https://hubs.li/Q04yDfh_0

9月29日周二
  1. 科大讯飞智慧教育21

    讯飞育星图提供500+活动助力国庆主题育人实践

    讯飞育星图平台内置500+活动与多套权威评价指标体系,覆盖品德、学业、身心健康、艺术素养及劳动实践等核心维度。学校可一键引用主题实践活动,将五育实践融入假期,实现综合素质评价可记录、可呈现、可落地。平台提供《AI美育拼图》等趣味AI活动,学生提交成果即可自动纳入综合素质档案,降低学校策划与归档成本。

9月26日周六
  1. GitHub · AI in 教育26

    devissaputra/feedback_quality_evaluator:基于多维度的形成性反馈评估原型

    devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。

9月18日周五
  1. Shake Up Learning26

    Shake Up Learning 推出包含 400+ 提示词的教师 AI 提示词库

    Shake Up Learning 发布包含 400 多个可定制 AI 提示词的库,旨在帮助教师高效完成备课、差异化教学及家校沟通等任务。该资源库按实际教学任务分类,支持按学段筛选,并可直接在 ChatGPT、Gemini 或 Claude 中使用。此功能仅向 ALL ACCESS Teacher Membership 会员开放,同时提供自定步调的专业发展课程。

9月14日周一
  1. Khan Academy Blog42

    Khan Academy 阐述评估系统如何超越分数以真正提升学习

    Khan Academy 指出评估系统应回答学生现状、困难原因及后续行动,而非仅监测表现。其 AI 增强功能 Explain Your Thinking 通过对话揭示学生思维过程,区分概念误解与计算错误。评估结果直接驱动个性化学习路径,形成“评估-理解-学习-再评估”的闭环,促进真实成长。

9月9日周三
  1. GitHub AI 教育开源精选74

    Taiwan Exam 发布 AI 生成台湾学测模拟考工具

    Taiwan Exam 发布了一款利用 AI 生成台湾学测原创模拟考的工具,支持 Claude、ChatGPT 和 Gemini 等平台。该工具能自动完成命题、解题验算及套用大考正式版面,最终交付题目 PDF 和答案详解 PDF。

    推荐理由:提供了基于大模型的台湾学测模拟考生成工作流,包含多模型实测数据与详细部署指南,为教师利用 AI 辅助命题提供了可复用的参考。

8月28日周五
8月14日周五
  1. Grammarly Blog · 教育65

    Grammarly Authorship 正式接入 Blackboard

    Grammarly Authorship 现已支持 Blackboard 集成,允许教师在作业设置中强制要求学生提交写作来源报告。该功能自动识别文档中人工输入、AI 生成、复制或改写的内容,学生可通过分享链接将报告附加至 Blackboard 提交,教师则能在班级视图中查看整体情况并深入分析个别学生的写作过程。

    推荐理由:Grammarly Authorship 接入 Blackboard 后,教师可在作业中强制要求提交写作来源报告,为高校应对 AI 写作提供了可落地的透明化方案。

8月11日周二
  1. Leon Furze75

    澳大利亚 AI 监管与评估改革趋势分析:南澳成立皇家委员会与新州暂停无监督评估

    南澳州州长宣布成立澳大利亚首个 AI 皇家委员会,预计 2027 年 7 月 1 日前提交报告,预算约 300 万澳元。与此同时,新南威尔士州副州长致函 NESA,建议暂停高中 12 年级无监督的带回家评估任务,并要求在 2026 年第四学期前提供建议。作者分析指出,这两项举措反映了澳大利亚在 AI 监管上的不同策略:南澳采取先调查后行动,而新州则倾向于立即采取临时措施以保护学生利益。

    推荐理由:文章对比了南澳州成立皇家委员会与新南威尔士州暂停无监督评估的不同路径,揭示了监管节奏与教育评估体系之间的深层张力。

2月4日周三
  1. Nearpod Blog42

    Nearpod AI Create 工具如何帮助教师编写有效 AI 提示词

    Nearpod 推出 AI Create 工具,专为教师生成符合课程标准的 10 道多项选择题。该工具仅对学校和学区账户开放,且承诺不利用学生数据进行训练。教师可通过将学习目标转化为提示词(如“Create questions about...”)来快速创建评估内容,从而节省备课时间并提升教学针对性。

11月5日周三