跳到正文
今天10月8日周四12 条
  1. arXiv cs.AI62

    arXiv 研究:儿童如何设计与推理可信 AI 聊天机器人

    arXiv 预印本发布了一项关于儿童设计可信 AI 聊天机器人的混合方法研究。研究团队开发了可调整信任相关特征(如自信、透明度)的聊天机器人构建环境,并招募了 115 名 8-18 岁的学习者制作了 119 个聊天机器人。

    推荐理由:研究通过让儿童设计聊天机器人,揭示了不同年龄段对 AI 信任校准的认知差异与设计维度。

  2. arXiv cs.AI28

    LogiKEy 方法论:利用数学证明助手教授逻辑

    LogiKEy 方法论以经典高阶逻辑(HOL)为通用元逻辑,通过语义嵌入在单一证明助手(如 Isabelle/HOL)中统一编码多种对象逻辑。该方法已用于计算机科学、数学及哲学混合课程逾十年,通过从命题逻辑到模态逻辑、动态认识论逻辑及义务逻辑的分级示例,帮助学生实验与比较不同逻辑系统。

  3. arXiv cs.AI74

    专家验证的AI学习材料对大学课程学习增益分布的影响研究

    一项针对大学经济学课程的双重差分研究测试了专家验证的AI生成学习材料的效果。结果显示,使用AI材料的学生在50分制的考试部分中平均高出2.34分,低于二等上学位分界线的比例相对反事实下降24.7个百分点,且约四分之三的平均增益来自最低五分位数的学生。

    推荐理由:研究通过双重差分法验证专家审核对缩小成绩差距的作用,提供了评估AI教育工具分布效应的实证框架。

  4. arXiv cs.CL42

    Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准

    研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。

  5. arXiv cs.CY70

    arXiv 论文审计 LLM 生成数学应用题跨语言文化翻译的一致性

    该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。

    推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。

  6. arXiv cs.CY50

    双建议与单建议 AI 辅助放射影像判读对住院医师的影响:随机多读者研究

    一项在中国三家医院进行的随机多读者研究显示,双建议 AI 支持能更有效地缓解错误 AI 建议的影响。放射科住院医师在双建议支持下的准确率提升显著高于单建议组,而非放射科住院医师无显著差异。当 GPT-5.4 建议错误时,双建议组(含 Kimi-K2.6 或 Gemini-3.6 Flash)的准确率显著高于单建议组。

  7. arXiv cs.CY77

    arXiv 研究:LLM 生成结构化评估在高等教育中的诊断质量分析

    该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。

    推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。

10月7日周三
  1. arXiv cs.CY68

    arXiv 研究:AI 数学学习中求助策略变化预测无辅助表现

    一项针对 112 名九年级学生的实证研究发现,在基于生成式 AI 的数学建模练习中,学生求助策略(Help-Seeking)在会话内的动态发展比静态使用摘要更能预测其后续的无辅助测试表现。

    推荐理由:研究揭示了九年级学生在数学建模中求助策略的动态变化如何预测其脱离AI后的独立表现,为理解AI辅助学习中的认知投入提供了实证依据。

  2. arXiv cs.CY62

    arXiv 研究:活动形式、交互模态与语言如何影响学生与 AI 对话的学习效果

    一项针对印度卡纳塔克邦 305 名本科生的实地研究比较了书面回答与基于文本或语音的 AI 对话活动。结果显示,完成对话式活动的学生花费时间更长、参与度更高且自我效能感更强,但整体完成率较低。所有条件下的知识增益无显著差异,但双语语音交互显著减少了表达困难并降低了对话放弃率。

    推荐理由:研究对比了书面与对话式 AI 学习活动的效果,揭示了双语语音交互在降低表达困难方面的具体优势。

  3. arXiv cs.CY42

    面向未来工程师的 LLM 可扩展工作坊

    一项面向工程硕士的可扩展游戏化工作坊,让 226 名学生在 10 次课程中通过移动 Web 界面为非推理和推理 LLM 编写提示词,解决网格导航任务。系统提供机器人可执行计划、轨迹可视化及自动评分,并在 Boston Dynamics Spot 机器人上进行现场演示。问卷显示 81.5% 的学生报告有显著学习收获,91.0% 报告高参与度。

  4. arXiv cs.CY55

    arXiv 论文:缓解纽约高中录取匹配中的不平等:不引发拥堵的个性化推荐

    该研究针对纽约高中录取匹配中的推荐拥堵问题,提出了一种拥堵感知的双层优化与模拟方法。在 2025-26 录取周期的随机对照试验中,实验组申请人将推荐项目列入志愿的比例为 16.4%,对照组为 10.5%(相对增加 57%);实验组匹配到此类项目的比例为 5.6%,对照组为 3.3%(相对增加 71%),且无实验组申请人被推荐项目拒绝。

  5. arXiv cs.CL70

    Sherpa:通过多轮强化学习训练LLM自适应教学

    研究提出Sherpa框架,利用多轮强化学习训练LLM教师,使其能根据模拟学生的不同学习偏好自适应调整教学策略。实验显示,Sherpa训练的教师模型使所有类型模拟学生的平均成绩提升20.5个百分点,在MathTutorBench评估中教学法得分从52.5%提升至79.2%,且在人类偏好测试中79.6%的情况下优于基础模型。

    推荐理由:提出Sherpa框架,通过多轮强化学习让LLM教师适应不同学习偏好的模拟学生,显著提升教学效果。

  6. arXiv cs.CL40

    FACTRIA:利用生成式 AI 支持高等教育机构分析中的偏见解读

    研究团队提出 FACTRIA 框架,将机构分析中的潜在偏见因素划分为分析管道、机构背景、课程特征和人口统计四个领域。该框架作为生成式 AI 聊天机器人的输入,引导用户在分析高等教育机构数据时反思被忽视的因素。定性研究表明,结合结构化框架与 AI 指导能增强对机构数据的负责任解读。

  7. arXiv cs.CL42

    有界评分量表上的双重差分法可能制造虚假效应:基于预注册 LLM 评审审计的证据

    研究证明,在评分有界时,双重差分法可能因量表边界衰减不均而制造虚假交互效应。一项包含 990 次调用的预注册 LLM 评审审计中,唯一显著次要交互(productive struggle,+0.378 分,p=0.002)被证实可由量表下限和严重度偏移复现 79% 至 85%。这表明观测到的交互效应无法识别潜在量表上的差异化偏好。

  8. arXiv cs.CL42

    教育方面级情感分析受控合成基准

    研究提出包含 10,000 条合成课程评论的教育方面级情感分析(ABSA)受控合成基准,涵盖 20 个教学方面。在基准测试中,BERT 模型达到 0.2930 的 micro-F1,gpt-5.2 零样本推理为 0.2519。外部评估显示 BERT 在真实数据上取得 0.4593 的 micro-F1,验证了部分合成到真实的迁移能力。

  9. arXiv cs.CL78

    K12-KGraph:面向教育大模型评测与训练的课标对齐知识图谱

    研究团队提出 K12-KGraph,一个从人教版数学、物理、化学、生物教材中提取的课程对齐知识图谱,涵盖 9 种节点和 14 种关系。基于该图谱构建了包含 23,640 道多选题的 K12-Bench 基准和 7,335 个样本的 K12-Train 微调数据集。

    推荐理由:该研究构建了基于人教版教材的知识图谱与评测基准,揭示了当前大模型在课程认知上的短板及微调改进路径。

  10. arXiv cs.CL55

    arXiv 论文:通过多轮强化学习解决 LLM 教学中的协助困境

    研究提出 Eduardo 多轮强化学习训练方案,引入掩码近迁移后测以抑制 LLM 导师直接告知答案的行为。Eduardo-27B 模型在 MathTutorBench 和 TutorMoments 上分别匹敌 Gemini-3.1-Pro 和 Claude Opus 4.8,且思考 token 消耗减少 2.4-6.2 倍。研究开源了训练环境、8671 题近迁移数据集及训练好的模型。

  11. arXiv cs.CL40

    AI 赋能选择题质量保障:自动化缺陷检测与评估综述

    该研究对自动化选择题缺陷检测、修订及心理测量筛查进行了叙述性综述,基于 14 份研究报告构建了 19 项标准评估框架。研究发现高标签准确率常伴随弱阳性案例检测,且现有修订证据混杂,无法确立修复效果。作者建议将质量保障视为独立验证决策序列,采用基于结果的评估方法。

10月5日周一
  1. arXiv cs.CY28

    LearnAdapt Praxis:面向成人职场学习的受控 AI 辅助与证据追踪系统

    LearnAdapt Praxis 提出包含 Frame 至 Transfer 五阶段的学习工作区,通过项目级服务器控制限制辅助访问并存储版本化规范与验证观察。可复现的合成演练执行了 120 个串行项目集,3,990 项检查均符合预期,60 次注入故障未产生伪造提示。该报告验证了系统架构的工程属性,但未确立学习增益或模型输出质量。