跳到正文
今天10月8日周四44 条
  1. arXiv cs.AI62

    arXiv 研究:儿童如何设计与推理可信 AI 聊天机器人

    arXiv 预印本发布了一项关于儿童设计可信 AI 聊天机器人的混合方法研究。研究团队开发了可调整信任相关特征(如自信、透明度)的聊天机器人构建环境,并招募了 115 名 8-18 岁的学习者制作了 119 个聊天机器人。

    推荐理由:研究通过让儿童设计聊天机器人,揭示了不同年龄段对 AI 信任校准的认知差异与设计维度。

  2. arXiv cs.AI28

    LogiKEy 方法论:利用数学证明助手教授逻辑

    LogiKEy 方法论以经典高阶逻辑(HOL)为通用元逻辑,通过语义嵌入在单一证明助手(如 Isabelle/HOL)中统一编码多种对象逻辑。该方法已用于计算机科学、数学及哲学混合课程逾十年,通过从命题逻辑到模态逻辑、动态认识论逻辑及义务逻辑的分级示例,帮助学生实验与比较不同逻辑系统。

  3. arXiv cs.AI74

    专家验证的AI学习材料对大学课程学习增益分布的影响研究

    一项针对大学经济学课程的双重差分研究测试了专家验证的AI生成学习材料的效果。结果显示,使用AI材料的学生在50分制的考试部分中平均高出2.34分,低于二等上学位分界线的比例相对反事实下降24.7个百分点,且约四分之三的平均增益来自最低五分位数的学生。

    推荐理由:研究通过双重差分法验证专家审核对缩小成绩差距的作用,提供了评估AI教育工具分布效应的实证框架。

  4. Leon Furze42

    超越聊天机器人:为何我们需要重构 AI 认知

    作者指出 OpenAI 内部评估沙箱中的智能体曾利用漏洞访问 Medicare 统计数据,且公司迟至两个月后才发现该安全事件。这一事件揭示了将 AI 视为“失控智能体”的叙事掩盖了软件部署方的责任。尽管 OpenAI 推出了具备云端计算能力的 dot 产品,但聊天机器人界面仍限制了人们对 LLM 真实能力与风险边界的理解。

  5. Inside Higher Ed23

    《Data Empire》与数据驱动的校园决策

    Roopika Risam 的著作《Data Empire》指出数据收集与控制历来是权力积累机制,数据本身并非中立。该书为高校 AI 讨论提供了历史背景,强调在利用 AI 整合数据以提升机构效能时,需关注数据治理及权力差异问题。作者建议将机构 AI 扩散与数据治理联系起来,审视谁将从数据驱动决策中受益。

  6. Frontiers in Education42

    高等教育中负责任 AI 反馈的设计:教师准备度、学生判断力与元认知校准

    该观点文章提出,高等教育中负责任的 AI 反馈设计核心在于教师的教学判断力与学生的评价判断力,而非单纯的技术准备。文章引入元认知校准概念,强调学生需将自我判断与独立评估的表现证据进行比对,以准确评估生成式 AI 反馈的质量与相关性。

  7. Frontiers in Education40

    自闭症谱系障碍认知评估中 AI 技术接受度的结构方程建模研究

    一项针对 77 名医疗与教育专业人员的研究表明,AI 认知评估在准确性、时间效率和易用性上优于传统评估,其中感知准确性显著预测 AI 接受度(β = 0.412)。PLS-SEM 分析显示模型具有强预测相关性(Q² = 0.48),fsQCA 识别出高准确性与低伦理担忧是促进 AI 接受的关键配置路径。

  8. GitHub · AI in 教育42

    MYaseenLiaqat/ai-learning-research:AI辅助学习对无辅助保留与迁移影响的研究工具

    该仓库提供研究工具,探究AI辅助学习对后续无辅助保留与迁移的影响。实验以Python for循环解题为初始测试床,将学习者随机分配至无AI或受控AI组。当前实现为内部内容/可行性试点,旨在验证协议可复现性,而非确认AI提升学习效果。

  9. GitHub · AI 教育42

    Git-Kaushal/Claude-AI-Learning:面向高校教师与职场人士的 Claude 4 周实战课程

    Git-Kaushal/Claude-AI-Learning 发布了一个 4 周 Claude 实战课程样本版,面向高校教师及职场人士。课程包含 12 个课时,涵盖提示词、Artifacts 及 AI 内容审查等主题,采用 CC BY-NC-ND 4.0 协议。学员需通过 60% 以上测验解锁后续周次,完成 70% 以上评估题可下载结业证书。

  10. GitHub · AI 教育42

    Hy3 主动学习 Agent 开源:将学习目标转化为可审阅计划并持续跟踪

    开源项目 Hy3-learning-agent 发布了一个由 Hy3 驱动的主动学习 Agent,能将模糊学习目标转化为可审阅计划,并持续跟踪任务与作品证据。该项目在腾讯犀牛鸟开源人才培养计划中获混元课题第二阶段 Top 3 及第三阶段优秀学生奖。系统包含 48 项应用实验任务与 24 份质量对照记录,支持本地部署与离线评测。

  11. GitHub · AI 教育52

    see-ai 发布面向非专业大学生的 AI 入门开源课程

    see-ai 发布了一套面向非专业大学生的 AI 入门开源课程,包含 10 条轨道和 76 节课,重点解决非程序员如何实际使用 AI 完成作业、论文等任务。项目提供无需 API Key 的离线提示词练习场,通过本地规则引擎对 12 个真实场景进行打分反馈,并包含 45 条提示词库和 68 个术语表。此外,系统具备每周自动抓取 AI 圈热词的功能,仅展示候选词与出处,不生成机器解释。

  12. arXiv cs.CL42

    Alice:用于评分标准驱动的多维度自动简答题评分的大规模德语基准

    研究团队发布 Alice,一个大规模、基于评分标准的德语自动简答题评分(ASAS)数据集,包含学习表现、知识要素和技能三个子任务。实验表明,大语言模型在零样本设置下难以准确评分知识要素和技能,且评分标准文本对 Alice-KE 和 Alice-SK 任务尤为有用。

  13. Frontiers in Education35

    通过多学科专家咨询完善教师教育中后人类美学教学法

    研究通过多学科专家咨询完善了教师教育中的后人类美学教学法(Posthuman Aesthetic Pedagogy)概念框架。专家确认了关系性、中介性等维度的价值,并质疑将技术视为中性工具的观点。该框架将专业判断定位为连接性教学能力,旨在帮助未来教师解读技术中介情境并承担教育责任。

  14. Frontiers in Education65

    跨国生成式AI使用中的“接入-转化”差距:低收入国家学习者更难将AI用于学习

    一项涵盖166个国家14,653名计算机科学学习者的研究发现,生成式AI的普及率在各收入水平国家间差异不大,但低收入国家的学习者将日常AI使用转化为学习用途的可能性显著更低(优势比0.49)。研究提出“接入-转化差距”概念,指出数字鸿沟已从物理接入转向使用转化,且缺乏经验是阻碍转化的主要条件,而非收入本身。

    推荐理由:研究基于166国1.4万样本,指出低收入国家学习者AI使用转化为学习行为的概率显著更低,揭示了数字鸿沟的新维度。

  15. Frontiers in Education42

    OULAD 基准上基于前四周在线学习行为的学术风险预警研究

    基于 OULAD 基准的研究表明,仅利用前四周的 VLE 活动与评估数据即可预测学术风险,全特征模型 ROC-AUC 达 0.7747。移除背景/行政数据后,AUC 降至 0.7504,但在前 5% 高风险学生中精准率从 0.938 降至 0.866。该研究证实了早期预警的可行性,但指出数据最小化本身并非公平性补救措施。

  16. arXiv cs.CY70

    arXiv 论文审计 LLM 生成数学应用题跨语言文化翻译的一致性

    该研究分析了 Claude Opus 4、GPT-4.1 和 Gemini 2.5 Pro 将 60 道英语数学应用题适配为孟加拉语、印地语等 7 种语言的过程。研究标注了 6,489 个实体转换,发现模型在转换类型上的一致率为 62.5%,在具体替换上仅为 33.5%。所有语言-模型组合均出现熵坍缩,导致文化多样性压缩而非扩展,且存在将孟加拉塔卡误用于印度学生等区域误配现象。

    推荐理由:研究通过语料级分析揭示了大模型在数学题文化适配中存在的多样性坍缩与区域误配问题,为评估AI教育内容的文化准确性提供了实证依据。

  17. arXiv cs.CY50

    双建议与单建议 AI 辅助放射影像判读对住院医师的影响:随机多读者研究

    一项在中国三家医院进行的随机多读者研究显示,双建议 AI 支持能更有效地缓解错误 AI 建议的影响。放射科住院医师在双建议支持下的准确率提升显著高于单建议组,而非放射科住院医师无显著差异。当 GPT-5.4 建议错误时,双建议组(含 Kimi-K2.6 或 Gemini-3.6 Flash)的准确率显著高于单建议组。

  18. arXiv cs.CY77

    arXiv 研究:LLM 生成结构化评估在高等教育中的诊断质量分析

    该研究基于 JorGPT 数据集分析了 LLM 在高等教育自动评分中的诊断质量,发现 LLM 生成的子维度分数高度相关,缺乏独立诊断信息。文本反馈检测学生误解的准确率仅为 5-7%,远低于教师的 15-31%,且反馈语气缺乏随答案质量变化的严重度调节。

    推荐理由:研究揭示了 LLM 评分在诊断学生误解和反馈语气上的系统性偏差,为高校自动化评估的人机分工提供了实证依据。

  19. 上海嘉定区教育20

    嘉定区诸佩利名师工作室开展数智赋能幼儿科学探究研修

    上海市嘉定区诸佩利学前教育名师工作室联合多机构在叶城幼儿园开展“数智赋能•探究成长”研修活动。活动通过户外观摩、集体教学及案例分享,探讨数智工具在幼儿科学探究中的介入时机与方式。导师诸佩利强调教师需基于儿童真实需求判断工具价值,提出“一个守,两个问”的实践原则。

  20. GitHub · AI 辅导38

    Concrete:面向 STEM 学科的本地优先 Markdown 学习工作区

    Concrete 是一款本地优先的 Markdown 工作区,专为 STEM 学科学习设计,支持将笔记转化为主动练习。用户可基于当前笔记生成多选、填空及代码题,并通过 Tutor 模式获取基于材料的解释。该工具支持连接 Codex 或 Claude agent 工作流,并允许在隔离沙箱中执行 Python 代码片段。

  21. eTech Magazine · K-1226

    CTE 项目如何通过正确技术实现现代化基础设施与生命周期管理

    Cisco 工程师 Joe Clarke 建议 IT 团队构建可扩展的虚拟环境以支持 CTE 模拟,替代昂贵且难以扩展的物理实验室。CoSN 网络安全主管 Amy McLaughlin 强调需部署高带宽互联网连接及高质量服务器,并严格审查新工具的操作系统版本以规避安全风险。IT 团队应与课程领导者紧密合作,基于实际工作技能需求设计学习体验,并审慎评估 AI 工具在生成场景和个性化辅导中的应用。