arXiv 研究:儿童如何设计与推理可信 AI 聊天机器人
arXiv 预印本发布了一项关于儿童设计可信 AI 聊天机器人的混合方法研究。研究团队开发了可调整信任相关特征(如自信、透明度)的聊天机器人构建环境,并招募了 115 名 8-18 岁的学习者制作了 119 个聊天机器人。
推荐理由:研究通过让儿童设计聊天机器人,揭示了不同年龄段对 AI 信任校准的认知差异与设计维度。
arXiv 预印本发布了一项关于儿童设计可信 AI 聊天机器人的混合方法研究。研究团队开发了可调整信任相关特征(如自信、透明度)的聊天机器人构建环境,并招募了 115 名 8-18 岁的学习者制作了 119 个聊天机器人。
推荐理由:研究通过让儿童设计聊天机器人,揭示了不同年龄段对 AI 信任校准的认知差异与设计维度。
该研究系统回顾了 100 项涉及青少年与 AI 交互的实证 HCI 研究,利用 YAIR 和 MIT 分类法映射风险与对策。结果显示,大多数风险仅匹配了提议中的对策,实际实施和评估的对策极少,且现有评估多侧重技术性能而非实际保护效果。
该观点文章提出,高等教育中负责任的 AI 反馈设计核心在于教师的教学判断力与学生的评价判断力,而非单纯的技术准备。文章引入元认知校准概念,强调学生需将自我判断与独立评估的表现证据进行比对,以准确评估生成式 AI 反馈的质量与相关性。
一项针对 77 名医疗与教育专业人员的研究表明,AI 认知评估在准确性、时间效率和易用性上优于传统评估,其中感知准确性显著预测 AI 接受度(β = 0.412)。PLS-SEM 分析显示模型具有强预测相关性(Q² = 0.48),fsQCA 识别出高准确性与低伦理担忧是促进 AI 接受的关键配置路径。
该仓库提供研究工具,探究AI辅助学习对后续无辅助保留与迁移的影响。实验以Python for循环解题为初始测试床,将学习者随机分配至无AI或受控AI组。当前实现为内部内容/可行性试点,旨在验证协议可复现性,而非确认AI提升学习效果。
研究通过多学科专家咨询完善了教师教育中的后人类美学教学法(Posthuman Aesthetic Pedagogy)概念框架。专家确认了关系性、中介性等维度的价值,并质疑将技术视为中性工具的观点。该框架将专业判断定位为连接性教学能力,旨在帮助未来教师解读技术中介情境并承担教育责任。
基于新疆五所高校 306 名学生的调查,GenAI 素养显著提升中国大学生的在线学习韧性,且自我效能感在其中起部分中介作用。GenAI 素养的认知意识、使用能力、评估能力和伦理意识四个维度均通过增强自我效能感来促进在线学习韧性。
一项涵盖166个国家14,653名计算机科学学习者的研究发现,生成式AI的普及率在各收入水平国家间差异不大,但低收入国家的学习者将日常AI使用转化为学习用途的可能性显著更低(优势比0.49)。研究提出“接入-转化差距”概念,指出数字鸿沟已从物理接入转向使用转化,且缺乏经验是阻碍转化的主要条件,而非收入本身。
推荐理由:研究基于166国1.4万样本,指出低收入国家学习者AI使用转化为学习行为的概率显著更低,揭示了数字鸿沟的新维度。
该研究调查了 Sultan Qaboos University 信息研究系将 ChatGPT 作为 AI 评估工具的应用现状。分析显示,67% 的课程未检测到 AI 评估方法,20% 具有中等整合度,13% 直接指导使用 AI。研究据此提出了高等教育机构整合生成式 AI 的治理政策与战略指南。
一项针对智利南部大学 22 名预备历史教师的定性研究分析了他们应对针对 Mapuche 人网络仇恨言论的教学策略。结果显示,参与者主要识别仇恨言论的描述性成分,但较少涉及结构性种族主义或殖民性框架,且数字公民观偏向技术工具主义。此外,6 份回应中提及生成式人工智能的使用,为教师培训中的 AI 应用提供了假设性发现。
文章提出“基于艺术的多教学法和平教育框架”,旨在 Education 6.0 时代整合 pedagogy、heutagogy、peeragogy 和 cybergogy 四种学习导向。该框架将和平意义建构置于核心,通过艺术、对话和数字实践,帮助学生在反思与协作中发展和平素养、同理心及数字公民意识。
一项针对 19 名特殊教育硕士研究生的混合方法研究显示,参与者对生成式 AI 的认知从行政效率工具转向适应性教学支架。研究强调在特殊教育环境中实施 AI 需重视人类监督、FERPA 合规及数据隐私。有意识的 AI 素养培养有助于未来特殊教育教师超越基础技术熟练度,具备负责任评估与实施生成式 AI 的批判性判断力。
一项针对印度卡纳塔克邦 305 名本科生的实地研究比较了书面回答与基于文本或语音的 AI 对话活动。结果显示,完成对话式活动的学生花费时间更长、参与度更高且自我效能感更强,但整体完成率较低。所有条件下的知识增益无显著差异,但双语语音交互显著减少了表达困难并降低了对话放弃率。
推荐理由:研究对比了书面与对话式 AI 学习活动的效果,揭示了双语语音交互在降低表达困难方面的具体优势。
该研究提出连接算法文化边缘化、文化扎根与 AI 中介文化再中心化的概念框架,以台湾客家语为案例。文章提出八项命题,主张评估 AI 普及时需兼顾语言多样性保留与社区权威,区分技术可用性与社会使用。
研究团队提出 FACTRIA 框架,将机构分析中的潜在偏见因素划分为分析管道、机构背景、课程特征和人口统计四个领域。该框架作为生成式 AI 聊天机器人的输入,引导用户在分析高等教育机构数据时反思被忽视的因素。定性研究表明,结合结构化框架与 AI 指导能增强对机构数据的负责任解读。
研究证明,在评分有界时,双重差分法可能因量表边界衰减不均而制造虚假交互效应。一项包含 990 次调用的预注册 LLM 评审审计中,唯一显著次要交互(productive struggle,+0.378 分,p=0.002)被证实可由量表下限和严重度偏移复现 79% 至 85%。这表明观测到的交互效应无法识别潜在量表上的差异化偏好。
研究提出 CLARA 框架及包含 1107 个中英双语儿童故事的基准资源,用于评估 AI 对儿童故事发育适宜性的判断能力。实验表明,基于认知、语言和社会情感维度的结构化标注方法,在匹配人类专家判断方面显著优于基于可读性的方法和直接提示基线。
melanie-ldi/genai-irr-calculator 是一个基于浏览器的评分者间信度(IRR)计算器,专为 GenAI 证据库系统文献综述设计。该工具以单文件 HTML 形式运行,无需安装,所有计算均在客户端完成。它支持上传 .csv、.xlsx 等编码表,自动检测版本并计算 Krippendorff's α,结果可导出为 CSV 或 Excel。
该研究探索了小学课堂中学生的 AI 素养,重点分析学生对生成式 AI、公平性及伦理使用的看法。
基于 2023 年后 32 项同行评审研究的迷你综述指出,教师沟通行为仍显著预测学生结果,元分析显示中到大效应量(r = 0.443)。学生使用人类沟通类别评估 AI 智能体,但在善意维度存在系统性差距,需通过即时性和礼貌线索弥补。当 AI 替代人际互动时,会引发孤独感和归属感下降等负面结果。
该迷你综述基于建构主义学习理论,将人工智能定位为麻醉教育中需随学习者表现调整并逐步撤除的临时支架,而非自主教师。现有麻醉特异性研究在区域麻醉训练、超声解读及虚拟患者等场景展示了可行性,但尚未证实能提升临床推理或胜任力。AI生成的反馈与评分应视为有缺陷的决策支持,不得独立用于总结性评估或授权。
荷兰 Fontys 和丹麦 IT University Copenhagen 的研究表明,手动数据标注任务能有效提升学生对标注主观性的理解。43 名参与者在标注皮肤病变图像后,对偏见和公平性的理解优于传统讲座。尽管存在情感不适,该活动仍被证实能帮助学生认识到人类判断对模型行为的影响。
LearnAdapt Praxis 提出包含 Frame 至 Transfer 五阶段的学习工作区,通过项目级服务器控制限制辅助访问并存储版本化规范与验证观察。可复现的合成演练执行了 120 个串行项目集,3,990 项检查均符合预期,60 次注入故障未产生伪造提示。该报告验证了系统架构的工程属性,但未确立学习增益或模型输出质量。
研究分析了150组学生与AI的对话,发现相似的评估成绩可能对应截然不同的认知参与模式。基于认知所有权框架,作业分数仅反映评估结果,无法还原学生与AI之间认知工作的具体分配。该研究为评估体系纳入认知过程证据提供了实证基础。
一项针对 69 名本科生的混合方法研究显示,100% 的学生使用 AI 工具,86.9% 认为 AI 提升了创造力与学习独立性。研究提出 AI-Empowered STEAM Climate Action Model (AISC-AM) 框架,通过“AI-in-the-Loop”验证结构解决准确性与抄袭担忧,连接学生研究与区域气候政策。
一项针对 45 名摩洛哥英语作为外语(EFL)职前教师的准实验研究显示,接受 UDL 结合 AI 工具培训组的课后教案评分显著高于对照组及仅接受 UDL 培训组。该研究指出,AI 工具有助于教师设计更具包容性的教学,但现有证据无法单独隔离 AI 的贡献,且结果受限于单一机构及评分标准。
一项涵盖2009至2023年间17项研究的系统文献综述表明,元认知是连接教师专业数字能力与自我调节学习的关键机制。个性化学习环境及元认知支架等技术支持系统有助于教师以自我调节方式发展数字能力。研究强调,自我调节学习需辅以协作学习和以学习者为中心的创新课堂形式,如启发式教学法,以提升教师教育效果。
一项针对拉脱维亚教育专业人员的定性研究揭示了“数字可持续性”的认知现状。研究发现,教师普遍将数字技术视为外部强加的不可避免因素,而非基于专业信念的教学选择。此外,相关实践多聚焦于孤立项目,缺乏系统性的长期战略,且存在机构驱动数字化与可持续性考量之间的张力。
针对马来西亚 18 名高校教师的质性研究揭示了 AI 对学生评估的重构影响。研究发现 AI 使用导致教师工作量增加,迫使教师角色向“学术质量守门人”转变,并引发专业身份张力。教师普遍采取适应性教学、重新设计评估及寻求机构支持等策略,以应对学术诚信挑战并推动 AI 治理。
CLEAR-Mem v0.1.0 作为首个私有发布候选版本,提供了 LLM 辅导系统中学习者状态记忆的参考实现。该工具将学习者判断表示为独立可审查的声明,控制其进入持久记忆的权限及后续证据对声明的确认或修正。配套基准 LSS-Bench 用于测试记忆是否导致教育上不合理的变更,项目采用 Apache License 2.0 许可。
华南师范大学团队基于生态系统理论,构建了数字化促进中国教育现代化的生态模型。该模型以公平、优质、全面、和谐、开放为价值追求,由时间系统贯穿微、中、外、宏系统,分别形成“学习—教学—评价”融合、“学校—家庭—社会”协同及“供给—教研—标准”耦合机制。研究进而提出以动态评估、文化融合、标准建设、场景创新和人才发展为保障的实践进路,旨在提供系统化的学理框架与行动路径。
Coursera 发布第八版《全球技能报告 2026》,推出全球首个 AI-人类技能协同指数,基于 3 亿多学习者数据揭示 98 国技能发展现状。报告显示,GenAI 课程注册速度达每分钟 45 次,批判性思维课程注册量同比增长 107%,AI 微证书注册量增长 122%。
EdReports 发布简报指出,10 家 K-12 课程与教育科技供应商中仅 1 家提供了第三方证据,证明其嵌入的 AI 功能能改善教育成果。研究强调,后台 AI 更新使学校难以确保产品效力,且现有框架缺乏评估 AI 是否增强学习的一致方法。专家建议学校要求供应商提供具体数据,并关注 AI 更新的教学决策属性。
推荐理由:报告揭示了K-12教育科技产品中AI功能缺乏实证支持的现状,为采购决策提供了关键的质量评估视角。
UNESCO IITE 发布《教师 AI 能力框架》分析报告,系统分析了 36 个来自国家教育主管部门、国际政策组织和学术界的教师 AI 能力框架。报告探讨了 AI 素养、实施场景及评估方法,并基于证据提出了设计国家级教师 AI 能力框架的建议,旨在促进高质量、课程对齐的教师 AI 能力发展。
推荐理由:报告系统分析了 36 个教师 AI 能力框架,为各国设计高质量教师 AI 发展体系提供了实证依据。
欧盟委员会教育总司发布简报,从欧盟视角分析 PISA 2025 首批结果。该简报旨在为即将推出的教育方案提供证据支持,以扭转基础技能水平下降趋势。方案将通过支持学校与教师、普及 AI 素养,并依托《基础技能行动计划》等措施,提升欧盟成员国学生的认知技能表现。
学生到底希望老师了解关于 AI 的什么? 作者 Tony Frontier 采访了 250 名高中生,其中一个主题尤为突出:学生并不想作弊,他们希望获得关于如何负责任地使用 AI 的指导。 完整 EL 杂志文章链接在第一条回复中。
devissaputra/feedback_quality_evaluator 是一个用于评估教育反馈质量的 AI 研究原型,通过 8 个独立维度(如目标对齐、可操作性)进行透明启发式分析。该工具明确区分证据缺失与低质量,不生成单一综合分数,并包含 41 个单元测试及 20 个合成压力测试用例以验证错误分析能力。
Devis Saputra 开源了 self_regulated_learning_copilot,这是一个用于研究自我调节学习的透明规则策略实验室。该原型通过显式学习者状态决定支持动作,区分有效挣扎与无效挣扎,并支持静默监控以减少提示负担。项目包含 40 个通过的单元测试,旨在保留学习者自主权而非充当自动导航。
devissaputra/engagement_early_warning 是一个时间安全的学生参与度早期预警研究原型,通过强制预测截止点边界防止数据泄露。该原型使用合成风险系数评估受限审查队列,并包含校准与子群诊断功能,29 个单元测试检查均已通过。
learner_agency_simulator 是一个用于压力测试自适应支持策略的透明学习者交互模拟器,允许合成学习者请求、接受或拒绝帮助。该工具追踪状态占用、干预负担及首次掌握时间,包含 33 个通过的单元测试,旨在验证策略结论在假设变化下的稳健性。