arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-23 至 2026-06-23 共收录 275 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 68 篇

2606.22318 2026-06-23 q-bio.OT 新提交 50%

PROMPT: A Pre-registered Randomized Protocol for Component-Level Evaluation of Clinical AI Prompts

PROMPT:临床AI提示组件级评估的预注册随机协议

Bin Hu, Avneek Sandhu, Shahryar Wasif

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PROMPT协议,通过预注册、随机化、匹配对照和拆解设计,在合成和医学图像任务中识别提示组件的有益、有害和无效效应,揭示整体提示评估遗漏的安全漏洞。

Comments 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23667 2026-06-23 cs.DB 新提交 50%

The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data

表格另有说法:用反事实关系数据测试大语言模型

Xinzhi Wang, Chunwei Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22961 2026-06-23 cs.IR 新提交 50%

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估

Yue Que, Junyi Zhou, Xiaokun Zhang, Haiming Jin, Qiao Xiang, Chen Ma

专题命中 推理评测 :reasoning(abstract)

AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 50%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21629 2026-06-23 cs.SE 新提交 50%

Assessing Language Models for Salient Class Identification

评估语言模型在显著类识别中的表现

Bo Xiong, Chaoran Cai, Kaipeng Xiong, Chong Wang, Peng Liang

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 研究语言模型能否直接从代码提交中识别显著类,无需特征工程或图构建,发现小模型在少样本提示下性能接近大模型,可降低成本和隐私障碍。

Comments 22 pages, 1 images, 8 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 50%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 50%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 推理评测 :reasoning(abstract)

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20412 2026-06-23 physics.ed-ph 版本更新 50%

Exploring the potential of ChatGPT for feedback and evaluation in experimental physics

探索ChatGPT在实验物理反馈与评估中的潜力

Marcos Abreu, Álvaro Suárez, Cecilia Stari, Arturo C. Marti

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探索ChatGPT在实验物理实验报告评估中的应用,通过API评估和定制化ChatGPT两种模式,发现其在形式结构反馈上表现一致,但在技术推理和实验数据解释方面可靠性较低,强调了教师监督的重要性。

Comments 11 pages, 1 fig

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新 50%

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 50%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 25 篇

2606.22085 2026-06-23 cs.AI cs.CL cs.LG 新提交 87%

Can Reasoning Models Detect Changes to their Chains of Thought?

推理模型能否检测其思维链的变化?

Sathvik Napa, Utkarsh Singh, Chengyuan Xue, Miriam Wanner, William Walden

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型在多种条件下检测自身思维链干预的能力,发现模型检测准确率很低,且难以识别修改方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23206 2026-06-23 cs.CV cs.CL 新提交 83%

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

CFPO:用于多模态推理的反事实策略优化

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出反事实策略优化框架,通过跨模态反事实增强机制强制视觉与文本推理的因果一致性,显著提升多模态推理的准确性。

Comments Accepted to ICML 2026. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09893 2026-06-23 cs.CL cs.AI 版本更新 81%

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

语言模型中的伪 deliberation:当推理无法使价值观与行动一致时

Sushrita Rakshit, Hanwen Zhang, Hua Shen

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。

Comments 9 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20937 2026-06-23 cs.LG 新提交 77%

Learning through Internalization

通过内化学习

Nikolaos Tsilivis, Nirmit Joshi, Marko Medvedev, Julia Kempe, Nati Srebro

机构 * New York University(纽约大学) Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) University of Chicago(芝加哥大学)

专题命中 其他推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 研究神经网络系统通过将显式计算过程吸收到自身权重中的内化机制,分析变换器如何内化半自动机模拟及链式思维令牌,首次证明简化单层变换器在奇偶性学习任务中成功内化的过程。

Comments first version, 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20382 2026-06-23 cs.CL cs.AI 版本更新 73%

Do as I Say, Not as I Do: Instruction-Induction Conflict in LLMs

言行不一:大型语言模型中的指令诱导冲突

Carolina Camassa, Derek Shiller

机构 * Future Impact Group(未来影响组)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在面对指令与模式完成之间的冲突时的表现,发现指令遵循率在不同模型和指令下差异显著,输出多样性是预测鲁棒性的主要因素。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23124 2026-06-23 cs.CL cs.AI 新提交 62%

PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation

PRIDE: 特权信息增强的共情对话生成蒸馏方法

Jiaqiang Wu, Zhouan Zhu, Shangfei Wang

机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22383 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers

结构化超边适应用于视觉Transformer的参数高效微调

Edwin Kwadwo Tenagyei, Lei Wang, Ugochukwu Ejike Akpudo, Jun Zhou, Yongsheng Gao

机构 * Griffith University(格里菲斯大学) Data61/CSIRO(Data61/澳大利亚联邦科学与工业研究组织)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出HyperAdapter,一种基于超图的适配器架构,通过软超边路由实现结构化、组感知的适应,在参数预算下优于现有PEFT方法。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21811 2026-06-23 cs.SE cs.AI cs.LG 新提交 62%

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

引导而非求解:为大型代码智能体训练小型评论模型

Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07078 2026-06-23 cs.LG cs.AI 版本更新 62%

The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

最优Token基线:长程LLM-RL的方差缩减

Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22486 2026-06-23 cs.CV cs.AI cs.HC 新提交 57%

Human and AI collaboration for pulmonary nodule segmentation

人类与AI协作进行肺结节分割

Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haiping Liu, Jianxing He, Bo Liu

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) PET/CT Center, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院PET/CT中心) Department of Thoracic Surgery and Oncology, The First Affiliated Hospital of Guangzhou Medical University(广州医科大学第一附属医院胸外科与肿瘤科) Department of Mathematical Science, Tsinghua University(清华大学数学科学系) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤金数学科学中心) China State Key Laboratory of Respiratory Disease & National Clinical Research Centre for Respiratory Disease, Guangzhou, China(中国呼吸疾病国家重点实验室及呼吸疾病临床研究中心,广州,中国) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) National Center for Respiratory Medicine, National Clinical Research Center for Respiratory Disease, Guangzhou Institute of Respiratory Health, The First Affiliated Hospital of Guangzhou Medical University(呼吸医学国家中心、呼吸疾病临床研究中心、广州呼吸健康研究院、广州医科大学第一附属医院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Hi-Seg框架,基于SAM通过人类迭代优化提示实现肺结节分割,在12中心1179例CT上平均Dice达85%,优于多种深度学习模型,并降低标注时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22110 2026-06-23 cs.SE cs.AI cs.HC 新提交 57%

TraceView: Interactive Visualization of Agentic Program Repair Trajectories

TraceView: 智能体程序修复轨迹的交互式可视化

Amirali Sajadi, Tu Nguyen, Kimmie Huynh, Esteban Parra, Preetha Chatterjee

机构 * Belmont University(贝尔蒙特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交 57%

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21151 2026-06-23 cs.SE cs.AI cs.NI 新提交 57%

Context-Aware Generative AI for Automated Telecom Test Script Generation

上下文感知的生成式AI用于自动化电信测试脚本生成

Gautam Prasad, Chandramohan T. N., Joy Bose

机构 * Ericsson R&D Bangalore(爱立信印度班加罗尔研发中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种上下文感知的生成式AI框架,通过实时知识图谱和增量引擎检测变化,仅更新受影响的测试,减少人工并加速测试周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21048 2026-06-23 cs.CL 新提交 57%

Event Ontology Expansion via LLM-Based Conceptualization

基于LLM概念化的事件本体扩展

Weicheng Ren, Zixuan Li, Long Bai, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ConceptE框架,利用LLM从句子和触发词中提取概念级语义,增强事件聚类和层次扩展,在ACE、ERE和MAVEN上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20768 2026-06-23 cs.CV cs.AI eess.IV 新提交 57%

UniSLAD: A Unified Framework for Structural and Logical Industrial Visual Anomaly Detection

UniSLAD: 面向结构与逻辑工业视觉异常检测的统一框架

Changyi Li, Chao Yang, Yu Xiao, Kari Tammi

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出UniSLAD统一框架,无需额外训练即可同时检测结构异常和逻辑异常,通过双特征提取器与双粒度特征表示模块,在工业基准上实现99.4%和93.1%的检测性能。

Comments This work has been accepted for publication in the Proceedings of the 2026 IEEE International Conference on Automation Science and Engineering (CASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15874 2026-06-23 cs.AI cs.SE 新提交 57%

LLM-as-Code: Agentic Programming for Agent Harness

LLM即代码:面向Agent框架的编程范式

Junjia Qi, Zichuan Fu, Jingtong Gao, Wenlin Zhang, Hanyu Yan, Xian Wu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13744 2026-06-23 cs.CV cs.AI 版本更新 57%

Mitigating Cross-Image Information Leakage in Multi-Image Understanding with Large Vision-Language Models

缓解多图像理解中大型视觉语言模型的跨图像信息泄露

Yeji Park, Minyoung Lee, Sanghyuk Chun, Junsuk Choe

机构 * Sogang University(ソガン大学) Princeton University(普林斯顿大学) NAVER AI Lab(NAVER AI实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对大型视觉语言模型在多图像输入时性能下降的问题,提出无需训练且架构无关的FOCUS方法,通过随机噪声掩码和噪声参考输入抑制跨图像信息泄露,显著提升多图像和视频理解性能。

Comments Source code is available at https://github.com/yejipark-m/FOCUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23052 2026-06-23 eess.AS 新提交 50%

CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models

CAAD:对比音频感知蒸馏用于高效语音语言模型

Chun-Wei Chen, Tzu-Quan Lin, Ke-Han Lu, Wei-Ping Huang, Hung-Yi Lee

专题命中 其他推理 :reasoning(abstract)

AI总结 提出对比音频感知蒸馏(CAAD)框架,通过同步教师强制策略将教师模型的对比推理内化到学生模型权重中,在Dynamic-SUPERB上相对提升约8%,并减少语言偏倚。

Comments Accepted to interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23138 2026-06-23 cs.CR 新提交 50%

Rising From the Ashes: How Agentic AI is Unblocking Challenges in Cybersecurity

浴火重生:自主AI如何解锁网络安全挑战

Gabriela F. Ciocarlie, Kathrin Grosse, Somesh Jha, Daryna Oliynyk, Andrew Paverd, Christian Wressnegger

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨自主AI通过直接处理自然语言或代码来缓解安全防御中劳动密集型瓶颈的潜力,并通过16个案例研究(包括供应链分析)展示其对防御者的益处。

Comments two tables, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22328 2026-06-23 cs.CY 新提交 50%

Do Gains from Generative AI-Enabled Adaptive Pretesting Persist? Evidence from a Retention Study

生成式AI自适应预测试的收益是否持久?来自一项保持研究的数据

Mahir Akgun, Sacip Toker

专题命中 其他推理 :reasoning(abstract)

AI总结 研究通过七周保持期实验,发现GenAI自适应预测试能提升初始理解,但持续学习依赖于后续AI支持练习的结构化方式。

Comments 27th International Conference on AI in Education

详情

展开后加载摘要…

URL PDF HTML 收藏