arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2506.00886 2026-05-11 cs.AI 70%

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07315 2026-05-11 cs.CL 70%

LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification

LaTER:通过潜在探索和显式验证实现高效的推理

Xuan Li, Yining Wang, Yuchen Liu, Guanjun Liu, Delai Qiu, Shengping Liu, Jiaen Liang, Wei Huang, Jun Yu, Junnan Zhu

机构 * University of Science and Technology of China(科学技术大学) Unisound AI Technology Co., Ltd(Unisound AI技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LaTER通过连续潜在空间的有限探索和显式CoT验证提升推理效率,在多个基准测试中减少16%-32%的token使用量,同时提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07153 2026-05-11 cs.CL 70%

Beyond Reasoning: Reinforcement Learning Unlocks Parametric Knowledge in LLMs

超越推理:强化学习解锁大语言模型中的参数知识

Wanli Yang, Hongyu Zang, Junwei Zhang, Wenjie Shi, Du Su, Jingang Wang, Xueqi Cheng, Fei Sun

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究强化学习在零样本、单跳、封闭书 QA 任务中提升参数知识直接回忆的能力,发现其平均相对提升达27%,揭示 RL 通过重新分配概率质量解锁潜在知识而非获取新事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07106 2026-05-11 cs.CL 70%

Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

检索、整合与综合:空间-语义 grounded 的潜在视觉推理

Jin Cui, Xinyue Long, Xunyong Zhang, Yadong Zhang, Chuanchang Su, Jingye Gan, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RIS框架,通过空间-语义 grounded 方法改进多模态大语言模型的视觉推理,通过构建逐步 grounded 数据集并引入短语言过渡token,提升潜在状态与词汇对齐的解码能力,实验显示在多个基准上优于现有基线。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 70%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06882 2026-05-11 cs.AI 70%

How Well Do LLMs Perform on the Simplest Long-Chain Reasoning Tasks: An Empirical Study on the Equivalence Class Problem

LLMs在最简单的长链推理任务上表现如何:等价类问题的实证研究

Chun Zheng, Lianlong Wu, Bingqian Li, Lvting Liu, Yi Zhou

机构 * University of Science and Technology of China(中国科学技术大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了LLMs在等价类问题上的表现,发现非推理模型无法解决,而推理模型虽更优但仍难以完全解决,且问题难度随连接概率和变量数变化而变化。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06819 2026-05-11 cs.LG 70%

A Theory of Online Learning with Autoregressive Chain-of-Thought Reasoning

在线学习中自回归链式推理理论

Ilan Doron-Arad, Idan Mehalel, Elchanan Mossel

机构 * MIT(麻省理工学院) The Hebrew University(希伯来大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究自回归生成过程中的在线学习问题,探讨反馈形式对学习误差界的影响,证明在链式推理模型中可消除生成步数依赖,提出最优误差界及新下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06671 2026-05-11 cs.AI cs.MA 70%

GraphDC: A Divide-and-Conquer Multi-Agent System for Scalable Graph Algorithm Reasoning

GraphDC: 一种用于可扩展图算法推理的分而治之多智能体系统

Wenjin Li, Jiaming Cui

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GraphDC通过分而治之的多智能体框架提升图算法推理效率,通过分解图并分配子任务给专用智能体,结合主智能体整合结果,提升大规模图处理的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08033 2026-05-11 math.CO 67%

Weak Order on the MacNeille Completion of Bruhat Order

Bruhat序的MacNeille完备性的弱序

Colin Defant

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文引入了0-Hecke monoid作用于MacNeille完备性,定义弱序和下降集统计,并证明了某些Knutson-Miller子词复形的顶点可分解性,以及Cohen-Macaulay ASM变种的猜想。

Comments 14 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07789 2026-05-11 cs.HC 67%

Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design

分析日常决策对话中的人类启发式与策略以指导对话AI设计

Sora Kang, Soyun Jeon, Jinsu Eun, Kwangwon Lee, Chaerin Song, Minyoung Joo, Joonhwan Lee

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文通过分析955个真实韩国对话,揭示人们在决策中优先满足而非优化,发现启发式策略在探索阶段维持对话流畅,而规则策略在利用阶段有效推动解决,为对话AI设计提供认知理论支持。

Comments CogSci 2026 (Annual Meeting of the Cognitive Science Society 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV 67%

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25809 2026-05-11 cs.CV 67%

Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

基于指令和证据的对比双流解码用于 grounded 视觉语言推理

Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Kharagpur(印度理工学院Kharagpur分校)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 本文提出 IECD$^2$ 方法,通过双流解码平衡语言信息和视觉真实性,提升视觉语言推理任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05359 2026-05-11 cs.CV 67%

Multimodal Latent Reasoning via Hierarchical Visual Cues Injection

多模态潜在推理 via 分层视觉提示注入

Yiming Zhang, Qiangyu Yan, Borui Jiang, Kai Han

机构 * Nanyang Technological University(南洋理工大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出HIVE框架,通过分层视觉提示注入实现多模态潜在推理,提升模型在对齐潜在空间中的多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 62%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07353 2026-05-11 cs.AI 57%

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

增强置信度的对齐使推理大语言模型更加可靠

Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia

机构 * Zhejiang University(浙江大学) Université de Montréal(蒙特利尔大学) Sun Yat-sen University(中山大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.AI

AI总结 本文提出CASPO框架,通过迭代直接偏好优化将token级置信度与逐步逻辑正确性对齐,提升推理可靠性和效率,实验表明其在多个基准和模型家族中表现优异。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07123 2026-05-11 cs.LG 57%

Convergence and Emergence of In-Context Reinforcement Learning with Chain of Thought

基于思维链的上下文强化学习的收敛与涌现

Zixuan Xie, Xinyu Liu, Rohan Chandra, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.LG

AI总结 本文探讨了思维链如何增强上下文强化学习的能力,通过线性Transformer分析证明思维链生成等同于时间差分学习更新,并展示策略评估误差随思维链长度减少而收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05949 2026-05-11 cs.AI cs.SE 57%

MAS-Algorithm: A Workflow for Solving Algorithmic Programming Problems with a Multi-Agent System

MAS-Algorithm: 一个基于多智能体系统的算法问题求解工作流

Yuliang Xu, Xiang Xu, Yao Wan, Hu Wei, Tong Jia

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出MAS-Algorithm,通过多智能体工作流提升算法问题求解能力,实验显示在多个模型上均取得显著提升,包括接受率提升6.48%和LiveCodeBench-Pro上的4.72%提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23947 2026-05-11 cs.AI 57%

GamED.AI: A Hierarchical Multi-Agent Framework for Automated Educational Game Generation

GamED.AI:一种用于自动教育游戏生成的分层多智能体框架

Shiven Agarwal, Yash Shah, Ashish Raj Shekhar, Priyanuj Bordoloi, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 本文提出GamEDAI框架,通过分层多智能体方法将教师提供的问题转化为可玩的教育游戏,验证通过形式化机制合同。系统在200个问题上实现90%验证通过率和98.3%的模式合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18856 2026-05-11 cs.CV cs.AI 57%

Motion-o: Trajectory-Grounded Video Reasoning

Motion-o:基于轨迹的视频推理

Bishoy Galoaa, Shayda Moezzi, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 57%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09907 2026-05-11 cs.AI cs.CV 57%

Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis

学习提出问题:基于推理和求解器适应的数据合成

Yongxian Wei, Yilin Zhao, Zixuan Hu, Li Shen, Xinrui Chen, Runxi Cheng, Sinan Du, Hao Yu, Chun Yuan, Dian Li

机构 * Tsinghua University(清华大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种基于推理和求解器适应的数据合成方法,通过生成相关问题对并利用推理模型生成中间步骤,提升问题设计策略,实验表明在多个基准上实现了3.4%的平均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07154 2026-05-11 cs.CV 50%

PRIMED: Adaptive Modality Suppression for Referring Audio-Visual Segmentation via Biased Competition

PRIMED: 通过偏见竞争实现适应性模态抑制的指引用视听分割

Yuchen He, Jing Zhang

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 PRIMED通过偏见竞争理论,实现适应性模态抑制,提升指引用视听分割的准确性,通过模态先验解码器和token蒸馏器增强多模态融合,实验表明其在Ref-AVS基准上达到最优性能。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06966 2026-05-11 cs.RO cs.SE 50%

Traffic Scenario Orchestration from Language via Constraint Satisfaction

通过约束满足实现基于语言的交通场景编排

Frieda Rong, Chris Zhang, Kelvin Wong, Raquel Urtasun

机构 * University of Toronto(多伦多大学) Waabi

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出一种基于约束满足的交通场景编排方法,通过自然语言生成约束条件,利用现成求解器实现闭环测试中的精确场景控制,显著提高了场景编排成功率。

Comments 19 pages, 10 figures; full version of paper accepted for poster presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 102 篇

2605.07422 2026-05-11 cs.SE cs.AI 92%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03736 2026-05-11 cs.AI cs.CL cs.LG 92%

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

LLM代理行为是否一致?用于社交模拟的潜在特征

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of African American & African Studies, University of Minnesota(明尼苏达大学非裔美国人与非洲研究系) Department of Sociology, University of Chicago(芝加哥大学社会学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究LLM代理在不同实验环境下是否保持经验一致性,通过揭示代理的潜在特征来检验其行为一致性,发现不同模型家族和大小的LLM存在显著不一致。

Comments 25 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02195 2026-05-11 cs.SE 92%

Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation

超越翻译准确性:解决基于LLM的代码翻译中的虚假失败

Fazle Rabbi, Soumit Kanti Saha, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文指出LLM代码翻译中许多失败并非逻辑错误,而是评估框架导致的编译器标志、库链接缺失或运行时环境未配置等问题,通过大规模实验揭示了虚假负样本的分类及改进评估标准的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 92%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 92%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01535 2026-05-11 cs.SE 91%

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(journal_ref)

AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。

Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same

Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14823 2026-05-11 physics.ed-ph 91%

Using an LLM to Investigate Students' Explanations on Conceptual Physics Questions

利用LLM探究学生对概念物理问题的解释

Sean Savage, N. Sanjay Rebello

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文利用LLM评估学生对能量与动量概念问题的书面解释,发现其评估结果与人类评分者一致,且能揭示不同错误解释类别,为教学提供更深入的理解。

Comments 5 pages, 3 figures and Physics Education Research Conference 2025

Journal ref 2025 PERC Proceedings, pp. 399-404 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏