arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-27 至 2026-04-27 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2601.12280 2026-04-27 cs.HC 91%

Democratizing Music Therapy: LLM-Based Automated EEG Analysis and Progress Tracking for Low-Cost Home Devices

音乐治疗民主化:基于LLM的自动EEG分析与进展追踪用于低成本家庭设备

Huixin Xue, Guangjun Xu, Shihong Ren, Xian Gao, Ruian Tie, Zhen Zhou, Hao Liu, Yue Gao

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于LLM的系统,通过自动EEG和心血管数据分析生成可读报告和个性化音乐推荐,解决家庭音乐治疗中可及性和成本问题。

Comments Withdrawn by the authors due to issues in the experimental validation and interpretation of EEG-derived measures, which may affect the reliability of the reported results and conclusions. The current version should not be cited as a reliable reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22606 2026-04-27 cs.CL 91%

Dharma, Data and Deception: An LLM-Powered Rhetorical Analysis of Cow-Urine Health Claims on YouTube

达摩、数据与欺骗:一种基于LLM的牛尿健康主张YouTube评论修辞分析

Sheza Munir, Ratna Kandala, Anamta Khan, Deepti, Joyojeet Pal

机构 * University of Michigan(密歇根大学) University of Kansas(堪萨斯大学) IIT Jodhpur(印度理工学院乔普里尔)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文利用LLM分析YouTube上牛尿健康主张的修辞策略,揭示推广者与反驳者在说服技巧上的差异,验证了LLM在 misinformation 分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08027 2026-04-27 cs.LG cs.AI cs.CV cs.RO 91%

LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines

LLMPhy: 结合大语言模型和物理引擎的参数可识别物理推理

Anoop Cherian, Radu Corcodel, Siddarth Jain, Diego Romeres

机构 * Mitsubishi Electric Research Labs (MERL)(三菱电机研究实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 LLMPhy通过整合大语言模型与物理引擎,解决复杂物理推理中参数识别问题,提出数字孪生构建方法,引入新数据集验证性能,实现更准确的参数恢复与稳定收敛。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 89%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10377 2026-04-27 cs.LG cs.AI stat.ME 89%

Causal Concept Graphs in LLM Latent Space for Stepwise Reasoning

在LLM潜在空间中使用因果概念图进行分步推理

Md Muntaqim Meherab, Noor Islam S. Mohammad, Faiza Feroz

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出因果概念图(CCG),通过结合任务条件稀疏自编码器和可微结构学习方法,在LLM潜在空间中建模概念间的因果依赖关系,提升了多步推理的效果。

Comments We have recently encountered author conflicts related to this work and therefore respectfully request the withdrawal of this paper. We believe this step is necessary to address the situation appropriately and maintain academic integrity in the submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22266 2026-04-27 cs.CL 88%

Large Language Models Decide Early and Explain Later

大语言模型早决策晚解释

Ayan Datta, Zhixue Zhao, Bhuvanesh Verma, Radhika Mamidi, Mounika Marreddy, Alexander Mehler

机构 * University of Sheffield, UK(谢菲尔德大学,英国) Goethe University, Frankfurt am Main, Germany(法兰克福歌德大学,德国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究发现大语言模型在生成过程中,只有32%的查询在中间阶段改变最终答案,且稳定后生成额外760个推理token。通过早停策略可减少500个token使用,仅导致2%的准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22438 2026-04-27 cs.CR cs.AI cs.CL 88%

SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking

SSG: 用于LLM水印的对数平衡词汇分区

Chenxi Gu, Xiaoning Du, John Grundy

机构 * AllenG-L

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSG方法,通过对数平衡词汇分区提升水印检测效果,针对低熵场景改进水印强度下界。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22601 2026-04-27 cs.SE cs.AI 86%

From Natural Language to Verified Code: Toward AI Assisted Problem-to-Code Generation with Dafny-Based Formal Verification

从自然语言到验证代码:迈向借助Dafny基于形式验证的AI辅助问题到代码生成

Md Erfan, Md Kamal Hossain Chowdhury, Ahmed Ryan, Md Rayhanur Rahman

机构 * Department of Computer Science, The University of Alabama(阿拉巴马大学计算机科学系) The University of Alabama(阿拉巴马大学) Alabama Water Institute, The University of Alabama(阿拉巴马水研究院,阿拉巴马大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出NL2VC-60数据集,通过分层提示策略评估不同LLM在形式验证中的表现,发现结构化提示和迭代反馈能显著提升验证成功率,证明开放权重LLM可用于高可靠软件开发。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22199 2026-04-27 cs.RO cs.AI 83%

An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments

基于大语言模型的闭环自主学习框架:面向机器人在开放环境中处理未覆盖任务

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息学院计算机学院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的闭环自主学习框架,使机器人在开放环境中自主处理未覆盖任务,通过闭环学习减少对大语言模型的依赖,提升任务执行效率和本地知识库的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22156 2026-04-27 cs.LG cs.CV 83%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12979 2026-04-27 cs.CL 83%

The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check

扩散语言模型在代理工作流中的苦涩教训:全面的现实检验

Qingyu Lu, Liang Ding, Kanjian Zhang, Jinxia Zhang, Dacheng Tao

机构 * Southeast University(东南大学) Alibaba(阿里巴巴) Southeast University Shenzhen Research Institute(东南大学深圳研究院) College of Computing and Data Science at Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文评估了扩散语言模型在代理任务中的表现,发现其在长期规划和工具调用任务中存在系统性失败,提出需整合因果推理机制以提升代理能力。

Comments ACL 2026 - Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16989 2026-04-27 cs.CL cs.AI cs.LG cs.LO 82%

Bolzano: Case Studies in LLM-Assisted Mathematical Research

Bolzano:大语言模型辅助数学研究的案例研究

Martin Balko, Jan Grebík, Pavel Hubáček, Martin Koutecký, Matěj Kripner, Václav Rozhoň, Robert Šámal, Adrián Zámečník

机构 * Computer Science Institute, Charles University(查尔斯大学计算机科学研究所) Institute of Mathematics, Czech Academy of Sciences(捷克科学院数学研究所) Institute of Formal and Applied Linguistics, Charles University(查尔斯大学形式与应用语言学研究所) Department of Applied Mathematics, Charles University(查尔斯大学应用数学系)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过八个数学和理论计算机科学问题,展示Bolzano系统如何通过多代理交互生成可发表的研究成果,其中五项几乎完全自主完成。

Comments 33 pages, 1 figure. Project page: https://bolzano.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22136 2026-04-27 cs.CR cs.LG 81%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22074 2026-04-27 cs.CL 81%

Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning

结果奖励并不能保证可验证或因果重要的推理

Qinan Yu, Alexa Tartaglini, Peter Hase, Carlos Guestrin, Christopher Potts

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文通过实验发现,尽管RLVR提升了任务准确率,但并未可靠提升推理的因果重要性和充分性,通过预训练可改善此问题,辅助奖励能进一步提升推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05038 2026-04-27 cs.CL 81%

Toward Automated Robustness Evaluation of Mathematical Reasoning

迈向数学推理的自动化鲁棒性评估

Yutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Ma Shuguang, Zhaoqian Dai, Hailiang Huang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Math Stress Tester框架,通过多轮重写验证循环生成对抗样本,提升数学推理任务的鲁棒性评估能力,并验证其在非数学任务中的扩展性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI 79%

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22217 2026-04-27 cs.SE 75%

RAG-Reflect: Agentic Retrieval-Augmented Generation with Reflections for Comment-Driven Code Maintenance on Stack Overflow

RAG-Reflect:基于反思的代理检索增强生成用于Stack Overflow的评论驱动代码维护

Mehedi Hasan Shanto, Muhammad Asaduzzaman, Alioune Ngom

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出RAG-Reflect框架,通过检索增强推理和自我反思机制,实现精确的评论-编辑预测,提升代码维护效率。

Comments 27 pages, submitted to the TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19592 2026-04-27 cs.CV 75%

Decomposed Attention Fusion in MLLMs for Training-Free Video Reasoning Segmentation

MLLMs中分解注意力融合用于无训练视频推理分割

Su Ho Han, Jeongseok Hyun, Pilhyeon Lee, Minho Shim, Dongyoon Wee, Seon Joo Kim

机构 * Yonsei University(延世大学) Inha University(inha大学) NAVER Cloud(NAVER云)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DecAF方法,通过对比物体背景融合和互补视频帧融合精炼注意力图,实现无训练视频推理分割,取得优于无训练方法和与有训练方法相当的性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HYUNJS/DecAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21375 2026-04-27 cs.CL cs.AI cs.SE 73%

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

VLAA-GUI: 知何时停止、恢复和搜索,一个用于GUI自动化模块化框架

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xiong, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz CMU(卡内基梅隆大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Salesforce UC Berkeley(伯克利加州大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 VLAA-GUI通过模块化框架解决GUI代理的早期停止和重复循环问题,引入完整性验证器、循环打破器和搜索代理,提升自动化性能。

Comments The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22498 2026-04-27 cs.CV cs.AI 70%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03294 2026-04-27 cs.CR cs.AI 70%

AgentMark: Utility-Preserving Behavioral Watermarking for Agents

AgentMark:用于代理的效用保持行为水印

Kaibo Huang, Jin Tan, Yukun Wei, Wanling Li, Zipei Zhang, Hui Tian, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huaqiao University(华侨大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出AgentMark,一种用于代理的行为水印方法,通过在规划决策中嵌入多比特标识符以保持效用,适用于黑盒API和动作层内容水印。

Comments Accepted to ACL 2026 (Main, Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22277 2026-04-27 cs.HC 67%

Multi-Agent Consensus as a Cognitive Bias Trigger in Human-AI Interaction

多智能体共识作为人类与人工智能交互中的认知偏差触发器

Soohwan Lee, Kyungho Lee

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 研究探讨多智能体系统中共识机制对人类判断的影响,发现多数共识加速意见变化并提升自信,而少数反对则促进更深入的思考,揭示了智能体共识结构在人类与AI交互中的偏差相关信号作用。

Comments ACM CHI 2026 Workshop on Understanding, Mitigating, and Leveraging Cognitive Biases to Calibrate Trust in Evolving AI Systems (CHI'26 Bias4Trust)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07632 2026-04-27 cs.AI cs.CL cs.CV cs.LG 67%

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

测试时匹配:在多模态模型中解锁组合推理

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出测试时匹配算法,通过改进评估指标提升多模态模型的组合推理能力,使SigLIP-B16和GPT-4.1在Winoground等基准上取得新突破。

Comments To appear at ICLR 2026; extended results to generative multimodal models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21935 2026-04-27 cs.AI cs.LG 62%

Math Takes Two: A test for emergent mathematical reasoning in communication

数学需要两个:一种评估交流中涌现数学推理的测试

Michael Cooper, Samuel Cooper

机构 * Cooper Cognitive(Cooper认知)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Math Takes Two基准测试,通过两个无先验数学知识的智能体交流,评估模型在视觉任务中通过发现潜在结构来发展抽象概念的能力。

Comments Accepted at HCAIR workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22225 2026-04-27 cs.CL eess.AS 57%

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

TTS-PRISM:一种用于细粒度诊断的感知推理和可解释语音模型

Xi Wang, Jie Wang, Xingchen Song, Baijun Song, Jingran Xie, Jiahe Shao, Zijian Lin, Di Wu, Meng Meng, Jian Luan, Zhiyong Wu

机构 * Tsinghua University(清华大学) MiLM Plus, Xiaomi Inc.(小鹏科技MiLM Plus) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :instruction tuning(abstract);分类 cs.CL

AI总结 本文提出TTS-PRISM模型,通过多维诊断框架和可解释合成流程,实现对语音生成中细粒度声学问题的诊断与解释,实验表明其在人感知对齐上优于通用模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22062 2026-04-27 cs.CL 57%

Incentivizing Neuro-symbolic Language-based Reasoning in VLMs via Reinforcement Learning

通过强化学习激励基于神经符号语言的视觉语言推理

Karthic Palaniappan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文基于Qwen3-VL-2B-Instruct模型,通过强化学习提升视觉语言模型的神经符号语言推理能力,在数学、科学和常识问题上准确率提升3.33%,推理令牌减少75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏