arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2607.09101 2026-07-13 cs.SE 新提交 87%

Multi-Agent LLM Collaboration for Unit Test Generation via Human-Testing-Inspired Workflows

通过受人工测试启发的工作流程进行多智能体大语言模型协作以生成单元测试

Quanjun Zhang, Ye Shang, Siqi Gu, Jianyi Zhou, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有基于大语言模型的单元测试生成方法的局限,提出TestAgent,通过多智能体协作机制模拟人工测试,设计专门智能体、配备工具API并构建知识图谱,在Java项目实验中取得优异结果,性能优于基线和搜索工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新 87%

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 87%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04293 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交 87%

CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试

Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong Baptist University(香港浸会大学) University of Oxford(牛津大学) New York University, Abu Dhabi(纽约大学阿布扎比分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。

Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01812 2026-07-03 cs.CE 新提交 87%

TO-Master: an LLM-agent framework for automated topology optimization

TO-Master:用于自动化拓扑优化的大语言模型智能体框架

Haoju Lin, Wenchang Zhang, Weipeng Xu, Xiang Li, Tian Xu, Tianju Xue

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出TO-Master框架,利用大语言模型智能体将有限元拓扑优化转化为对话式工作流,通过自然语言指令自动完成几何处理、网格生成、边界条件设置和优化求解,无需用户编写代码。

Comments 29 pages, 10 figures, 2 tables; submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01485 2026-07-03 cs.IR 新提交 87%

CoPersona: Collaborative Persona Graphs for Robust LLM Personalization

CoPersona: 面向鲁棒LLM个性化的协作人格图

Yangtian Zhang, Leyao Wang, Hiren Madhu, Ngoc Bui, Walter Roznyatovskiy, Rex Ying

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。

Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30649 2026-07-01 cs.CY 新提交 87%

Thinking Out Loud: Real-Time Deception Monitoring in Asymmetric LLM Negotiations

大声思考:非对称LLM谈判中的实时欺骗监控

Nolan Coffey, Faithful Odoi, Makenzie Johnson, Nasir U. Eisty

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30029 2026-06-30 astro-ph.IM 87%

ESOFinder: an LLM-powered tool to help users navigate ESO documentation

ESOFinder:一个基于LLM的工具,帮助用户浏览ESO文档

P. Sánchez-Sáez, C. Reinero, M. Vioque, M. Wittkowski, M. Rejkuba, M. Romaniello, A. Barnes, J. Pritchard, M. Marsset

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对ESO文档量大且多样导致用户查找困难的问题,开发了基于大语言模型和检索增强生成的ESOFinder聊天机器人,集成多类文档提供精准答案,减少幻觉,提升可靠性。

Comments Submitted to SPIE Astronomical Telescopes and Instrumentation 2026, paper number 14155-19

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20888 2026-06-23 cs.CV 新提交 87%

Fine-grained Human Motion Understanding with Language Models

基于语言模型的细粒度人体运动理解

Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

机构 * Delft University of Technology(代尔夫特理工大学) Honda Research Institute Japan(日本本田研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title)

AI总结 提出LLM模型\methodname,通过显式时间戳编码和多样化姿态/运动级监督,在多个基准上实现SOTA性能,且仅用2D骨骼输入即可超越3D方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19776 2026-06-19 cs.CV 新提交 87%

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Occ-VLM: 面向室内场景理解的占用接地视觉语言模型

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出Occ-VLM,仅用姿态RGB图像和单一2D视觉编码器,通过重建3D占用作为几何先验,实现统一的3D场景理解,在占用预测、3D VQA和密集描述任务上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17128 2026-06-19 cs.AR 新提交 87%

Shift-Left High-Level Synthesis Verification via Knowledge-Augmented LLM Agent

通过知识增强的LLM智能体实现左移高层次综合验证

Zhihan Xiao, Hongbing Lang, Zhe Zhao, Luke Ztz Hu, Songping Mai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种知识增强的智能体驱动左移验证框架,通过双层级一致性检查、符号执行和HLS验证知识图谱,在综合前自动验证C与HLS-C的功能一致性,覆盖率达98.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16886 2026-06-16 cs.SE 新提交 87%

Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale

神经符号软件验证:通过符号推理在规模上增强本地语言模型

Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出VerIbmc管道,结合符号不变量生成与本地开源语言模型及ESBMC验证工具,通过结构化的验证器反馈迭代优化,实现隐私保护且高效的循环不变量合成,在520个问题上达到86.4%的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10838 2026-06-10 eess.AS 新提交 87%

Towards Deep Contextual Reasoning from Broad Descriptions for ASR with Speech-LLM via Metadata-Driven Reasoning Chains

面向语音-大语言模型的基于元数据驱动推理链的宽描述深度上下文推理

Jakob Poncelet, Hugo Van hamme

专题命中 推理与问题求解 :LLM(title,summary_cn)

AI总结 提出一种训练方法,使语音-LLM利用宽描述作为弱语义先验,通过链式推理进行上下文修正,降低罕见词和命名实体错误率。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07831 2026-06-09 cs.SE 新提交 87%

SLRMentor: An LLM-Based Tool Supporting Learning of SLR in Software Engineering

SLRMentor:一种基于LLM的软件工程系统文献综述学习支持工具

Rodolfo Gil-Pereira, Ronnie de Souza Santos, Cleyton Magalahes, Italo Santos

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出SLRMentor对话助手,利用LLM支持软件工程中系统文献综述的学习与规划,通过引导搜索字符串构建和纳入排除标准推理,降低新手入门门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01745 2026-06-02 cs.SI 87%

Enhancing the Socioeconomic Understanding of Foundation Models with Urban Mobility

利用城市流动性增强基础模型的社会经济理解

Baoshen Guo, Donghang Li, Zhiqing Hong, Kailai Sun, Heye Huang, Alok Prakash, Shenhao Wang

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出MobFusion范式,通过将流动性网络作为上下文、图连接器和结构化令牌三种方式融入基础模型,以提升城市社会经济预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30539 2026-06-01 cs.MA 87%

A Theory-Guided LLM Pedagogical Agent for STEM+C Scaffolding Without Over-Reliance

理论引导的LLM教学代理:用于STEM+C支架式教学,避免过度依赖

Clayton Cohn, Surya Rayala, Siyuan Guo, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Ryan Li, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Ashwin T S, Meiyi Ma, Gautam Biswas

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出基于证据-决策-反馈框架的多智能体协作代理Copa,结合社会认知理论与社会建构主义,通过自适应对话支持促进STEM+C学习,实验证明其能增强学生信心和概念表达能力而不导致依赖。

Comments Submitted to Computers & Education. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30314 2026-05-29 cs.MA 87%

SpecBench: Evaluating Specification-Level Reasoning for Software Engineering LLM Agents

SpecBench: 评估软件工程LLM代理的规约级推理能力

Grant Hamblin, Kevin Song, Zhanda Zhu, Anand Jayarajan, Sihang Liu, Nandita Vijaykumar, Gennady Pekhimenko

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出SpecBench基准,通过从RFC过程中提取任务,评估LLM代理在无执行反馈下识别初始设计提案中遗漏、歧义、不一致或错误假设的规约级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27685 2026-05-28 cs.MA cs.HC 87%

Decoupled Intelligence: A Multi-Agent LLM Framework for Controllable Traffic Scenario Generation in SUMO

解耦智能:用于SUMO中可控交通场景生成的多智能体LLM框架

Shuyang Li, Ruimin Ke

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种多智能体协作框架,通过解耦仿真流程为规划器、构建器、需求、运行器和分析器等专业角色,并由状态持久化编排器协调,实现SUMO中端到端交通仿真的自动化与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26497 2026-05-27 cs.CR 87%

Aligning Provenance with Authorization: A Dual-Graph Defense for LLM Agents

对齐来源与授权:面向LLM智能体的双图防御

Peiran Wang, Ying Li, Yuan Tian

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出AuthGraph双图对齐防御框架,通过构建注入推理图与授权图的结构化比较,检测工具调用和参数来源级别的偏差,在AgentDojo上将攻击成功率从40%降至1%并保持76%任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21674 2026-05-22 cs.CR 87%

Adversarial Reframing: A Framework for Targeted Generation in Language Models

对抗性重构:一种用于语言模型针对性生成的框架

Shahnewaz Karim Sakib, Swati Kar, Anindya Bijoy Das

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);foundation model(abstract)

AI总结 本文提出THREAT框架,通过协调多个语言模型进行迭代搜索,寻找文本劫持提示,并通过非凸优化问题解决提示发现问题,提高了攻击成功率并降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21008 2026-05-21 eess.AS 87%

A Survey of Audio Reasoning in Multimodal Foundation Models

多模态基础模型中音频推理的综述

Zhihan Guo, Wenqian Cui, Guan-Ting Lin, Daxin Tan, Jingyao Li, Qiyong Zheng, Dingdong Wang, Jing Xiong, Han Shi, Jiaya Jia, Irwin King

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文综述了多模态基础模型中音频推理的研究问题,探讨了音频推理模型的架构和训练基础,并系统整理了音频到文本、音频到语音、音频视觉推理和代理音频推理等领域的最新进展,同时分析了新兴范式和评估实践,提出了未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 87%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21272 2026-04-30 cs.CR cs.SE 87%

LLM-Powered Detection of Price Manipulation in DeFi

基于大语言模型的去中心化金融中价格操纵检测

Lu Liu, Wuqi Zhang, Lili Wei, Hao Guan, Yongqiang Tian, Yepang Liu, Shing-Chi Cheung

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04058 2026-04-28 q-bio.GN 87%

RareCollab: an LLM-powered framework for multimodal reasoning in Mendelian disease diagnosis

RareCollab: 一种基于大语言模型的多模态推理框架,用于孟德尔疾病诊断

Guantong Qi, Jiasheng Wang, Mei Ling Chong, Zahid Shaik, Shenglan Li, Shinya Yamamoto, Maura R. Z. Ruzhnikov, Devon E. Bonner, Jennefer N. Carter, Kevin S. Smith, Matthew T. Wheeler, Stephen B. Montgomery, Jonathan A. Bernstein, Sasidhar Pasupuleti, Undiagnosed Diseases Network, Pengfei Liu, Hu Chen, Zhandong Liu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RareCollab通过整合基因组、表型和转录组证据,提升孟德尔疾病诊断的多模态推理能力,其在890名患者中实现了对94%诊断基因的高优先级识别,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17142 2026-04-21 cs.MA 87%

Logic-Based Verification of Task Allocation for LLM-Enabled Multi-Agent Manufacturing Systems

基于逻辑的任务分配验证在LLM赋能的多智能体制造系统中

Jonghan Lim, Mostafa Tavakkoli Anbarani, Rômulo Meira-Góes, Ilya Kovalenko

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种利用大语言模型灵活性并保持安全性的控制架构,通过时序逻辑和离散事件系统验证任务分配,通过多机器人装配案例证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16198 2026-04-20 cs.SE 87%

Bridging the Gap between User Intent and LLM: A Requirement Alignment Approach for Code Generation

弥合用户意图与大语言模型之间的鸿沟:一种用于代码生成的需求对齐方法

Jia Li, Ruiqi Bai, Yangkang Luo, Yiran Zhang, Wentao Yang, Zeyu Sun, Tiankuo Zhao, Dongming Jin, Lei Li, Zhi Jin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出REA-Coder方法,通过需求对齐提升大语言模型的代码生成性能,实验表明其在多个编程基准测试中表现优异,平均提升率达7.93%至30.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10701 2026-04-14 cs.LG cs.AI cs.CL 87%

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

带回价值模型:生成式批评者在大语言模型强化学习中的价值建模

Zikang Shan, Han Zhong, Liwei Wang, Li Zhao

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出生成式批评者GenAC,通过链式推理改进价值建模,提升RL性能。

Comments 16 pages including appendix, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 87%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 推理与问题求解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05655 2026-04-08 cs.CL cs.AI cs.LG 87%

LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals

大语言模型推理作为轨迹:步骤特定的表示几何与正确性信号

Lihao Sun, Hang Dong, Bo Qiao, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过表示空间结构揭示大语言模型的推理过程,发现推理步骤在不同层深度下逐渐分离,晚期阶段正确与错误解的分歧可预测最终答案正确性,提出轨迹引导框架控制推理。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02375 2026-04-06 cs.SE cs.PL 87%

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU:一种意图门控的LLM代理执行内核

Cormac Guerin, Frank Guerin

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 KAIJU通过解耦LLM推理层与代理执行流程,引入意图门控执行和执行内核,提升LLM代理在复杂任务中的执行效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏