arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2608.11386 2026-08-13 cs.SE 新提交 67%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11164 2026-08-12 cs.IR 新提交 67%

Role of Personality in Conversational Information Seeking

人格在对话式信息检索中的作用

Abdisalam Abukar, Junchen Fu, Chengli Zhai, Joemon M. Jose

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究以大五人格为变量,开展受控被试内实验,发现助手人格与任务的交互作用影响对话式信息检索的信任与决策,助手人格需作为语境敏感的交互设计变量。

Comments Accepted by CIKM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10758 2026-08-12 cs.CV 新提交 67%

Where To Look? : Causal Tracing of Vision Encoders in VLM

看向何处?:视觉语言模型中视觉编码器的因果追踪

Naren Kumar S, Tirth Bhatt, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)

专题命中 推理与问题求解 :language model(abstract,abstract_cn)

AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。

Comments 10 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07987 2026-08-11 cs.CV 新提交 67%

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

优势引导门:重塑基于视觉的空间智能的开放式推理

Ling Lin, Yang Bai, Congcong Zhu, Jiangming Shi, Meng Wang, Yang Long, Jingrun Chen, Ling Shao, Huazhu Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学) Durham University(杜伦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07555 2026-08-11 cs.RO 新提交 67%

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement

你无需停留在循环中:用于机器人策略改进的智能体机器人循环

Hang Yu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。

Comments Agentic Robotics Preview Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07528 2026-08-11 cs.AI cs.CL cs.LG 新提交 67%

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

知-言差距:当探测模型发现错误而置信度未察觉时

Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07050 2026-08-10 math.LO 新提交 67%

Lévy-Montague reflection is $Π^1_1$-conservative over $\mathsf{WKL}_0$

Lévy-Montague反射在Π¹₁上对WKL₀是保守的

Fedor Pakhomov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究证明Lévy-Montague反射方案Rfn在Π¹₁上对WKL₀、RCA₀保守,在Π⁰₂上对PRA保守,其结果为在对PRA保守的理论内形式化Feferman的范畴论论证开辟了道路。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06771 2026-08-10 physics.soc-ph 新提交 67%

Agentic Artificial Intelligence for Reproducible Human-in-the-Loop Environmental Health Research

用于可复现人在环环境健康研究的智能体式人工智能

Edmund Seto

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出人在环智能体框架,结合领域知识与编码素养,利用智能体式大语言模型生成R代码,通过美国超级基金场地案例验证其可提升环境健康研究结果的严谨性与可复现性。

Comments 41 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06170 2026-08-07 cs.RO cs.CV 新提交 67%

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Prior-SG:面向任意结构环境中场景图的任务与先验驱动区域分割

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter

机构 * RAI Institute(RAI研究所) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出Prior-SG框架,将场景图生成视为概率对齐问题,通过融合异构专家与拓扑先验提升任意结构环境的语义区域分割精度,实现零样本本体灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06013 2026-08-07 cs.HC 新提交 67%

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:用于情感感知、理解与交互的统一多模态推理模型

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 67%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04634 2026-08-06 cs.MA 新提交 67%

HELENA:Hierarchical Sparse Coordination over a Union of Complementary Topologies for MAS

HELENA:面向多智能体系统的互补拓扑联合上的分层稀疏协调框架

Zhifang Mao, Linyao Zheng, Xuhang Shi, Xiuquan Hou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 HELENA 是一种 MAS 框架,通过互补拓扑联合与分层稀疏协调抑制冗余噪声,在八个基准测试上实现最优结果,平均提升 3.47%,MMLU-Pro 最高提升 10.34%,难基准提升更显著且附加成本合理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 67%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04533 2026-08-06 cs.CV 新提交 67%

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

EgoAfford:基于自我中心指称分割的面向任务的可供性定位

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对部件级可供性定位难以适配复杂多步桌面任务的问题,提出基准EgoAfford及参考模型EgoLens,验证了下一步推理与动作角色条件部件定位的互补挑战,为感知与规划联合研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04459 2026-08-06 cs.SE 新提交 67%

AdaptAgent: A Multi-agent, Domain-Guided Reasoning Framework for Code Adaptation

AdaptAgent:一种用于代码适配的多智能体、领域引导推理框架

Xiaokai Rong, Hridya Dhulipala, Aashish Yadavally, Tien N. Nguyen

专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract)

AI总结 本研究提出AdaptAgent框架,通过分工的多智能体实现代码适配,在真实数据集上的语义正确性优于强基线,各智能体对适配效果均有重要作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 67%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04217 2026-08-06 cs.SE 新提交 67%

Neuro-Symbolic Proof-of-Vulnerability Generation with Open-Weight Models

基于开放权重模型的神经符号漏洞证明生成

Yu Nong, Haipeng Cai

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 研究人员提出POVGEN神经符号框架,利用开放权重模型实现低成本漏洞证明生成,在基准测试和真实CVE中表现优于模糊测试与符号执行,还发现了有缺陷补丁及未报告漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 67%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03232 2026-08-05 cs.CR 新提交 67%

MalTotal: Cost-Effective and Language-Agnostic Malicious Code Poisoning Detection for Millions of Repositories

MalTotal:面向数百万代码仓库的高性价比、语言无关型恶意代码投毒检测方法

Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出MalTotal框架,可跨5种主流语言检测恶意代码,F1值达93.1%,成本大幅降低,在12万个GitHub仓库中发现564个未知恶意仓库,适用于大规模多语言场景。

Comments Accepted by ISSTA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03134 2026-08-05 cs.CR cs.SE 新提交 67%

CLEAR: Causal Context-Based Agentic Reasoning for Vulnerability Detection

CLEAR:基于因果上下文的智能体推理漏洞检测

Sungju Yun, Sijune Hwang, Yeonjoon Lee, Kyungtae Kang, Sungbin Park

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有漏洞检测方法无法捕捉漏洞复杂因果依赖的问题,提出CLEAR多智能体框架,通过构建VCKG并结合四类智能体协同推理,在C/C++和Java基准上性能显著优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03064 2026-08-05 cs.CV 新提交 67%

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

基于全局图验证的VLM驱动3D室内场景生成优化

Jialu Huang, Yingxuan You, Fei Wang, Zheng Dang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 该研究针对VLM驱动3D室内布局生成中全局一致性与物理可行性不足的问题,提出结合GSV与GPFS的混合策略,实现了该任务的当前最优性能。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 67%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 推理与问题求解 :language model(abstract,abstract_cn)

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 67%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01522 2026-08-04 cs.LG cs.AI cs.CL 新提交 67%

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

问题催生问题:面向竞赛数学强化微调的自演进课程

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 67%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00066 2026-08-04 cs.CV 新提交 67%

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

PhysAgent:用于可靠远程心率估计的多智能体框架

Yehui Yang, Bo Zhao, Junzhe Cao, Hui Ma, Yue Sun, Wenjin Wang, Zitong Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交 67%

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27435 2026-07-31 cs.DB 新提交 67%

AgenticER: the next frontier in Entity Resolution

AgenticER:实体解析的下一个前沿领域

George Papadakis, Panos Korovesis, Manolis Koubarakis, Themis Palpanas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 针对现有实体解析被动范式无法适配异构流数据场景的问题,提出Agentic ER新范式,将其建模为自主智能体的序列决策过程,构建参考架构并明确研究挑战,开拓数据管理与智能体交叉的新研究方向。

Comments Vision paper submitted to VLDB, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27805 2026-07-31 nlin.CD cond-mat.dis-nn 新提交 67%

Chaos in reason: How chain-of-thought LLMs can look for an answer

理性中的混沌:思维链大语言模型(LLMs)如何探寻答案

Gregorio Jaca, Kristóf Benedek, János Török

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本研究将非线性动力学与混沌理论工具应用于思维链LLMs,证实其存在混沌标志性特征,明确各Transformer子模块对扰动的作用,揭示其与典型混沌系统的结构相似性及分形特性,指出注意力机制诱导的非线性耦合是混沌行为的关键驱动因素。

Comments 16 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 67%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏