arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2606.16122 2026-06-16 cs.AI 新提交 57%

Thinking with Visual Grounding

视觉锚定思维

Junkai Zhang, Yihe Deng, Kai-Wei Chang, Wei Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出视觉锚定思维方法,让视觉语言模型在推理时交替生成自然语言和视觉锚点(点或框),并通过合成数据管道和锚定感知强化学习训练,在计数和空间推理任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15141 2026-06-16 eess.AS cs.AI cs.SD 新提交 57%

EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning

EChO-Agent: 用于音频推理的证据链编排智能体

Siyuan Zhang, Jian Zong, Junyu Wang, Peiyuan Jiang, Jiahao Yan, Jingyu Zhang, Tianrui Wang, Xiaobao Wang, Longbiao Wang, Jianwu Dang

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 提出EChO-Agent模块化框架,将复杂音频问答转化为规划、工具执行、证据整合和答案验证流程,在MMAR基准上提升准确率和评分。

Comments 5 pages, 2 figures. Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14620 2026-06-15 cs.LG 新提交 57%

Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens

既非并行也非顺序:DiffusionGemma 实际如何提交令牌

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 通过钩取DiffusionGemma 26B的采样器接受步骤,测量其解码顺序,发现解码既非并行也非块自回归,而是呈现部分从左到右的提交偏差,且块大小是测量尺度的伪影而非架构特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12910 2026-06-15 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 57%

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

边界框作为目标:通过神经符号规划实现语言条件抓取

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。

Comments Project website: https://allisonandreyev.github.io/grasp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13673 2026-06-12 cs.CV cs.AI 新提交 57%

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

SpatialClaw:重新思考智能体空间推理的动作接口

Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出SpatialClaw框架,以代码作为动作接口,通过状态化Python内核和感知几何原语,使VLM智能体逐步执行并灵活组合中间结果,在20个3D/4D空间推理基准上平均准确率59.9%,比现有方法高11.2个百分点。

Comments Project page: https://spatialclaw.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13643 2026-06-12 cs.CL 新提交 57%

Recursive Agent Harnesses

递归智能体框架

Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13282 2026-06-12 cs.AI 新提交 57%

ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space

ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试

Pratyush Chaudhari

机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。

Comments 8 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12830 2026-06-12 cs.CV cs.AI 新提交 57%

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

感知、交互、推理:构建工具增强的视觉智能体用于空间推理

Changye Li, Meng Lu, Yi Wu, Ligeng Zhu

机构 * Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出PERIA智能体,通过视觉感知和交互工具增强VLM的空间推理能力,在13个基准上优于同类模型7.0%-14.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12783 2026-06-12 cs.AI 新提交 57%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12550 2026-06-12 cs.RO cs.AI 新提交 57%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 57%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12402 2026-06-11 cs.RO cs.AI cs.CV 新提交 57%

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

DIRECT: 在具身规划器中何时何地分配测试时计算?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12003 2026-06-11 cs.CL 新提交 57%

Agreement in Representation Space for Open-Ended Self-Consistency

表示空间中的一致性:面向开放式自洽性

Paula Ontalvilla, Gorka Azkune, Aitor Ormazabal

机构 * HiTZ Center - Ixa, University of the Basque Country (UPV/EHU)(HiTZ中心 - Ixa,巴斯克大学(UPV/EHU))

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 针对开放式生成任务,提出基于嵌入的协议(EBA),通过聚类采样生成的嵌入表示来估计自洽性,无需训练即可鲁棒地选择更可靠的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11953 2026-06-11 cs.CL 新提交 57%

Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos

解码多模态线索:揭示仇恨视频背后的隐含意义

Junyu Lu, Deyi Ji, Liqun Liu, Xiaokun Zhang, Youlin Wu, Roy Ka-Wei Lee, Peng Shu, Huan Yu, Jie Jiang, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Tencent(腾讯) City University of Hong Kong(香港城市大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL

AI总结 提出IARE框架,通过信息增强和推理优化实现可解释的仇恨视频检测,在Ex-HateMM和Ex-ImpliHateVid数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10918 2026-06-10 cs.RO cs.LG 新提交 57%

Task Robustness via Re-Labelling Vision-Action Robot Data

通过重新标注视觉-动作机器人数据的任务鲁棒性

Artur Kuramshin, Özgür Aslan, Cyrus Neary, Glen Berseth

机构 * Mila — Quebec AI Institute(Mila — 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 提出TREAD框架,利用大型视觉语言模型对机器人数据集进行语义子任务分解和多样化指令生成,无需额外数据收集,提升策略在未见任务上的泛化能力。

Comments Project website: https://akuramshin.github.io/tread

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10658 2026-06-10 cs.CR cs.AI cs.CE q-fin.CP 新提交 57%

Post-Quantum Secure Federated DeFi for Inclusive Banking

面向普惠银行的后量子安全联邦DeFi

Swati Sachan, Dale Fickett, Richard Buchinger, Theo Miller

机构 * AI FinTech Group, University of Liverpool(人工智能金融科技组,利物浦大学) RVA Works and University of Richmond(RVA Works和里士满大学) Chain Crunch Labs(Chain Crunch实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出后量子安全联邦DeFi框架,利用格基全同态加密和NASA-IBM地理空间基础模型,实现银行间加密协作以提升信用不足个体的金融普惠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 57%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.LG

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08992 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Central South University(中南大学) Jiangsu University(江苏大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08014 2026-06-09 cs.CV cs.AI 新提交 57%

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence

GVC-Seg: 基于几何视觉对应的免训练3D实例分割

Liang Xu, Fangjing Wang, Jinyu Yang, Feng Zheng

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07856 2026-06-09 cs.LG 新提交 57%

Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain

无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉

Igor Lima Strozzi

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07361 2026-08-10 cs.RO cs.CV 新提交 56%

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

驾驶视觉-语言-动作模型中规划 token 的深度探测与剪枝

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

机构 * Robert Bosch GmbH(罗伯特·博世有限公司) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 推理与问题求解 :language model(abstract);foundation model(comments)

AI总结 本文针对驾驶 VLA 模型的规划 token,通过探测其 32 个解码器层的信号并剪枝部分层,在误差小幅增加下实现 1.33 倍解码器加速,验证了规划信息早期存在但格式适配问题。

Comments Accepted at the 6th DriveX Workshop (Foundation Models for Autonomous Driving), ECCV 2026. 14 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19164 2026-08-20 cs.CY cs.HC 新提交 50%

LearnAI: Just-in-Time AI Co-Creation Across Disciplines at a University

LearnAI:大学跨学科即时AI协同创作

Weihao Qu, Ling Zheng, Chris Buzaid, Daniel Crawford

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究提出LearnAI两层AI协同创作框架,试点后发现其能帮助不同能力学习者转变对AI的认知,贡献了可实用的AI教育框架及初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18833 2026-08-20 cs.CV 新提交 50%

EVADE: Evidence-Verified Agentic Diagnosis with Escape

EVADE:带弃权机制的证据验证智能诊断方法

Mohaimenul Azam Khan Raiaan, Nur Mohammad Fahad

机构 * Monash University(莫纳什大学) Murdoch University(默多克大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19008 2026-08-20 physics.ao-ph 新提交 50%

Extremes on Rewind: Generating 1,000-Member Ensembles Initialized at a Final Condition

回溯极端事件:在最终状态条件下初始化生成1000成员集合

Jerry Lin, Mu-Ting Chien, Mansi Sakarvadia, Elizabeth A. Barnes

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本研究使用非自回归基础模型cBottle-video生成1000成员集合,针对三个极端事件验证了终点约束集合的多样性与有效性,为罕见高影响事件的情景规划提供了高效方案。

Comments 38 pages, 21 figures; includes 17 pages of Supporting Information with 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17535 2026-08-19 cs.CV 新提交 50%

GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting

GroupForward:通过实例分组前馈高斯溅射构建可参考的3D场景

Qijian Tian, Zimeng Wu, Xuhong Wang, Lizhuang Ma, Xin Tan

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 GroupForward是一种实例分组前馈高斯溅射模型,可从稀疏多视图图像重建3D场景,结合RSRF实现复杂3D参考推理,提升了语义重建与参考推理的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15788 2026-08-18 cs.CV 新提交 50%

ChainSpace: A Chained-Reasoning Paradigm for Spatial Intelligence

ChainSpace:面向空间智能的链式推理范式

Xiaohan Zhang, Feng Gu, Xudong Rao, Xuhao Pan, Tao Wei, Zhou Pan, Kun Zhan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Li Auto Inc.(理想汽车有限公司)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10838 2026-08-12 cs.CV 新提交 50%

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

PolyLayout:超越矩形房间的分层VLM引导布局生成

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))

专题命中 推理与问题求解 :language model(abstract)

AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交 50%

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10107 2026-08-12 cs.CV 新提交 50%

4D-WAM: 4D Consistent World Modeling for Autonomous Driving

4D-WAM:面向自动驾驶的4D一致世界建模

Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出4D-WAM模型,通过几何基础模型的训练时监督与面向决策的时间步长采样策略,提升自动驾驶中世界-动作模型的4D场景一致性,在NAVSIM-v1、NAVSIM-v2基准上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏