arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1613 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1613 篇

2607.19235 2026-07-22 cs.CL cs.CV 新提交 70%

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18979 2026-07-22 cs.AI 新提交 70%

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18820 2026-07-22 cs.CL 新提交 70%

CASE: Causal Alignment and Structural Enforcement for Improving Chain-of-Thought Faithfulness

CASE:用于提高思维链忠实度的因果对齐和结构强化

Ziming Wang, Yinghua Yao, Changwu Huang, Ke Tang, Xin Yao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18100 2026-07-21 cs.AI 新提交 70%

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

我们能否使大语言模型摆脱自我循环?通过激活引导实现细粒度推理控制

Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型推理过程不可控问题,提出SOPHIA方法,通过将推理轨迹视为潜在状态序列,构建引导向量库,在推理时进行干预,可检测并防止自我循环,提升推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17657 2026-07-21 cs.AI cs.CV cs.MM 新提交 70%

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

OrientSAM:通过方向感知空间对齐减轻多模态空间推理中以相机为中心的捷径

Wenxiao Fan, Hang Yin, Kan Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态模型空间推理中以相机为中心的问题,提出OrientSAM框架,通过方向感知令牌、傅里叶角度编码及课程学习策略注入方向信息并改善推理,构建数据管道生成监督,实验证明其在多任务中表现出色,能减轻捷径行为,实现更强大的以对象为中心的空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16727 2026-07-21 cs.AI cs.CV 新提交 70%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 70%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-07-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 新提交 70%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 70%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 70%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14756 2026-07-17 cs.AI 新提交 70%

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

人工智能与人类专家推理:基于街景图像评估建筑类型预测中的一致性

Zahratu Shabrina, Muhammad Asa, Jin Rui, Lu Yin, Stephen Law

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型从街景图像推断建筑类型的潜力,将其预测与人类专家比较,评估多种VLM,发现思维链提示性能更稳定,通过分析关键词概率研究推理过程,表明VLM能逼近专家能力,为城市分析提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14658 2026-07-17 cs.AI 新提交 70%

TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning

TopoAgent:用于多模态科学推理的自进化拓扑智能体

Mingze Xu, Yinghui Li, Jiayi Kuang, Zhanhui Kang, Di Yin, Ying Shen, Xing Sun, Yuxing Han

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型科学推理难题,提出TopoAgent自进化拓扑框架,用图进化取代线性轨迹,通过前端分解器、DAG组织原子及自适应原子裂变实现,实验证明其显著优于线性智能体框架,为科学推理提供新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14303 2026-07-17 physics.ed-ph cs.AI 新提交 70%

Assessing AI in Introductory Physics Problem Solving

评估人工智能在基础物理问题解决中的能力

Amir Bralin, N. Sanjay Rebello

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估OpenAI的o4-mini模型解决基础物理问题的能力,通过解决《费曼物理学讲义》章节末尾问题展开,发现模型总体准确率约90%,性能受问题模态和难度影响,表明先进大语言模型虽能解决不少基础物理问题,但表现不均衡。

Comments Working paper, submitted as a placeholder

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13901 2026-07-16 cs.CL 新提交 70%

High-Order Question Generation in a Multilingual Educational Context

多语言教育背景下的高阶问题生成

Suna-Şeyma Uçar, Itziar Aldabe, Nora Aranberri, Orphée De Clercq

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究在多语言教育背景下,针对高阶问题生成的挑战,引入基于主张-证据-推理和发散性提问的提示,对比布鲁姆分类法。结果显示开源和专有模型能生成多语言问题,部分问题被教师认可为高阶,替代框架可补充布鲁姆分类法。

Comments This paper was accepted at the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 760-769

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12723 2026-07-15 cs.CR cs.AI cs.SE 新提交 70%

Bulkhead: Automated Semantic Detection and Remediation of Container Escape Vulnerabilities

舱壁:容器逃逸漏洞的自动语义检测与修复

Qiyuan Fan, Zhi Li, Junjie Li, XiaoFeng Wang, Bin Yuan, Deqing Zou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究容器逃逸漏洞,提出舱壁框架,集成大语言模型与形式化方法,利用多智能体系统通过多维知识模式识别修复漏洞,检测管道找漏洞并生成利用程序,补丁管道验证确保修复正确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 70%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12455 2026-07-15 cs.AI cs.CE 新提交 70%

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化

Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI Research(悖论人工智能研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12058 2026-07-15 cs.SE cs.AI cs.CR 新提交 70%

AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

AutoTrace:通过智能过程间探索从补丁到触发器

Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对修复漏洞提交的触发器定位难题,提出AutoTrace智能管道逐层探索代码属性图定位漏洞触发器,并构建SinkTrace - Bench数据集。AutoTrace在基准测试中表现出色,还揭示了前沿语言模型在因果推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11736 2026-07-14 cs.CL 新提交 70%

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

MET:基于理论和文化感知的多语言道德推理

Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10651 2026-07-14 cs.AI 新提交 70%

Embark Now: User Demand Oriented Framework for Multi-day Urban Travel Itinerary Planning

即刻出发:面向多日城市旅行行程规划的用户需求导向框架

Rongbo Qi, Yaqi Zhang, Shijun Yan, Xuemeng Liu, Xiangrui Cai, Chunyao Song

机构 * Jiangxi Normal University(江西师范大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大城市多日旅行行程规划难题,提出集成大语言模型与增强GRASP算法的框架,经实验验证其在行程质量和计算效率上显著优于现有方法,能动态满足多样用户需求。

Comments 37 pages, 16 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10562 2026-07-14 cs.AI 新提交 70%

CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps

CRiT-QA:利用反事实链和干扰陷阱评估多跳推理

JungMin Yun, JuneHyoung Kwon, YoungBin Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Graduate School of Advanced Imaging Sciences, Multimedia and Film, Chung-Ang University(Chung-Ang大学高级成像科学研究院,多媒体与电影)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型多跳推理能力评估难题,提出CRiT-QA数据集,通过反事实实体转换推理链、注入干扰链解决模型依赖知识和利用捷径问题,实验表明该数据集能暴露模型弱点,为评估多跳推理及开发可靠模型提供基础。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10463 2026-07-14 cs.AI cs.IR 新提交 70%

GRASP: GRanularity-Aware Search Policy for Agentic RAG

GRASP:用于智能检索增强生成的粒度感知搜索策略

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe 研究院)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究智能体检索增强生成中模型决策难题,提出GRASP强化学习框架,训练智能体协调互补检索工具,实验表明其提升检索召回率和问答性能,还展现出可解释行为,凸显协调检索信号和上下文粒度对智能体推理的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09790 2026-07-14 cs.AI cs.CY 新提交 70%

Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems

语义漂移与推理类决策支持系统中操作员控制的稳定性

M. L. Kaluzhsky, V. A. Efirov

机构 * Omsk State Technical University(鄂木斯克国立技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究新一代人机混合决策支持系统中操作员控制稳定性问题,通过实验验证推理LLMs语义漂移现象,提出人机界面交互数学模型及控制稳定性系数,在认知组理论范式下捕捉临界点,给出相关工程建议。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09795 2026-07-14 cs.IT cs.AI eess.SP math.IT 新提交 70%

Large Multimodal Model-Based Environment-Aware Mobility Management

基于大型多模态模型的环境感知移动性管理

Seokhyun Jeong, Sangmok Shin, Seungnyun Kim, Jiao Wu, Byonghyo Shim

机构 * Department of Electrical and Computer Engineering and the Institute of New Media and Communications, Seoul National University(电气电子工程系和新媒体与通讯研究所,首尔国立大学) Information Systems Technology and Design (ISTD) pillar, Singapore University of Technology and Design(信息与系统技术与设计(ISTD)部门,新加坡科技设计大学) Computer, Electrical and Mathematical Sciences and Engineering Division, King Abdullah University of Science and Technology(计算机、电子与数学科学与工程系,卡塔尔科学与技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs在移动性管理应用少的问题,提出基于大型多模态模型的环境感知移动性管理方案,利用LMMs提取环境信息,学习信道容量图预测未来信道容量,据此确定主动切换决策,相比传统DL方法显著提升了信道容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05734 2026-07-13 cs.IR cs.AI 新提交 70%

SCOReD: Student-Aware CoT Optimization for Recommendation Distillation

SCOReD:用于推荐蒸馏的学生感知思维链优化

Haz Sameen Shahgir, Yufei Li, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Sandeep Pandey, Luke Simon, Yue Dong, Xi Liu

机构 * University of California Riverside(加州大学河滨分校) Meta AI

专题命中 推理与问题求解 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 研究针对推荐蒸馏中原始教师轨迹不适用于任务的问题,提出SCOReD框架,先解析教师轨迹片段并评分,再动态选择编辑操作,使轨迹适应学生输出分布,训练能为学生模型提供清晰信号,提升指标并减少推理长度。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交 70%

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05888 2026-07-08 cs.CR cs.AI 新提交 70%

i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler

i-EXAM:可指导且可解释的攻击连通性图建模器

Rakesh Podder, Wadia Ganim, Sarath Sreedharan, Indrajit Ray, Indrakshi Ray

机构 * Colorado State University(科罗拉多州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 i-EXAM工具借助规划编译,帮系统管理员创建复杂网络安全配置文件并做假设分析,可识别攻击路径、评估指标、生成强化策略,还能用大语言模型解释策略。

Comments In the Proceedings of the International Conference on Automated Planning and Scheduling (ICAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05798 2026-07-08 cs.CV cs.AI 新提交 70%

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

回答前分割:用于多模态大语言模型视觉推理的像素定位

Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型视觉推理,提出SegAnswer方法,将放大单元从边界框转为像素级分割掩码,能精准定位感兴趣区域,过滤冗余信息,与视觉令牌构建方式更契合,经多基准测试验证了其在像素定位及分割任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05790 2026-07-08 cs.AI 新提交 70%

Controlling Tool Use with Heading-Specific Activation Steering

通过特定标题激活控制工具使用

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究工具增强大语言模型中工具使用决策的稳定内部表示,通过从标题锚点位置提取引导向量对工具调用行为进行双向因果控制,发现其因果有效性与线性结构不符,还区分了工具使用引导向量与参数化概念的引导向量,二者关系待解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03436 2026-07-08 cs.LG 新提交 70%

How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise

路由差距中有多少是真实的?将路由器到预言机的差距分解为可重现的专家优势和单次抽取标签噪声

Teng-Ruei Chen

机构 * Institute of Bioinformatics and Systems Biology, National Yang Ming Chiao Tung University(国立阳明交通大学生物信息与系统生物学研究所) Krixvon AI(Krixvon人工智能公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型中路由差距,将预言机期望分解为可重现部分和选择下限,证明单次抽取标签噪声是差距一部分,提出多样本预言机评估协议,多数差距是可恢复专家优势。

Comments 29 pages, 9 figures. v2: released reproducible artifacts; added a robustness subsection (k/K-sweeps, lineage jackknife, learned-router baseline) and GPQA-Diamond results; abstract takeaway + trim. Theorems and headline numbers unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏