arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1613 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1613 篇

2606.21169 2026-06-23 cs.AI 新提交 77%

Trip+: Benchmarking Agents in Personalized Interactive Travel Planning

Trip+: 个性化交互式旅行规划中的智能体基准测试

Junle Chen, Wei Chen, Yehong Xu, Zhengjun Huang, Yuqian Wu, Zhoujin Tian, Kai Wang, Lei Wang, Xiaofang Zhou

机构 * HKUST(香港科技大学) Tencent Hy(腾讯Hy) HKUST(GZ)(香港科技大学(广州))

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出Trip+基准,通过多轮交互和分钟级行程生成与修订,评估智能体在个性化旅行规划中的可行性、偏好匹配及主观体验(如疲劳度),发现现有模型倾向于技术可行但耗时的行程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18850 2026-06-18 cs.CL cs.IR 新提交 77%

ScholarSum: Student-Teacher Abstractive Summarization via Knowledge Graph Reasoning and Reflective Refinement

ScholarSum:基于知识图谱推理与反思性精炼的师生式抽象摘要生成

Bohou Zhang, Xiaoyu Tao, Mingyue Cheng, Huijie Liu, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ScholarSum框架,通过构建层次知识图谱引导学生生成初稿,并利用教师式审阅者迭代检查与修正,实现科学文献摘要的流畅性与事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16562 2026-06-16 cs.LG 新提交 77%

MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

MIRAGE: 审计前沿大语言模型在推理、智能体与时间耦合条件下的反穆斯林偏见

Noor Islam S. Mohammad, Tamim Sheikh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MIRAGE基准,包含1200个提示,覆盖直接完成、思维链推理和模拟智能体决策三种部署场景,发现思维链放大偏见、智能体决策存在不对称性、偏见与检索新闻时间耦合,现有缓解措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14961 2026-06-16 cs.CL 新提交 77%

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

CoRA: 面向可靠思维链推理的置信度-理由对齐

Juming Xiong, Weixin Liu, Kevin Guo, Congning Ni, Junchao Zhu, Chongyu Qu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL

AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12828 2026-06-12 cs.AI 新提交 77%

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号

Rasul Khanbayov, Hasan Kurban

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Doha, Qatar(卡塔尔多哈)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11724 2026-06-11 cs.AI 新提交 77%

Mind the Perspective: Let's Reason Recursively for Theory of Mind

注意视角:递归推理实现心智理论

Chao Lei, Guang Hu, Meng Yang, Yanbei Jiang, Nir Lipovetzky

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院) SensiLab, Monash University, Australia(蒙纳士大学SensiLab)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出RecToM框架,通过递归视角构建建模嵌套信念,将高阶信念问题转化为实际世界问题,在多个ToM基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11195 2026-06-11 cs.CY cs.AI cs.HC 新提交 77%

From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning

从消费到反思:为稳定推理设计人-人工智能关系

Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee

机构 * Faculty of Medicine, Lund University(吕勒欧大学医学院) Department of Economics, Lund University School of Economics and Management(吕勒欧大学经济学与管理学院经济系) Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出关系反思智能(RRI),一种推理时治理层,通过可审计的推理循环实现反思,将人机交互转变为联合推理系统,以补偿双方局限并实现稳定推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11164 2026-06-10 cs.AI 新提交 77%

ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

ReasonAlloc: 推理模型的分层解码时KV缓存预算分配

Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Shenzhen University of Advanced Technology(深圳理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10316 2026-06-10 cs.CL 新提交 77%

TabClaw: An Interactive and Self-Evolving Agent for Spreadsheet Manipulation and Table Reasoning

TabClaw: 一个用于电子表格操作和表格推理的交互式自进化智能体

Mingyue Cheng, Shuo Yu, Daoyu Wang, Qingchuan Li, Xiaoyu Tao, Qingyang Mao, Yitong Zhou, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TabClaw,一个开源交互式AI智能体,通过可编辑执行计划、流式ReAct循环、并行多表推理和用户记忆提取,提升电子表格操作和表格推理的透明性与个性化。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09556 2026-06-09 cs.AI 新提交 77%

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究

Yinan Wang

机构 * Noah AI Research(Noah AI研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 通过分层消融实验,发现药物资产估值中AI科学家的决策上限由专有证据集决定,而非仅依赖推理框架;加入专有数据后决策质量显著提升。

Comments Preprint; 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07538 2026-06-09 cs.IR cs.AI 新提交 77%

Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents

面向遥感智能体的双向语义互补工具检索

Zeyuan Wang, Dongyang Hou, Cheng Yang, Xuezhi Cui, Linrui Xu, Bo Yu, Gaozhi Zhou, Ziyu Li, Liangtian Liu, Kai Ouyang, Wang Guo, Lili Zhu, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Mechanical and Electrical Engineering, Central South University(机械与电子工程学院,中南大学) Hunan Key Laboratory of Land Resources Evaluation and Utilization, Hunan Provincial Institute of Land and Resources Planning(湖南省国土资源评价与利用重点实验室,湖南省国土资源规划院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对遥感智能体工具检索中查询与文档语义不对称问题,提出双向语义互补方法:通过规划增强查询机制补充功能语义,利用动态工具依赖图注入上下文语义,显著提升复杂遥感任务工具检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07462 2026-06-08 cs.AI 新提交 77%

Act As a Real Researcher: A Suite of Benchmarks Evaluating Frontier LLMs and Agentic Harnesses in Research Lifecycle

像真正的研究者一样行动:一套评估前沿LLM和研究生命周期中智能体框架的基准测试套件

Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学)

专题命中 推理与问题求解 :LLM(title_cn);foundation model(abstract);分类 cs.AI

AI总结 提出AARR基准系列,通过AARRI-Bench评估智能体在细粒度研究场景中模拟人类研究者的专业性、全面性和细微推理能力,发现最佳配置成功率仅68.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06842 2026-06-08 cs.CL 新提交 77%

CRAFT: A Unified Counterfactual Reasoning Framework for Tabular Question Answering and Fact Verification

CRAFT:面向表格问答与事实验证的统一反事实推理框架

Chenshuo Pan, Yu Zhao, Jie Zhang, Changzai Pan, Zhenhe Wu, Jiayi Liang, Yujie Mao, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Xingchen AGI Lab,China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(兴晨AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CRAFT统一反事实推理框架,将表格问答和事实验证转化为双向验证过程,通过构建声明及其反事实变体并加权整合证据,显著提升复杂表格推理性能。

Comments 24pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15797 2026-08-18 cs.AI cs.CL 新提交 76%

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

KV-Rescue:通过逐步交错恢复推理语言模型的KV驱逐损失

Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI

AI总结 KV-Rescue是一种无需训练的推理框架,通过交错轻量级辅助模型的推理步骤,结合在线检测器,在驱逐预算B=64时平均恢复了87%的KV驱逐损失准确率,还减少了43%的基础模型token生成量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12599 2026-08-14 cs.AI cs.LG 新提交 76%

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

无效文本还是绑定条款?测量并恢复黑盒大语言模型对话中的约束影响

Haoyuan Zhu

机构 * University of Sheffield(谢菲尔德大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI、cs.LG

AI总结 该研究针对黑盒大语言模型对话中撤销约束失效的问题,提出 sysname 方法,通过合约账本、顺序消融探针和修复阶梯实现复发率的测量、预测与修复,降低了约束撤销的失效概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16451 2026-07-21 cs.CL cs.AI 新提交 76%

Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM

推理前先承诺:开放权重语言模型中答案预承诺的行为再现及初步激活水平证据

Heejin Jo

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究聊天模型在简单问题上先承诺答案而非推导的现象,通过行为再现和初步激活水平证据揭示错误承诺情况,还指出方法学上问题措辞对结果的影响,强调阳性对照对解读阴性预言机结果的重要性。

Comments 8 pages. Code, data, and all reported statistics: https://github.com/JO-HEEJIN/interview_mate/tree/docs/car-wash-repro/car_wash/paper_4

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 76%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11816 2026-06-11 cs.CL cs.AI 新提交 76%

WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning

WorldReasoner: 评估语言模型代理是否通过有效推理预测事件

Yizhou Chi, Eric Chamoun, Zifeng Ding, Andreas Vlachos

机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI

AI总结 提出WorldReasoner框架,通过时间有效检索、证据质量和因果图推理三个维度评估语言模型代理的事件预测能力,发现时间有效检索是结果准确性的最强驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 76%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理与问题求解 :language model(title);分类 cs.AI、cs.LG

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 75%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08225 2026-08-11 eess.SP cs.SY eess.SY 新提交 75%

Toward Intelligent Skies: Signal Processing and AI Foundations of Low-Altitude Wireless Networks

迈向智能天空:低空无线网络的信号处理与人工智能基础

Weijie Yuan, Geng Sun, Jiacheng Wang, Jun Wu, Yuanhao Cui, Jiahui Li, Wei Zhang, George K. Karagiannidis, Sumei Sun, Yonina C. Eldar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本教程从AI与信号处理视角,全面阐述低空无线网络(LAWN)的架构基础、信号处理与AI技术,结合案例分析其融合应用,指出未来发展挑战与机遇。

Comments Invited Overview Paper in JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09591 2026-08-11 cs.RO cs.CV 新提交 75%

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 推理与问题求解 :language model(abstract);instruction tuning(abstract);post-training(abstract)

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06701 2026-08-10 cs.SE cs.AI cs.CL cs.LG 新提交 75%

Online Monitoring and Corrective Steering of Programming Agents

编程智能体的在线监控与纠正引导

Shuyang Liu, Saman Dehghan, Ji Young Kim, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LivePlan,通过解耦判断与建议的设计,在SWE-agent基础上实现编程智能体的在线监控与纠正,在SWE-bench数据集上显著提升问题解决率,且成本增量极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 75%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00629 2026-08-04 cs.GR 新提交 75%

ParticleGen: A Multi-Agent System for Particle Effects Generation

ParticleGen:用于粒子效果生成的多智能体系统

Junhao Zhuge, Junyi Yang, Yuqing Wang, Kangzhan Wang, Sipeng Yang, Xiaogang Jin

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00200 2026-08-04 cs.AI cs.CL cs.ET cs.LG 新提交 75%

TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding

TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理

Sparsh Rastogi, Tanmay Kumar, Baiyu Chen, Jatin Bedi, Zechen Li, Flora D. Salim

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。

Comments 24 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00004 2026-08-04 cs.CL cs.AI cs.LG 新提交 75%

Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

自然语言数学证明的高性价比自动评判

Benjamin Grayzel

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 75%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 75%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏