arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 79 篇

2605.09494 2026-05-12 cs.RO cs.AI 57%

LASSA Architecture-Based Autonomous Fault-Tolerant Control of Unmanned Underwater Vehicles

基于LASSA架构的无人水下车辆自主容错控制

Hong Chen, Zixiang Tang, Yuanbao Chen, Yu Liu

机构 * Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) School of Aeronautic Science and Engineering, Beihang University(北航航空科学与工程学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LASSA架构的无人水下车辆自主容错控制方法,通过LLM识别未知故障并自主规划任务,结合智能代理感知与决策评估, solver验证物理约束,实现高动态决策与高频控制的双闭环协同控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI 57%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26805 2026-05-12 cs.AI cs.MA 57%

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bian Que: 一个具有灵活技能安排的代理框架,用于在线系统运维

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

机构 * Kuaishou Technology(快手科技)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Bian Que通过统一运维范式和灵活技能安排,提高了在线系统运维效率,减少了警报量,提高了根因分析准确率,缩短了故障解决时间。

Comments HomePage: https://benchen4395.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15529 2026-05-12 cs.AI 57%

LACE: Lattice Attention for Cross-thread Exploration

LACE:用于跨线探索的晶格注意力

Yang Li, Zirui Zhang, Yang Liu, Chengzhi Mao

机构 * Amazon AGI Labs(亚马逊人工通用智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LACE通过引入跨线注意力机制,使大语言模型在推理过程中实现协同合作,提升推理准确性达7个百分点。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL 57%

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19585 2026-05-12 cs.IR cs.AI 57%

LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation

基于大语言模型的强化学习用于交互推荐中的长期用户满意度

Chongjun Xia, Yanchun Peng, Xianzhi Wang

机构 * University of Technology Sydney, Sydney, Australia(新南威尔士大学悉尼分校) University of Shanghai for Science and Technology(上海科学技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出LLM-Enhanced Reinforcement Learning框架,通过结合大语言模型的语义规划能力与强化学习的细粒度适应性,解决推荐系统中内容同质化和过滤气泡问题,提升长期用户满意度。

Journal ref In: Jung, H., Wang, T., Toyoda, M., Kwon, HY., Lee, Jw. (eds) Database Systems for Advanced Applications. DASFAA 2026. Lecture Notes in Computer Science, vol 16535. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA 57%

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09150 2026-05-12 cs.LG 57%

AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play

AlphaExploitem:超越纳什均衡的扑克博弈

Vlad Murgoci, Matthijs Spaan, Yaniv Oren

机构 * Delft University of Technology(代尔夫特理工大学) Department of Intelligent Systems(智能系统系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 AlphaExploitem通过引入层次变压器编码器和多样化对手池,提升了扑克博弈中对非最优策略的利用能力,同时保持对纳什均衡对手的性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI 57%

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08769 2026-05-12 cs.AI 57%

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS:学习执行时间的多智能体系统工作流

Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Zhejiang University(浙江大学) ShanghaiTech University(上海理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 EvoMAS通过动态构建执行时间工作流,改进多智能体系统的协作策略,实验证明其在复杂任务中优于单智能体基线和现有自动化方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08686 2026-05-12 cs.AI 57%

Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

迭代批评与路由控制器用于异构大语言模型的多智能体系统

Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种迭代批评与路由控制器,通过将多智能体协调视为序列决策问题,改进多智能体系统的协调效率,实验表明其在多个异构系统和七个推理基准中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08518 2026-05-12 cs.AI 57%

Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge

2025年CODS资产操作挑战赛的结果与回顾分析

Dhaval Patel, Chathurangi Shyalika, Suryanarayana Reddy Yarrabothula, Ling Yue, Shuxin Lin, Nianjun Zhou, James Rayfield

机构 * IBM Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院) Steel Authority of India Limited(印度钢铁公司) Indian Institute of Technology, Bhilai(比哈尔理工学院) Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文回顾2025年CODS资产操作挑战赛,分析了评估指标、隐藏评估对结果的影响以及团队表现,揭示了评估奖励的行为及改进方向。

Comments 43 pages, 32 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08516 2026-05-12 cs.AI 57%

OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

OracleTSC: 通过Oracle信息的奖励障碍和不确定性正则化用于交通信号控制

Darryl Jacob, Xinyu Liu, Muchao Ye, Xiaoyong Yuan, Pan He

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Auburn University(亚伯拉罕大学) Department of Computer Science(计算机科学系) University of Iowa(爱荷华大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OracleTSC通过奖励障碍和不确定性正则化机制提升交通信号控制的稳定性与效果,实验表明其在交通效率提升和跨路口泛化能力方面表现突出。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01401 2026-05-12 cs.HC cs.AI 57%

AI Expert Twin: Capturing Expert Cognition for Human-Centred, Practice-Based Learning

AI专家双胞胎:捕捉专家认知以实现以人为本的基于实践的学习

Annie Yuan, Xiaohua Chen, Kalina Yacef, Judy Kay

机构 * The University of Sydney(悉尼大学) Beijing Institute of Fashion Technology(北京服装技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI专家双胞胎框架,通过结构化表示专家实践中的动作、概念和决策过程,为AI教育系统提供可计算的知识模型,并在文化遗产工作坊中验证其可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08315 2026-05-12 cs.LG 57%

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

反思引导的策略优化:轨迹 grounded 的修订与显著性偏差

Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito

机构 * Laboratory of AI and Robotics Research (LAIRR)(人工智能与机器人研究实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出R2PO框架,通过轨迹级证据改进策略搜索,解决传统方法仅依赖标量奖励的不足,通过分离全局搜索与行为修订,提升策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08211 2026-05-12 eess.SP cs.IT cs.LG math.IT 57%

Learning the Channel Gain from Anywhere to Anywhere via Cross-environment Transformer Estimators

通过跨环境变压器估计器学习任意地点到任意地点的信道增益

Prasenjit Dhara, Daniel Romero

机构 * Dept. of Information and Communication Technology, University of Agder(信息与通信技术系,阿格德大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的估计器,利用跨环境的空间模式学习信道增益地图,减少测量次数,提升学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10738 2026-05-12 math.OC cs.MA cs.RO cs.SY eess.SY 50%

Decentralized Contingency MPC based on Safe Sets for Nonlinear Multi-agent Collision Avoidance

基于安全集的非线性多智能体碰撞避障的去中心化应急MPC

Max Studt, Georg Schildbach

机构 * Institute for Electrical Engineering in Medicine, University of Luebeck, Luebeck, Germany(医学电气工程研究所,吕贝克大学,吕贝克,德国)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于安全集的去中心化应急MPC框架,实现非线性多智能体在仅状态信息下的碰撞避免,通过局部优化问题和应急证书保证递归可行性与收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10367 2026-05-12 cs.IR 50%

AgentGR: Semantic-aware Agentic Group Decision-Making Simulator for Group Recommendation

AgentGR: 基于语义的群体决策模拟器用于群体推荐

Yangtao Zhou, Wenhao You, Hua Chu, Shihao Guo, Jianan Li, Zhifu Zhao, Qingshan Li

专题命中 规划推理 :reasoning(abstract)

AI总结 AgentGR通过结合语义推理和群体动态模拟,提升群体推荐的准确性与决策模拟能力,采用链式偏好推理机制和多智能体策略改进用户偏好和群体互动模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10013 2026-05-12 cs.HC cs.CR 50%

When Are LLM Inferences Acceptable? User Reactions and Control Preferences for Inferred Personal Information

当大语言模型的推断何时是可接受的?用户对推断个人信息的反应及对控制的偏好

Kyzyl Monteiro, Minjung Park, Alexander Ioffrida, Angelina Sanna, Hao-Ping, Lee, Niloofar Mireshghallah, Yang Wang, Sauvik Das

专题命中 规划推理 :planning(abstract)

AI总结 研究探讨了用户对大语言模型推断个人信息的反应及控制偏好,发现用户对推断信息的接受度受内容和上下文规范影响,而非单纯内容本身。

Comments 20 pages including appendix; 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09925 2026-05-12 cs.CV 50%

Frequency Adapter with SAM for Generalized Medical Image Segmentation

基于SAM的频率适应器用于通用医学图像分割

Phuoc-Nguyen Bui, Van-Nguyen Pham, Duc-Tai Le, Junghyun Bum, Hyunseung Choo

机构 * Sungkyunkwan University, Korea(成均馆大学,韩国)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出FSAM框架,结合LoRA和频率适配器提升医学图像分割的域泛化能力,通过提取域不变高频特征缓解频率相关域偏移。

Comments Under review, 10 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17979 2026-05-12 cs.IR 50%

Architecture Matters More Than Scale: A Comparative Study of Retrieval and Memory Augmentation for Financial QA Under SME Compute Constraints

架构比规模更重要:在中小企业计算限制下的金融问答中检索与记忆增强的比较研究

Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan

专题命中 规划推理 :reasoning(abstract)

AI总结 本文在中小企业计算限制下比较了检索增强生成和记忆增强推理架构,发现结构化记忆在确定性任务中更精确,而检索方法在对话场景中表现更优,提出混合部署框架以平衡准确性、可审计性和效率。

Comments Accepted at the 2026 6th International Conference on Artificial Intelligence and Industrial Technology Applications (AIITA 2026), to be published by IEEE. 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07686 2026-05-12 cs.RO cs.CV 50%

UniUncer: Unified Dynamic Static Uncertainty for End to End Driving

UniUncer: 统一的动态静态不确定性用于端到端驾驶

Yu Gao, Jijun Wang, Zongzheng Zhang, Anqing Jiang, Yiru Wang, Yuwen Heng, Shuo Wang, Hao Sun, Zhangfeng Hu, Hao Zhao

机构 * Bosch Corporate Research(博世企业研究)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出UniUncer,一种轻量级统一不确定性框架,用于端到端驾驶规划中同时估计和利用静态和动态场景元素的不确定性,通过概率回归器、不确定性融合模块和不确定性感知门控模块,降低轨迹误差并提升整体性能。

Comments Accepted ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13107 2026-05-12 cs.RO 50%

Towards Robust Surgical Automation via Digital Twin Representations from Foundation Models

通过基础模型生成的数字孪生表示实现鲁棒的手术自动化

Hao Ding, Lalithkumar Seenivasan, Hongchao Shu, Grayson Byrd, Han Zhang, Pu Xiao, Juan Antonio Barragan, Russell H. Taylor, Peter Kazanzides, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于数字孪生的感知方法,结合LLM代理与dVRK平台,实现手术任务规划的鲁棒性与泛化能力,为手术自动化提供新的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09185 2026-05-12 cs.CE 50%

AutoRedTrader: Autonomous Red Teaming of Trading Agents through Synthetic Misinformation Injection

AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试

Zhiwei Liu, Yangyang Yu, Yupeng Cao, Yuechen Jiang, Haohang Li, Zhuoran Lu, Yuyan Wang, Yixiang Zheng, Xiaorui Guo, Calvin Yixiang Cheng, Sophia Ananiadou

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09132 2026-05-12 cs.CV 50%

KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection

KEPIL: 基于知识增强的提示-图像学习用于提示鲁棒疾病检测

Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou, Robert Berke, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(放射肿瘤科、Inselspital伯尔尼大学医院及伯尔尼大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 KEPIL通过整合 curated 医学知识,提升零样本推理性能,采用动态提示增强、语义感知对比损失和实体中心报告标准化方法,在多个基准测试中实现 state-of-the-art 成绩,提升 AUC 6.37% 在 CheXpert 上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01194 2026-05-12 cs.CV 50%

EMFormer: Efficient Multi-Scale Transformer for Accumulative Context Weather Forecasting

EMFormer:高效的多尺度Transformer用于累积上下文天气预测

Hao Chen, Tao Han, Jie Zhang, Song Guo, Fenghua Ling, Lei Bai

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学计算机科学与工程系) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EMFormer,通过单次卷积提取多尺度特征,结合累积上下文微调和复合损失函数,提升天气预测精度并减少计算开销。

Comments This paper has been accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08385 2026-05-12 cs.CR 50%

Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection

可量化不确定性:一种随机一致性多智能体RAG框架用于鲁棒恶意软件检测

ElMouatez Billah Karbab

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出MAGMA框架,通过语义代码检索与概率验证分离恶意软件分析,引入随机一致性集合和两个互补指标,提升恶意软件检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08207 2026-05-12 cs.CV 50%

A Breast Vision Pathology Foundation Model for Real-world Clinical Utility

乳腺病理科基础模型用于真实世界临床应用

Yingxue Xu, Zhengyu Zhang, Xiuming Zhang, Mengwei Xu, Fengtao Zhou, Yihui Wang, Jiabo Ma, Yi Xin, Danyi Li, Chengyu Lu, Zhijian Cen, Ying Tan, Qingbing Yao, Qi Wang, Zizhao Gao, Yong Zhang, Jingjing Chen, Feifei Liu, Qian Xu, Yi Dai, Hongxuan Tan, Cheng Jin, Huajun Zhou, Zhengrui Guo, Ling Liang, Hongyi Wang, Yingcong Chen, Xi Wang, Zhenhui Li, Ronald Cheong Kin Chan, Ning Mao, Muyan Cai, Zhe Wang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(南方医科大学基础医学学院病理学系,广州医院) Department of Pathology, The First Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, China(浙江大学医学院第一附属医院病理学系,杭州) State Key Laboratory of Holistic Integrative Management of Gastrointestinal Cancers, Department of Pathology, School of Basic Medicine and Xijing Hospital, Fourth Military Medical University, Xi’an, China(胃肠癌整体整合管理国家重点实验室,第四军医大学基础医学学院病理学系,西京医院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出BRAVE模型,通过101638张乳腺全切片图像评估其在乳腺癌诊断中的临床实用性,展示了在不同阶段的病理评估中提升诊断效率和准确性的能力。

Comments 60 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 26 篇

2605.09719 2026-05-12 cs.CV cs.AI 90%

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

将3D空间推理蒸馏到轻量级视觉-语言模型中:利用推理链

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

专题命中 视觉空间推理 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出一种知识蒸馏框架,将7B教师模型的3D空间推理能力转移到2.29B学生模型,实现8.7倍更低的推理延迟和3倍模型压缩,同时保留54-72%的性能。引入隐藏推理链提升推理能力,学生模型联合执行空间描述、深度估计和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09906 2026-05-12 cs.AI cs.SD 88%

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

先分后融:通过模态特定的推理链减轻音频视觉大语言模型中的跨模态干扰

Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

机构 * Tianjin Key Laboratory of Cognitive Computing(天津认知计算实验室) Tianjin University(天津大学) Huiyan Technology Company, Ltd.(慧颜科技有限公司) Chinese Academy of Sciences(中国科学院) Tencent(腾讯)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本文提出SFFL框架,通过模态特定的推理链减少跨模态干扰,提升音频视觉问答的准确性和鲁棒性,实验显示在通用AVQA基准和跨模态幻觉基准上分别提升5.16%和11.17%。

详情

展开后加载摘要…

URL PDF HTML 收藏