arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1974 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1974 篇

2505.14999 2025-10-02 cs.LG cs.AI cs.CL stat.ML 88%

Learning to Rank Chain-of-Thought: Using a Small Model

Eric Hanchen Jiang, Haozheng Luo, Shengyuan Pang, Xiaomin Li, Zhenting Qi, Hengli Li, Cheng-Fu Yang, Zongyu Lin, Xinfeng Li, Hao Xu, Kai-Wei Chang, Ying Nian Wu

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17155 2025-06-03 cs.LG cs.AI cs.CL 88%

TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling

Weizhe Lin, Xing Li, Zhiyuan Yang, Xiaojin Fu, Hui-Ling Zhen, Yaoyuan Wang, Xianzhi Yu, Wulong Liu, Xiaosong Li, Mingxuan Yuan

机构 * Huawei Advanced Computing and Storage Lab(华为高级计算与存储实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12856 2026-07-15 cs.LG 新提交 88%

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

基于验证器的热能存储控制推理模型强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title);planning(abstract);分类 cs.LG

AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL 88%

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05593 2026-01-12 cs.LG 88%

PaCoRe: Learning to Scale Test-Time Compute with Parallel Coordinated Reasoning

PaCoRe: 通过并行协调推理学习扩展测试时间计算

Jingcheng Hu, Yinmin Zhang, Shijie Shang, Xiaobo Yang, Yue Peng, Zhewei Huang, Hebin Zhou, Xin Wu, Jie Cheng, Fanqi Wan, Xiangwen Kong, Chengyuan Yao, Kaiwen Yan, Ailin Huang, Hongyu Zhou, Qi Han, Zheng Ge, Daxin Jiang, Xiangyu Zhang, Heung-Yeung Shum

机构 * StepFun Tsinghua University(清华大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.LG

AI总结 PaCoRe通过并行协调推理框架,实现大规模测试时间计算扩展,提升数学推理能力至94.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23506 2026-01-06 cs.AI cs.HC 88%

Emotion-Coherent Reasoning for Multimodal LLMs via Emotional Rationale Verifier

通过情感推理验证器实现多模态大语言模型的情感一致性推理

Hyeongseop Rha, Jeong Hun Yeo, Yeonju Kim, Yong Man Ro

机构 * Corresponding author(通讯作者)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.AI

AI总结 本文提出情感推理验证器和解释奖励,通过引导模型生成与目标情绪一致的推理,提升多模态大语言模型在情绪识别中的解释准确性与一致性。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10481 2026-01-01 cs.CL 88%

xVerify: Efficient Answer Verifier for Reasoning Model Evaluations

xVerify:用于推理模型评估的高效答案验证器

Ding Chen, Qingchen Yu, Pengyuan Wang, Mengting Hu, Wentao Zhang, Zhengren Wang, Bo Tang, Feiyu Xiong, Xinchi Li, Chao Wang, Minchuan Yang, Zhiyu Li

机构 * China Telecom Research Institute(中国电信研究院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司) College of Software, Nankai University(南开大学软件学院) Center for Data Science, Peking University(北京大学数据科学中心) Peking University(北京大学) Data Development Center of China Telecom(中国电信数据开发中心)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

AI总结 xVerify是一种高效答案验证器,通过VAR数据集训练,能够准确评估推理模型的等价性判断和最终答案提取,实验表明其在多个任务中表现优异。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18896 2025-09-26 cs.CL 88%

ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs

Jiaru Zou, Ling Yang, Jingwen Gu, Jiahao Qiu, Ke Shen, Jingrui He, Mengdi Wang

机构 * UIUC(伊利诺伊大学香槟分校) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) ByteDance(字节跳动)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025. Project: https://github.com/Gen-Verse/ReasonFlux

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10449 2025-09-10 cs.LG 88%

M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models

Junxiong Wang, Wen-Ding Li, Daniele Paliotta, Daniel Ritter, Alexander M. Rush, Tri Dao

机构 * TogetherAI Cornell University(康奈尔大学) University of Geneva(日内瓦大学) Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);chain-of-thought(abstract);分类 cs.LG

Comments Code is available https://github.com/jxiw/M1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22148 2025-05-29 cs.AI 88%

What Makes a Good Reasoning Chain? Uncovering Structural Patterns in Long Chain-of-Thought Reasoning

Gangwei Jiang, Yahui Liu, Zhaoyi Li, Qi Wang, Fuzheng Zhang, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19000 2025-05-27 cs.CL cs.CV 88%

VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization

Yunxin Li, Xinyu Chen, Zitao Li, Zhenyu Liu, Longyue Wang, Wenhan Luo, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Alibaba International Group(阿里巴巴国际集团) Division of AMC and Department of ECE, HKUST(HKUST电子工程系与AMC division)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

Comments 19 pages, 9 figures, Project Link: https://github.com/HITsz-TMG/VerIPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00271 2025-02-04 cs.CL 88%

Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning

Fei Yu, Yingru Li, Benyou Wang

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24560 2026-08-04 cs.CL cs.AI 版本更新 88%

AdaThink-Med: Optimizing Inference-Time Compute for Medical Reasoning via Uncertainty Quantification

AdaThink-Med:通过不确定性量化优化医学推理的推理时计算

Shaohao Rui, Kaitao Chen, Weijie Ma, Xiaosong Wang

机构 * SJTU(上海交通大学) SII(上海信息所) Shanghai AI Lab(上海人工智能实验室) FDU(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdaThink-Med框架,通过不确定性引导长度校准优化医学推理的推理时计算,在六大医学基准上降低4.7-6.4倍推理token消耗且性能损失极小,无需外部分类器即可实现资源高效分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22938 2026-06-23 cs.LG cs.AI 新提交 88%

Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯

Stanley Wei, Juno Kim

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20075 2026-05-20 cs.CL cs.AI 88%

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07654 2026-05-11 stat.ML cs.CL cs.LG 88%

Reliable Chain-of-Thought via Prefix Consistency

通过前缀一致性提升可靠性的链式思维

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama

机构 * Nagoya University(名古屋大学) Nara Institute of Science and Technology(奈良科学技術大學) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP(理化学研究所(AIP))

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过前缀一致性来提升链式思维的可靠性,利用再生过程中答案的重复频率作为权重,无需访问token对数概率或自我评价提示,在多个模型和基准测试中表现出色,减少至21倍的token使用量。

Comments See our project page at https://naoto-iwase.github.io/prefix-consistency-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 88%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 测试时计算 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12118 2025-02-19 cs.LG cs.CL 88%

Scaling Test-Time Compute Without Verification or RL is Suboptimal

Amrith Setlur, Nived Rajaraman, Sergey Levine, Aviral Kumar

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);math reasoning(abstract);verifier(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11209 2026-06-11 cs.CL cs.AI cs.LG 新提交 88%

ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

Jingpei Wu, Xiao Han, Weixiang Shen, Boer Zhang, Zifeng Ding, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Harvard University(哈佛大学) University of Cambridge(剑桥大学) Mina AI Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))

专题命中 测试时计算 :reasoning(title,abstract);logical reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06347 2026-04-09 cs.CV 88%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract)

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 87%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);self-correction(abstract)

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新 87%

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);test-time compute(abstract);分类 cs.AI

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04179 2026-07-07 cs.CV cs.AI 新提交 87%

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Digital Media & Design Arts(数字媒体与设计艺术学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13517 2026-07-07 cs.CL 版本更新 87%

Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

深入思考,而非仅靠长度:通过深度思考令牌测量大语言模型推理工作量

Wei-Lin Chen, Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Google(谷歌)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 研究通过识别深度思考令牌量化推理时间工作量,在多个基准和模型上验证深度思考比例与准确率正相关,据此引入Think@n策略提升推理效率并降低成本。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05897 2026-05-28 cs.CL 87%

Stop Rewarding Hallucinated Steps: Faithfulness-Aware Step-Level Reinforcement Learning for Small Reasoning Models

停止奖励幻觉步骤:面向小型推理模型的忠实感知步骤级强化学习

Shuo Nie, Hexuan Deng, Chao Wang, Ruiyu Fang, Xuebo Liu, Shuangyong Song, Yu Li, Min Zhang, Xuelong Li

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Institute of Artificial Intelligence (TeleAI), China Telecom Corp Ltd(中国电信人工智能研究院) College of Integrated Circuits, Zhejiang University, Hangzhou, Zhejiang, China(浙江大学集成电路学院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对小型推理模型在中间推理步骤中容易产生忠实性幻觉的问题,提出忠实感知步骤级强化学习(FaithRL),通过过程奖励模型提供步骤级监督和隐式截断重采样策略,减少幻觉并提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26735 2026-05-27 cs.CL 87%

Rethinking the Multilingual Reasoning Gap with Layer Swap

通过层交换重新思考多语言推理差距

Maxence Lasbordes, Amélie Chatelain, Djamé Seddah

机构 * LightOn Inria(法国国家科学研究中心)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过构建多语言推理数据集并微调专家模型,发现本地推理与英语枢轴推理的性能差距远小于先前报道,并提出层交换方法将英语专家的推理中间层迁移到本地专家,以缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11262 2026-05-20 cs.LG 87%

Latent Chain-of-Thought Improves Structured-Data Transformers

潜在的链式思维提升结构化数据转换器

Carson Dudley, Samet Oymak

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);test-time compute(abstract)

AI总结 本文研究了链式思维对时间序列和表格数据的影响,并提出了一种递归方案,通过压缩查询位置的隐藏状态生成反馈标记,从而在预测前进行多次潜在计算,从而提升结构化数据转换器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11202 2026-05-14 cs.LO cs.AI 87%

interwhen: A Generalizable Framework for Steering Reasoning Models with Test-time Verification

interwhen:一种可泛化的引导推理模型进行测试时验证的框架

Vishak K Bhat, Prateek Chanda, Vijval Ekbote, Ashmit Khandelwal, Maitreyi Swaroop, Vineeth N. Balasubramanian, Subbarao Kambhampati, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research(微软研究院) IIT Bombay(印度理工学院班加罗尔分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(summary_cn,abstract);分类 cs.AI

AI总结 interwhen提出一种单轨迹验证框架,通过反馈中间推理轨迹引导模型行为,解决验证状态获取和 verifier 缺乏的问题,提升推理代理的任务完成和政策合规性。

Comments 56 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 87%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 87%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏