arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 15 篇

2605.22361 2026-05-22 eess.SP 50%

Propagation-Consistent Wireless Environment Digital Twin Construction Under Sparse Measurements

基于稀疏测量的无线环境数字孪生构建:传播一致性

Junjie Ai, Shurui Xu, Yanqing Ren, Zhuoyu Liu, Weicong Chen, Wankai Tang, Xiao Li, Chao-Kai Wen, Shi Jin

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种无线环境数字孪生(WEDT)构建方法,通过校准场景级电磁特性场,将重建的几何数字孪生转化为传播一致的无线环境表示,实现了从稀疏测量到密集概率监督的转换,并展示了其在不同场景下的有效性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22328 2026-05-22 cs.CV 50%

3D LULC classification using multispectral LiDAR and deep learning: current and prospective schemes

基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类:当前和未来方案

Narges Takhtkeshha, Aldino Rizaldy, Markus Hollaus, Juha Hyyppä, Fabio Remondino, Gottfried Mandlburger

机构 * D Optical Metrology (3DOM) Unit, Bruno Kessler Foundation (FBK)(3D光学计量(3DOM)单元,布鲁诺·凯塞尔基金会(FBK)) Department of Geodesy and Geoinformation, TU Wien(测绘与地理信息系,维也纳技术大学) Helmholtz-ZentrumDresden-Rossendorf (HZDR), Helmholtz Institute Freiberg for Resource Technology (HIF)(德累斯顿-罗斯托克赫尔姆霍尔茨研究中心(HZDR),资源技术赫尔姆霍尔茨研究所(HIF)) Freie Universität Berlin, Remote Sensing and Geoinformatics(柏林自由大学,遥感与地理信息学) Department of Remote Sensing and Photogrammetry, Finnish Geospatial Research Institute FGI, The National Land Survey of Finland(芬兰地理研究所(FGI),芬兰国家土地测绘局)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于多光谱LiDAR和深度学习的3D土地利用/覆盖分类方法,介绍了NMCA对齐的L1和L2分类方案,并引入了一个新的多光谱LiDAR基准数据集,评估了七种最先进的深度学习模型,并展示了光谱信息对分类性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22144 2026-05-22 cs.CV 50%

One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems

一句话,一出戏剧:通过多智能体系统实现个性化短剧生成

Yufei Shi, Weilong Yan, Naixuan Huang, Yucheng Chen, Chenyu Zhang, Tao He, Si Yong Yeo, Ming Li

机构 * MedVisAI Lab, Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室,李光前医学院,南洋理工大学) National University of Singapore(新加坡国立大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种多智能体框架,通过结构化中间模块和迭代优化,将用户的单句想法转化为完整短剧,解决了短剧生成中的叙事节奏、空间一致性及生产质量控制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21788 2026-05-22 cs.CV cs.RO 50%

SceneGraphGrounder: Zero-Shot 3D Visual Grounding via Structured Scene Graph Matching

SceneGraphGrounder: 通过结构化场景图匹配实现零样本3D视觉定位

Xuefei Sun, Xujia Zhang, Brendan Crowe, Doncey Albin, Christoffer Heckman

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SceneGraphGrounder框架,通过结构化场景图匹配将3D定位问题转化为结构化图匹配问题,利用视觉标记提示策略从2D视图推断物体间关系,并在3D场景图中建立持久编码,从而在ScanRefer基准测试中实现了零样本条件下与现有方法相当的性能,并在真实机器人部署中验证了其在长周期物理环境中的鲁棒空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 10 篇

2605.21810 2026-05-22 cs.AI cs.MA 79%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23224 2026-05-22 cs.CV 78%

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3:长视频多跳推理的原生交错线索搜索

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 本研究提出Video-o3框架,通过迭代发现显著视觉线索、细粒度检查关键片段以及适应性终止,提升长视频多跳推理能力,实验表明其在MLVU和Video-Holmes上分别达到72.1%和46.5%的准确率。

Comments 27 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22156 2026-05-22 cs.LG cs.AI 73%

One-Way Policy Optimization for Self-Evolving LLMs

单向策略优化用于自演化大语言模型

Shuo Yang, Jinda Lu, Kexin Huang, Chiyu Ma, Shaohang Wei, Yuyang Liu, Guoyin Wang, Jingren Zhou, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Dartmouth College(达特茅斯学院) Alibaba(阿里巴巴)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单向策略优化方法,通过解耦优化方向与更新幅度,解决传统方法中验证器奖励稀疏导致的训练不稳定问题,实现大语言模型的持续自演化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21996 2026-05-22 cs.SE cs.AI 70%

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

从片段到轨迹:软件工程代理的特权过程监督

Murong Ma, Tianyu Chen, Yun Lin, Shuai Lu, Qinglin Zhu, Yeyun Gong, Zhiyong Huang, Peng Cheng, Yan Lu, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) King’s College London(伦敦国王学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出Patches-to-Trajectories (P2T)方法,通过利用开发者撰写的参考补丁来改进软件工程代理的训练过程,提高训练效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21980 2026-05-22 cs.CV cs.AI 70%

Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow

通过跨模态信息流解读并增强大视觉-语言模型中的情感电路

Chengsheng Zhang, Chenghao Sun, Zhining Xie, Xinmei Tian

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception(脑启发智能感知与认知MOE实验室) Cognition, University of Science(认知,科学大学) AIPD, Tencent(AIPD,腾讯)

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于转向向量的因果归因框架,用于描述性情感推理,通过构建专用数据集揭示了三阶段'适应-聚合-执行'机制下的情感电路,发现视觉情感线索在中间层通过情感特定的注意力头进行聚合,随后在深层通过情感通用路径转换为叙述生成,并通过调控情感信息路由增强注意力流和语义激活,从而提升性能并缓解情感幻觉。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI 62%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16299 2026-05-22 cs.SE cs.AI 57%

ACE: Self-Evolving LLM Coding Framework via Adversarial Unit Test Generation and Preference Optimization

ACE:通过对抗性单元测试生成和偏好优化的自进化LLM编码框架

Yixu Huang, Xinglei Yu, Zhongyu Wei

机构 * School of Data Science Fudan University(数据科学学院 复旦大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出ACE框架,通过基于求解器-对抗架构的执行中心监督,实现自进化代码生成,无需真实代码或外部奖励模型,实验表明其在CodeContests、MBPP和LiveCodeBench上均优于现有求解器-验证器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07243 2026-05-22 cs.CL 57%

SpecBlock: Block-Iterative Speculative Decoding with Dynamic Tree Drafting

SpecBlock:带有动态树草案的块迭代推测解码

Weijie Shi, Qiang Xu, Fan Deng, Yaguang Wu, Jiarun Liu, Yehong Xu, Hao Chen, Jia Zhu, Jiajie Xu, Xiangjun Huang, Jian Yang, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) MetaX Zhejiang Normal University(浙江师范大学) Soochow University(苏州大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究提出了一种结合路径依赖性和低成本草案的块迭代草案方法SpecBlock,通过动态树草案和路径依赖机制提高LLM推理效率,同时在部署时利用验证器反馈进行成本感知适应,从而在速度和成本上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04708 2026-05-22 cs.CL 57%

Accelerated Test-Time Scaling with Model-Free Speculative Sampling

加速测试时间缩放与模型无关的推测采样

Woomin Song, Saket Dingliwal, Sai Muralidhar Jayanthi, Bhavana Ganesh, Jinwoo Shin, Aram Galstyan, Sravan Babu Bodapati

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室) AirSignal

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出STAND,一种无需模型的推测解码方法,通过利用推理轨迹中的冗余性,显著提升推理效率而不牺牲准确性,经多个模型和任务评估,STAND在保持准确性的同时将推理延迟降低了60-65%。

Comments EMNLP 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19192 2026-05-22 cs.AI cs.CR 57%

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

幻觉作为利用:证据承载多模态智能体

Guijia Zhang, Hao Zheng, Harry Yang

机构 * Shenzhen University(深圳大学) HKUST(香港科技大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文研究了多模态智能体中幻觉导致授权失败的问题,提出证据承载多模态智能体(ECA)方法,通过分解工具调用、获取类型证书并使用确定性门控来授权,从而将模型的模糊信念转换为可审计的残余,提高了系统的安全性。

Comments 23 pages, 6 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 9 篇

2605.22658 2026-05-22 cs.CV cs.LG cs.MM eess.IV 87%

SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation

SegCompass: 探索通过稀疏自编码器实现可解释对齐以增强推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(美团,北京) University of Chinese Academy of Sciences(中国科学院大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出SegCompass,一种通过稀疏自编码器实现可解释对齐的端到端模型,以提升推理分割的性能和可解释性。

Comments Accepted by CVPR 2026. 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22072 2026-05-22 cs.CL cs.CV 79%

Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention

Faithful-MR1: 通过锚定和强化视觉注意力实现忠实的多模态推理

Changyuan Tian, Zhicong Lu, Huaxing Liu, Xiang Wang, Shuai Li, Yu Chen, Wenqian Lv, Zichuan Lin, Juncheng Diao, Deheng Ye

机构 * AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Faithful-MR1框架,通过锚定和强化视觉注意力解决多模态推理中的忠实性问题,提升模型在多模态基准上的表现。

Comments 20 pages, 7 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05094 2026-05-22 cs.CV 78%

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

VChain:用于视频生成中推理的视觉思维链

Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu

机构 * eyeline-labs(Eyeline Labs)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出VChain,一种在视频生成中引入多模态模型视觉推理信号的新型推理时间视觉思维链框架,通过生成关键帧来指导预训练视频生成器的稀疏推理时间视觉状态适应,从而提升视频生成质量。

Comments ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08872 2026-05-22 cs.LG cond-mat.dis-nn cond-mat.stat-mech 70%

How does Chain of Thought decompose complex tasks?

链式思维如何分解复杂任务?

Amrut Nadgir, Vijay Balasubramanian, Pratik Chaudhari

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文研究了链式思维在复杂任务分解中的作用,发现通过将任务分解为多个小分类问题可以显著降低预测误差,并确定了分解深度的最优阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22786 2026-05-22 cs.AI cs.ET cs.LG cs.MA 62%

LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems

LCGuard: 多智能体系统中安全KV共享的潜在通信守护者

Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LCGuard框架,通过在智能体间共享KV缓存前学习表示层面的转换,以防止敏感信息泄露,同时在多个模型家族和多智能体基准测试中验证了其在减少重建攻击成功率和保持任务性能方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21625 2026-05-22 cs.CV cs.AI cs.CL 62%

Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly

Flat-Pack Bench: 通过家具组装评估大视觉-语言模型的时空理解

Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技) MBZUAI(麦吉尔-伯克利-浙江大学人工智能研究院) UC Berkeley(伯克利大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Flat-Pack Bench基准,用于评估大视觉-语言模型在复杂视频场景中的时空理解能力,发现当前模型在细粒度时空推理上存在显著不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22238 2026-05-22 cs.AI 57%

Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play

评估大型语言模型作为实时战略代理:提供商性能、混合分解及时间风险游戏中的操作差距

H. C. Ekne

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在实时策略环境中的表现,发现其性能受目标跟踪、执行转换、成本和运行时可靠性等因素影响,支持将LLM作为受限制工作流中的组件进行评估,而非孤立的基准测试对象。

Comments 13 pages, 7 figures. Code and tracked notes: https://github.com/hcekne/risk-game . Public runtime artifact index: https://github.com/hcekne/risk-game/blob/main/docs/article-plans/public_experiment_artifacts.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11739 2026-05-22 cs.CL 57%

Learning to Foresee: Unveiling the Unlocking Efficiency of On-Policy Distillation

学习预见:揭示在线蒸馏的解锁效率

Yuchen Cai, Ding Cao, Liang Lin, Chunxi Luo, Xin Xu, Kai Yang, Weijie Liu, Saiyong Yang, Tianxiang Zhao, Guangzhong Sun, Guiquan Liu, Junfeng Fang

机构 * USTC(中国科学技术大学) Tencent(腾讯) NUS(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) UCAS-IIE(中国科学技术大学国际交流学院) SHU(上海大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了在线蒸馏(OPD)的效率来源,提出EffOPD方法通过适应性选择 extrapolation 步长和沿当前更新方向移动来加速OPD,实现了3倍的训练加速同时保持最终性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21821 2026-05-22 cs.AI 57%

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

PHYSICS:在大学物理问题求解中基准测试基础模型

Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学) Notre Dame University(诺特丹大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PHYSICS基准测试,用于评估大学水平物理问题求解能力,包含1297个专家标注的问题,涵盖六个核心领域,并通过自动化评估系统揭示了领先基础模型的显著局限性。

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 45 篇

2605.21856 2026-05-22 cs.LG cs.AI 93%

The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation

推理的幻觉:通过零CoT截断揭示LLM中的逃避数据污染

Yifan Lan, Yuanpu Cao, Hanyu Wang, Lu Lin, Jinghui Chen

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出零CoT探针(ZCP)方法,通过截断整个推理过程来暴露模型中的潜在捷径映射,以检测LLM中的直接和逃避数据污染,提出了 contamination confidence 指标来量化污染的可能性和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12506 2026-05-22 cs.LG 90%

On Robustness and Chain-of-Thought Consistency of RL-Finetuned VLMs

关于RL微调VLMs的鲁棒性和链式思维一致性

Rosie Zhao, Anshul Shah, Xiaoyu Zhu, Xinke Deng, Zhongyu Jiang, Yang Yang, Joerg Liebelt, Arnab Mondal

机构 * Apple(苹果公司) OpenAI

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文研究了RL微调VLMs在视觉推理任务中的鲁棒性和链式思维一致性,发现文本扰动和CoT不一致会显著降低模型的鲁棒性和信心,而闭源模型在保持鲁棒性和推理一致性方面表现更佳,指出这一差距源于当前开源RL微调的不足而非任务本身的限制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22012 2026-05-22 cs.CL cs.CV 87%

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解

Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) HKUST(香港科技大学) CASIA(中国科学院自动化研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00319 2026-05-22 cs.LG cs.AI 86%

DecepChain: Inducing Deceptive Reasoning in Large Language Models

DecepChain: 在大型语言模型中诱导欺骗性推理

Wei Shen, Han Wang, Haoyu Li, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究探讨了大型语言模型是否能够生成看似合理但错误的推理链,并提出DecepChain方法通过放大模型自身的幻觉来诱导欺骗性推理,同时保持表面合理性和有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22389 2026-05-22 cs.CL 83%

Unified Data Selection for LLM Reasoning

统一的数据选择用于LLM推理

Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出了一种无需训练的高熵和(HES)指标,用于评估和选择高质量的推理样本,通过在三种主流训练范式(监督微调、拒绝微调和强化学习)中验证,证明了其在提高LLM推理性能和减少计算开销方面的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22109 2026-05-22 cs.AI cs.CV cs.CY 81%

Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?

感知还是偏见:大语言模型能否超越个性的第一印象?

Caixin Kang, Tianyu Yan, Sitong Gong, Mingfang Zhang, Liangyang Ouyang, Ruicong Liu, Bo Zheng, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI 研究所东京) Dalian University of Technology(大连理工大学)

专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨了多模态大语言模型(MLLMs)在感知个性方面的能力,提出了一种新的任务Grounded Personality Reasoning(GPR),并构建了一个新的数据集MM-OCEAN,通过三重评估体系揭示了MLLMs在人格推理中的偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21606 2026-05-22 cs.LG cs.AI 81%

When Are Teacher Tokens Reliable? Position-Weighted On-Policy Self-Distillation for Reasoning

何时教师标记可靠?用于推理的基于位置加权的在线自我蒸馏

Xiaogeng Liu, Xinyan Wang, Yingzi Ma, Yechao Zhang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于位置加权的在线自我蒸馏方法,用于改进推理任务中教师标记的可靠性,通过引入分支可行性诊断来识别教师标记的可靠性,并在不同模型上验证了其有效性。

Comments Pre-print. Code is available at https://github.com/SaFo-Lab/PW-OPSD

详情

展开后加载摘要…

URL PDF HTML 收藏