arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-16 至 2026-06-16 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 62 篇

2606.16313 2026-06-16 cs.RO cs.AI 新提交 57%

Is Your Trajectory Displacement Safe in Long-tail?

你的轨迹位移在长尾场景中安全吗?

Qiao Sun, Weicheng Zheng, Yixin Huang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出FluidTest评估框架,通过成对WebUI协议、32种语义威胁分类和三元验证系统,检测规划轨迹相对于专家参考的额外威胁,实验发现SOTA规划器仍存在大量安全相关失败。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16153 2026-06-16 cs.CV cs.AI 新提交 57%

A Comprehensive Survey of Medical Image Segmentation: Challenges, Benchmarks, and Beyond

医学图像分割综述:挑战、基准与未来展望

Pengyu Zhu, Xiaojing Zhang, Kunbo Zhang, Chunyan Zhang, Zhenyu Wang

机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) SPIC Digital Technology Co., Ltd(国家电投数字科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department 6 of Health Care, Second Medical Center, People’s Liberation Army General Hospital(中国人民解放军总医院第二医学中心健康医学科六病区)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文系统综述了基于U-Net、Transformer和SAM架构的医学图像分割方法,分析主要挑战,旨在指导未来研究并推动临床转化。

Comments 12 pages,3 figures,1 table. All related resources are available at https://github.com/andrew-pengyu/Awsome_MedSeg/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15611 2026-06-16 cs.CV cs.AI 新提交 57%

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation

双基础模型的相互蒸馏用于半监督PET/CT分割

Fuyou Mao, Beining Wu, Yanfeng Jiang, Bohan Xu, Lixin Lin, Naye Ji, Hao Zhang, Yan Tang

机构 * Central South University(中南大学) Hangzhou Dianzi University(杭州电子科技大学) Communication University of Zhejiang(浙江传媒学院) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出MuDuo框架,利用SAM-Med3D和SegAnyPET分别从CT和PET中蒸馏知识到轻量学生网络,实现半监督器官分割,仅用5个标注样本在AutoPET数据集上达到最优性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14778 2026-06-16 cs.CV cs.AI 新提交 57%

FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration

FactCheck: 基于多智能体协作的可行性感知长期动作预测

Rui Cao, Jiannong Cao, Bo Yuan, Zhiyuan Wen, Mingjin Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) China Mobile(中国移动)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 提出FactCheck多智能体框架,通过闭环“观察-规划-验证”机制,结合历史动作图验证可行性,在EPIC-Kitchens-55和EGTEA Gaze+上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18960 2026-06-16 cs.LG cs.CV cs.RO 版本更新 57%

AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention

AVA-VLA: 通过主动视觉注意力改进视觉-语言-动作模型

Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu

机构 * LiAuto Inc.(LiAuto公司) Beijing University of Technology(北京理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对VLA模型忽视历史信息的问题,提出AVA-VLA框架,利用循环状态近似信念并引入主动视觉注意力动态重加权视觉令牌,在LIBERO和CALVIN等基准上取得最优性能。

Comments Accepted at CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10047 2026-06-16 cs.SE cs.AI cs.HC 57%

Toward Epistemic Stability: Engineering Consistent Procedures for Industrial LLM Hallucination Reduction

迈向认知稳定性:为工业大语言模型幻觉减少设计一致的程序

Brian Freeman, Adam Kicklighter, Matt Erdman, Zach Gordon

机构 * Trane Technologies(特纳技术公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出并比较了五种提示工程策略,旨在减少模型输出的方差,实现可重复、基于事实的结果。通过LLM-as-Judge框架评估,M4在100次试验中均表现最佳,M2在v2版本中提升显著。

Comments 50 pages, 5 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02863 2026-06-16 cs.AI 版本更新 57%

EMS: Multi-Agent Voting via Efficient Majority-then-Stopping

EMS: 通过高效多数决后停止的多智能体投票

Yiqing Liu, Hantao Yao, Wu Liu, Yongdong Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出EMS方法,通过可靠性感知调度和自适应增量投票,在保持多数投票准确性的同时,平均减少35%的智能体调用和44%的令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01696 2026-06-16 cs.CV cs.AI 版本更新 57%

Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

跨模态身份映射:通过强化学习最小化模态转换中的信息损失

Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团(阿里巴巴)) The University of Hong Kong(香港大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出跨模态身份映射(CIM)框架,利用强化学习优化图像描述,通过检索一致性度量信息损失,无需额外标注,显著提升关系推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17431 2026-06-16 cs.CL 版本更新 57%

Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning

用于搜索的智能体强化学习使指令微调对齐失效

Yushi Yang, Shreyansh Padarha, Sarah Ball, Andrew Lee, Adam Mahdi

机构 * University of Oxford(牛津大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Harvard University(哈佛大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16972 2026-06-16 cs.RO cs.SY eess.SY 新提交 50%

When Should a Robot Replan? Regret-Guided Update Scheduling in Time-Varying MDPs

机器人何时应重新规划?时变MDP中的遗憾引导更新调度

Negin Musavi, Gokul Puthumanaillam, Ruben Hernandez, William Schafer, Melkior Ornik

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :planning(abstract)

AI总结 针对时变环境下机器人因预算限制无法持续重规划的问题,提出基于动态遗憾的在线更新调度规则,在仿真和实物实验中优于固定预算基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16907 2026-06-16 cs.DC 新提交 50%

Tangram: Hiding GPU Heterogeneity for Efficient LLM Parallelization

Tangram: 隐藏GPU异构性以实现高效的大语言模型并行化

Yanda Tao, Pedro F. Silvestre, Marcel Wagenländer, Peter Pietzuch

专题命中 规划推理 :planning(abstract)

AI总结 提出Tangram系统,通过将并行化规划与GPU异构性解耦,利用同构GPU岛和模型切片组合成工作平衡流水线,实现现有异构不可知并行化器在异构集群中的高效使用,训练吞吐量提升高达2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16600 2026-06-16 cs.RO 新提交 50%

WaveSync: Constrained Wavefront Optimization for Synchronized Co-Speech Gestures in Humanoid Robots

WaveSync: 面向人形机器人同步共语手势的约束波前优化

Thang Tran Viet, Thanh Nguyen Canh, Gia Huy Uong, Phuc Van Dinh, Tan Viet Tuyen Nguyen, Xiem HoangVan, Nak Young Chong

机构 * University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) School of Information Science, Japan Advanced Institute of Science and Technology(日本先端科学技术大学院大学信息科学学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 规划推理 :planning(abstract)

AI总结 提出WaveSync框架,利用大语言模型分解语义并构建重要性波,通过动态运动基元生成手势轨迹,再经波前优化实现手势与语音的峰值同步,同时满足运动学约束,在五组对话场景中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 50%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 规划推理 :planning(abstract)

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15550 2026-06-16 cs.RO 新提交 50%

Robots as Tokens: Unified Diffusion Transformer for Coordinated Multi-Robot Trajectory Generation

机器人作为令牌:面向协调多机器人轨迹生成的统一扩散Transformer

Ruofei Bai, Jie Chen, Yuxin Cai, Jun Li, Wei-Yun Yau, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research(新加坡科技研究局) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出Roken框架,将每个机器人表示为离散令牌,通过扩散Transformer直接生成满足安全和连通性约束的多机器人轨迹,无需迭代后处理。

Comments 23 pages, 13 figures; \textbf{Project page:} \href{https://bairuofei.github.io/roken-project-page/}{\texttt{bairuofei.github.io/roken-project-page}}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14808 2026-06-16 eess.IV cs.CV cs.IT math.IT 新提交 50%

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

面向AI原生6G网络的可解释任务导向Token通信

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

机构 * IEEE

专题命中 规划推理 :reasoning(abstract)

AI总结 提出ET-TokenCom框架,通过跨模态注意力融合视觉Token与任务Token,实现可解释的任务导向图像通信,解决Token表示不足、协作差和可解释性低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03505 2026-06-16 cs.SE 版本更新 50%

LATS-RCA: Language Agent Tree Search for Root Cause Analysis in Microservices

LATS-RCA:面向微服务根因分析的语言智能体树搜索

Alexander Naakka, Yuqing Wang, Mika V Mäntylä

专题命中 规划推理 :reasoning(abstract)

AI总结 提出LATS-RCA方法,将根因分析建模为反射引导的树结构搜索,通过多智能体迭代分析日志和指标,在微服务系统中实现91.3%的诊断准确率,并验证了模型无关性。

Comments Accepted at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14401 2026-06-16 cs.IR 版本更新 50%

LLM-Driven Usefulness Judgment for Web Search Evaluation

LLM驱动的网络搜索评估中的有用性判断

Mouly Dewan, Jiqun Liu, Aditya Gautam, Chirag Shah

专题命中 规划推理 :reasoning(abstract)

AI总结 提出TRUE方法,利用LLM结合用户行为信号评估文档有用性,通过迭代采样和推理建模搜索行为,实验表明LLM能生成中等有用性标签,微调后判断更准确。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 23 篇

2606.16783 2026-06-16 cs.CV cs.AI cs.LG 新提交 91%

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

Gen-VCoT: 基于扩散的RGB中间表示的生成式视觉思维链推理

Zhiqiang Zhou, Junliang Dai, Xu ling

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出Gen-VCoT框架,利用专家视觉模型生成RGB图像作为推理中间步骤,通过自适应路由器选择推理深度,在空间和深度问题上分别提升25%和50%,但简单事实查询性能下降,表明最优表示依赖于任务。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05248 2026-06-16 cs.RO 版本更新 87%

LaST$_{0}$: Latent Spatio-Temporal Chain-of-Thought for Robotic Vision-Language-Action Model

LaST$_{0}$:面向机器人视觉-语言-动作模型的潜在时空思维链

Zhuoyang Liu, Jiaming Liu, Hao Chen, Jiale Yu, Ziyu Guo, Chengkai Hou, Chenyang Gu, Xiangju Mi, Renrui Zhang, Kun Wu, Zhengping Che, Jian Tang, Pheng-Ann Heng, Shanghang Zhang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract)

AI总结 提出LaST$_0$框架,通过潜在时空思维链在隐空间进行高效推理,避免显式推理的延迟和语言瓶颈,在10个真实世界任务中平均成功率提升13%-14%。

Comments Project page: https://vla-last0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09669 2026-06-16 cs.AI cs.CL 新提交 86%

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14795 2026-06-16 cs.CV 新提交 82%

Position: The Systemic Lack of Agency in Visual Reasoning

立场:视觉推理中系统性的能动性缺失

Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang

机构 * National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence, School of Computer Science, Wuhan University(武汉大学计算机学院人工智能研究所多媒体软件工程研究中心) Hubei Key Laboratory of Multimedia(湖北省多媒体与网络通信工程重点实验室) Zhongguancun Academy, Beijing, China. 100094(中关村学院,北京,中国) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) Shanda AI Research Tokyo(上海大势人工智能研究东京)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文指出当前视觉语言模型因缺乏自主探索能力而无法进行隐式推理,并提出V-IRD基准来评估这一能力,实验表明强语义识别不等同于主动视觉探索。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 82%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15749 2026-06-16 cs.CV cs.AI cs.SY eess.SY 新提交 79%

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

OmniTraffic:面向时空交通推理的可控生成流水线与基准

Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Lab(上海人工智能实验室) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。

Comments 34 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10384 2026-06-16 cs.AI 版本更新 79%

Beyond Scalars: Evaluating and Understanding LLM Reasoning via Geometric Progress and Stability

超越标量:通过几何进展和稳定性评估与理解LLM推理

Xinyan Jiang, Ninghao Liu, Di Wang, Lijie Hu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TRACED框架,利用几何运动学将推理轨迹分解为进展和稳定性,揭示正确推理与幻觉的拓扑差异,实现鲁棒的推理质量评估。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15909 2026-06-16 cs.RO 新提交 78%

GeoTLM: Geometry-aware Tactile-Language Models for Contact Motion Orientation Reasoning of Dynamic Objects

GeoTLM: 面向动态物体接触运动方向推理的几何感知触觉语言模型

Qiutian Li, Zinan Liu, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出GeoTLM,通过可微几何表示(DGR)提取触觉剪切场中的几何先验,提升动态物体旋转和滑动方向推理能力,在旋转和滑动任务上分别提升14.6%和16.2%的准确率。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02506 2026-06-16 cs.CV 版本更新 78%

Question-Aware Evidence Ledgers for Video Relational Reasoning

问题感知的证据账本用于视频关系推理

Yilin Ou, Mengshi Qi, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出基于GPT-5.5视频QA求解器和问题感知证据账本的测试时推理流水线,通过显式化计数、空间、端点、视角和对话推理所需的目标、计数单位、参考帧及时间或空间范围,并利用外部工具作为证据源,最终在VRR-QA挑战上达到92.95%的整体准确率。

Comments Technical report for the VRR Challenge at the VideoLLMs Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17547 2026-06-16 cs.CV cs.IR cs.MM 版本更新 78%

A Comprehensive Survey of Knowledge-Based Vision Question Answering Systems: The Lifecycle of Knowledge in Visual Reasoning Task

基于知识的视觉问答系统综述:视觉推理任务中的知识生命周期

Jiaqi Deng, Zonghan Wu, Huan Huo, Guandong Xu

机构 * University Technology of Sydney(悉尼大学技术学院) East China Normal University(华东师范大学) Education University of Hong Kong(香港教育大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 综述基于知识的视觉问答(KB-VQA)方法,将其分为知识表示、检索和推理三个阶段,并探讨大语言模型带来的变革,指出未来研究方向。

Comments Accepted at TKDE, 20 pages, 5 figures, 4 tables

Journal ref IEEE Transactions on Knowledge and Data Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10840 2026-06-16 cs.CV 版本更新 71%

PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning

PoseGAM: 通过几何感知多视图推理实现鲁棒的未见物体姿态估计

Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka

机构 * KAUST(卡塔尔科技大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 提出PoseGAM,一种基于多视图基础模型的几何感知框架,直接预测未见物体的6D姿态,无需显式匹配,通过点云几何和特征网络整合几何信息,在多个基准上平均AR提升5.1%。

Comments Accepted by CVPR 2026 (Oral). Project page: https://windvchen.github.io/PoseGAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15694 2026-06-16 cs.MM cs.AI cs.CV cs.LG 新提交 62%

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

MAF: 面向情感分析的多模态自适应少样本提示方法

Hangling Xie

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MAF框架,通过动态检索与查询相关的多模态示例,利用轻量级系数生成网络实时融合多模态相似度,结合多数投票提升MLLM在情感分析中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07082 2026-06-16 cs.LG cs.AI 版本更新 62%

On the Geometry of On-Policy Distillation

论在线策略蒸馏的几何结构

Zhennan Shen, Yanshu Li, Qingyu Yin, Chak Tou Leong, Zhilin Wang, Yanxu Chen, Rongduo Han, Sunbowen Lee, Yi R. Fung

机构 * HKUST(香港科技大学) UT Austin(得克萨斯大学奥斯汀分校) Zhejiang University(浙江大学) Hong Kong PolyU(香港理工大学) USTC(中国科学技术大学) BUPT(北京邮电大学) Nankai University(南开大学) BIT(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过参数空间诊断,揭示在线策略蒸馏(OPD)的更新轨迹具有松弛离主成分、子空间锁定等独特几何特性,表明其并非介于SFT和RLVR之间的中间方法。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏