Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control
可调节的视觉-语言-动作策略用于具身推理和分层控制
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
可调节的视觉-语言-动作策略用于具身推理和分层控制
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。
支持应用-网络交互的意图推理(RAG)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出基于RAG的意图推理框架,用于自动网络操作与管理。通过结合机器推理、检索增强生成和生成式AI技术,实现不同应用的意图翻译,提升网络交互的智能化和领域适应性。
SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体
机构 * Allen AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。
Comments Project Page: https://praeclarumjj3.github.io/sage/
基于推理的异常检测与定位:图像级监督
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。
Comments Accepted to CVPR 2026
Mario:基于大语言模型的多模态图推理
机构 * New York University Shanghai(上海纽约大学) ; New York University(纽约大学) ; Tsinghua University(清华大学) ; EPFL(瑞士联邦理工学院洛桑)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。
Comments CVPR 2026
AgentRVOS: 基于对象跟踪的零样本视频对象分割
机构 * KAIST AI Project(韩国科学技术院人工智能项目)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。
学习轨迹感知的多模态大语言模型用于视频推理分割
机构 * Southern University of Science and Technology(南方科技大学) ; Tencent YouTu Lab(腾讯优图实验室)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。
当机器加入道德圈:生成式AI代理在协作推理中的人格效应
专题命中 其他推理 :reasoning(title,abstract)
AI总结 研究探讨生成式AI代理在协作推理中对道德讨论的影响,发现支持性AI增强论证质量,而反对性AI扩大道德框架,表明AI队友能改变道德框架的分布与连接,而非单纯影响道德选择。
一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) ; The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。
Comments 10 pages,7 figures
SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力
机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) ; Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。
Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1
线索至关重要:利用潜在视觉线索增强视频推理
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。
Comments 18 pages, 7 figures
VideoChat-A1: 通过镜头链推理实现长视频的思考
专题命中 其他推理 :reasoning(title,abstract)
AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。
基于图基础模型的路径感知图RAG中最小和充分推理子图检索
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出GFM-Retriever,通过图基础模型实现路径感知的子图检索,提升多跳问答任务的检索与生成性能。
DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力
机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。
DeepScan: 一种无需训练的框架,用于大视觉-语言模型中的视觉引导推理
机构 * East China Normal University(东华大学) ; Sichuan University(四川大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 DeepScan是一种无需训练的框架,通过层次扫描、聚焦和证据增强推理提升大视觉-语言模型在视觉任务中的表现。
Comments 18 pages 17 figures
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
推理作为表示:重新思考图像质量评估中的视觉强化学习
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出RALI算法,通过对比学习实现图像与通用文本表示的对齐,无需推理过程,显著降低参数和推理时间,提升图像质量评估的泛化性能。
Comments ICLR 2026 Oral
清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法
机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) ; Department of Computer Science, University of Memphis(密苏里大学计算机科学系)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。
Comments Accepted by CVPR 2026
面向6G的推理原生代理通信
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出推理原生代理通信,旨在通过协调平面解决6G网络中自主机器间的信念分歧问题,提升异构系统间的协同一致性。
Comments 8 pages 4 figures
DIVER: 一种具有动态交互值链接和证据推理的鲁棒文本到SQL系统
专题命中 其他推理 :reasoning(title,abstract)
AI总结 DIVER通过动态交互值链接和证据推理,提升文本到SQL系统的鲁棒性,实验显示其在执行准确率和验证效率分数上均有显著提升。
Comments Accepted by SIGMOD 2026
超越多数投票的推理:一种可解释的语音语言模型框架用于语音情感识别
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出了一种可解释的语音语言模型框架,通过生成推理任务提升语音情感识别的可解释性,同时保持预测性能。
多源检索与推理用于法律判决预测
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出MSR²框架,通过多源检索与强化学习提升法律判决预测的准确性和可解释性。
AdNanny:一个用于所有离线广告推荐任务的推理LLM
专题命中 其他推理 :reasoning(title,abstract)
AI总结 AdNanny是一种统一的推理LLM,用于提升离线广告推荐任务的效率和准确性,通过整合多个任务模型,减少冗余并提升性能。
Comments 21 pages, 3 figures
ARMOR: 为对抗攻击的鲁棒性进行方法编排与重参数化中的代理推理
专题命中 其他推理 :reasoning(title,abstract)
AI总结 ARMOR通过视觉语言模型引导的代理协作,提升对抗攻击的鲁棒性和跨架构迁移能力。
RGFL:基于大语言模型的自动化程序修复中的推理引导故障定位
专题命中 其他推理 :reasoning(title,abstract)
AI总结 RGFL通过引入分层推理模块和反事实分析,提升自动化程序修复中的文件和元素级故障定位精度,显著提高修复成功率。
Comments 23 pages, 5 figures
DesignerlyLoop: 通过精选推理形成设计意图以实现人-大语言模型对齐
专题命中 其他推理 :reasoning(title,abstract)
AI总结 DesignerlyLoop通过精选推理提升人-大语言模型在设计任务中的对齐,改进设计质量和创造力。
MLLMRec: 基于图细化的多模态推荐偏好推理范式
专题命中 其他推理 :reasoning(title,abstract)
AI总结 MLLMRec通过图细化和多模态大语言模型提升多模态推荐的用户偏好推理与物品表示学习准确性。
弥合专家推理与大语言模型检测:一种基于知识的恶意包检测框架
专题命中 其他推理 :reasoning(title,abstract)
AI总结 IntelGuard通过整合专家推理与大语言模型,实现高准确率的恶意包检测,发现54个未报告恶意包。
思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; Tsinghua University(清华大学)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。
通过大型语言模型理解多智能体推理用于漫画视觉问答
机构 * University of Reading(阅读大学)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。
AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理
专题命中 其他推理 :reasoning(title,abstract)
AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。
Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM