Unordered Landmark Visual Navigation
无序地标视觉导航
专题命中 视觉空间推理 :planning(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
无序地标视觉导航
专题命中 视觉空间推理 :planning(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
SmartMage:面向3D场景理解的动态模态编排
机构 * Zhejiang University(浙江大学) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。
Comments Accepted to ACM MM 2026
Traj-VLN:通过自回归轨迹生成学习像素空间交互
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng National Laboratory(鹏城国家实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。
RoboAtlas:上下文感知主动SLAM
机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。
Comments Alexander Schperberg and Shivam K. Panda made equal contribution
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
让几何引导:在多模态大语言模型中逐层展开几何先验
机构 * Xi’an Jiaotong University(西安交通大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; InspireOmni
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。
Comments Revised manuscript with updated experiments, figures, and presentation
用于3D手部重建的可负担性引导扩散先验
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/
消息传递实现高效推理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出消息传递语言模型(MPLM),通过线程间直接通信和抢占机制,在Sudoku、3-SAT和长上下文问答任务中实现比串行CoT和并行FJ更高效的推理。
Comments COLM 2026
理解并缓解过早自信以提升大语言模型推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);test-time compute(abstract);分类 cs.AI
AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。
无验证器的测试时扩展的一致性方法
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。
GradCuit:信用分配梯度流实现鲁棒且可解释的测试时潜在推理
机构 * Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; School of Artificial Intelligence for Science, Peking University(北京大学科学人工智能学院)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 GradCuit在测试时插入可优化潜在状态,实现序列级信用分配,在多基准上准确率优于同类方法,且鲁棒性、可解释性更强,为LLM测试时推理扩展提供新方向。
能力路由守卫:防御大型推理模型免受以推理为中心的越狱攻击
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 本研究提出能力路由守卫(CRG),一种针对闭源大型推理模型的模型无关推理时护栏,可有效缓解多种以推理为中心的越狱攻击,同时保留良性效用并避免过度拒绝问题。
记忆还是检索:考虑RAG的缩放规律
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究员) ; Patronus AI ; The Ohio State University(俄亥俄州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。
Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws
套娃语言模型套件
机构 * Cornell University(康奈尔大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。
下一步编辑什么:对话系统中视觉对齐的图像编辑后续建议
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务单元) ; Southeast University(东南大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI
AI总结 该研究针对对话系统的图像创作场景,提出三阶段多模态推荐框架,经测试可降低视觉不一致率并显著提升推荐相关指标。
PIVOT:用于教学导师引导的基于偏好的干预向量
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 研究针对LLM对话辅导缺乏教学策略推理时控制的问题,提出PIVOT框架,通过偏好干预向量实现导师动作控制,在用户研究中获多数教师认可。
在LLM推理扩展中采样多样性的影响
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; The Chinese University of Hong Kong(香港中文大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; NEC Laboratories America(NEC美国实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 本文研究了在LLM推理扩展中采样多样性对性能的影响,通过理论和实验证明多样化的采样能提升模型表现,并在不同任务中实现了显著的增益。
Comments 31 pages
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 测试时计算 :reasoning(abstract)
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026
你无需停留在循环中:用于机器人策略改进的智能体机器人循环
专题命中 测试时计算 :verifier(abstract)
AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。
Comments Agentic Robotics Preview Version
RankGuide: 张量秩引导的路由与引导以实现高效的推理
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Intel Labs(英特尔实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 RankGuide通过张量秩引导的路由与引导提升小推理模型与大推理模型的协作效率,减少推理延迟并提高准确性。
协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理
机构 * Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。
Comments 9 pages, 5 figures, Findings of ACL 2026
LexKairos:评估大型语言模型的法律时间能力基准
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究提出LexKairos基准,评估LLMs的中文法律时间能力,经多设置测试发现Gemini-3-Flash表现最优,但现有模型在时间敏感任务上仍存局限,相关能力待提升。
Comments 15 pages, 5 figures
SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。
REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。
Comments 26 pages and 22 figures
ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; CITIC Securities(中信证券) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。
阅读并非推理:弥合视觉-文本压缩中的智能体策略差距
专题命中 复杂问题求解 :reasoning(title);分类 cs.AI
AI总结 该研究针对视觉-文本压缩导致的智能体策略差距,提出CAPS跨模态智能体策略自蒸馏框架,在SearchQA、ALFWorld等数据集上显著提升性能并大幅降低上下文成本。
REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。
Comments 24 pages, 8 figures
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
KGCaRe:结合自动知识图谱构建与大语言模型上下文检索的可解释复杂条件问答方法
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM与RAG处理复杂条件问答时在特定领域表现不佳的问题,提出KGCaRe混合方法,结合KG构建、迭代图遍历与神经检索,在多类LLM及数据集上优于现有基线。
双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Stony Brook University(石溪大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。