No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。
WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模
专题命中 推理与问题求解 :pretraining(abstract)
AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。
超越文本编辑:源代码的代数操作
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究提出源代码代数方法,通过逻辑代数操作修改代码库,概述其操作属性。实验表明大语言模型代理用此方法完成代码更改成功率更高、令牌数更少,为代码编辑提供新方向,推动相关研究。
Comments Accepted for publication in the Visions and Emerging Results Track of the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), 14-18 September 2026, Benevento, Italy
RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。
VGOcc:学习视觉几何高斯用于以视觉为中心的3D驾驶占用预测
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 研究仅视觉3D驾驶占用预测问题,提出VGOcc方法,通过从基础模型学习视觉和几何线索,纳入高斯建模的初始化与细化,实现高效语义占用预测,在nuScenes实验中达最优性能。
ShotPlan:使用可学习规划令牌生成电影级视频
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI)) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 针对电影级视频生成难题,提出ShotPlan框架,基于视频扩散基础模型,引入可学习规划令牌捕捉镜头过渡线索,结合分数时间旋转位置嵌入在帧级别建模,实验证明其优于现有方法,提升了镜头管理与一致性。
Comments Project page: https://pensioner-11.github.io/ShotPlan/
Rtl2lean:通过分层定理生成和引理重用实现从寄存器传输级到Lean的自动翻译
专题命中 推理与问题求解 :LLM(abstract)
AI总结 本文提出Rtl2lean框架,自动将RTL设计转为Lean 4模型并构建分层定理库。通过四层定理框架和基于大语言模型的证明循环处理验证。实验表明该框架能构建机器检查的RTL证明库,检查开销低且引理重用性高。
Comments 6 pages, 2 figures
超越语义的艺术:用于多关系表示的层状信息对比学习
机构 * University of Zurich(苏黎世大学) ; Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) ; Sapienza University of Rome(罗马第一大学) ; Amazon(亚马逊) ; University of Amsterdam(阿姆斯特丹大学) ; The University of Osaka(大阪大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。
Comments Accepted to ECCV 2026
HoloGeo:通过证据驱动推理减轻地理定位中的地标偏差
机构 * National University of Singapore(新加坡国立大学) ; Shandong University of Science and Technology(山东科技大学) ; University of Oxford(牛津大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究针对视觉语言模型地理定位易受地标偏差影响的问题,提出证据驱动推理框架HoloGeo,借助高质量数据集,通过多维度奖励实现平衡关注与联合推理,经实验验证其在多个数据集上能有效减轻地标偏差,提升地理定位性能。
SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。
Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
在线Beck--Fiala问题降至对数稀疏度
专题命中 推理与问题求解 :prompting(abstract)
AI总结 研究将离线Beck--Fiala猜想有效性扩展到\(d\geq\log(T)^{1 + o(1)}\),通过结合在线Komlós问题相关思想的在线算法最小化前缀差异,解决了Spencer设定下在线向量平衡问题,且该结果本质最优。
Comments 9 pages
ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。
用于视觉与语言导航的联合在线与离线策略学习
机构 * Joy Future Academy(京东探索研究院)
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究视觉与语言导航问题,提出JOP-VLN框架,通过三阶段训练流程,协同结合离线策略模仿学习和在线策略探索,采用高熵轨迹采样和纠错优先轨迹排序策略,在相关基准上取得高成功率,创技术新水平。
Comments Accepted by IROS 2026
不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beijing Aerospace Control Center(北京航天飞行控制中心)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。
反证法:合成漏洞检测器与可利用性证明
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究旨在在不过高成本下实现高召回率漏洞发现与可靠自动验证。核心方法是结合神经符号检测器合成与可利用性预言机的反证法系统。主要贡献是在多数据集和系统扫描中表现出色,发现大量未知漏洞并获多个CVE编号。
Comments 17 pages, 7 figures
解析、搜索与确认:基于思维链推理和结构化空间记忆的免训练空中视觉与对话导航
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Jianghuai Advance Technology Center(江淮先进技术中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; University of Macau(澳门大学)
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究免训练环境下的空中视觉与对话导航任务,提出PSC - AVDN框架,结合解析 - 搜索 - 确认推理管道与结构化空间记忆,整合多种空间线索,在免训练设置中取得新的最优性能。
Comments 10 pages, 4 figures. Accepted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 23859-23868
TreeSoc:用于足球视频理解的树状结构动态推理与工具协同
机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。
Comments Accepted to ICMV 2026
未知多房间家庭环境中多目标搜索的交错部分可观测马尔可夫决策过程规划
机构 * Georgia Institute of Technology(佐治亚理工学院) ; The Hong Kong University of Science and Technology(香港科技大学) ; Ising AI(伊辛人工智能公司) ; MIT(麻省理工学院) ; Notre Dame University(圣母大学)
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究未知多房间家庭环境下多目标搜索问题,提出Inter-POMDP算法,通过高级POUCT规划器与低级运动规划器相互作用,平衡规划质量与效率,相比基线方法减少碰撞、导航步数及检测次数。
WeaveEarth:用于免训练超高分辨率遥感理解的结构化证据构建与推理
机构 * School of Frontier Sciences, Nanjing University(南京大学前沿科学学院) ; Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
专题命中 推理与问题求解 :language model(abstract)
AI总结 针对UHR遥感图像理解,提出免训练框架WeaveEarth,通过全局感知证据构建选最小支持证据集,经结构化证据推理增强VLM全局-局部联合推理能力,在多基准测试中表现优于现有方法。
通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。
Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file
自动化即时Python类型注释更新
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。
Comments 12 pages, accepted by ICSE 2026
通过时间比率理解和缓解视频动作泛化差距
机构 * Georgia Tech(佐治亚理工学院) ; Amazon FAR(亚马逊FAR)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。
Comments 26 pages, 9 figures
独立随机变量跨度的稳定相位恢复
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究独立实值中心随机变量\(L^2\)跨度上稳定相位恢复的条件,基于随机变量\(\ell^2\)系数分解给出两种证明,一种紧致性证明,一种定量证明,还给出结果在Lean 4中的自动形式化,完整刻画了此类子空间的稳定相位恢复。
Comments Lean verification available at https://github.com/jaumededios/RandomVarSPR
EAGOR:全方位的具身推理
机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。
Comments 12 Pages, 7 Figures, 4 Tables
RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略
机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)
专题命中 推理与问题求解 :LLM(abstract)
AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。
Comments Accepted at ECCV 2026
基于原始校正的渐进推理用于组合零样本学习
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)
专题命中 推理与问题求解 :post-training(abstract)
AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。
超越孤立对象:基于3D场景图分析的关系感知开放词汇场景理解
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 针对现有开放词汇3D理解方法忽略对象关系的问题,提出RelGraphOV框架,通过3D场景图与自适应门控双流式图注意力网络,提升场景理解性能与泛化性。
Comments Project Page: https://cxavireh.github.io/relgraphov-projectpage
PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型
机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) ; Central Research Institute, Huawei(华为中央研究院)
专题命中 推理与问题求解 :language model(abstract)
AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。
Comments Accepted by ECCV 2026
ACE-Brain-0.5:用于物理智能体人工智能的统一具身基础模型
机构 * ACE-Brain Team(ACE-Brain团队)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 研究针对具身人工智能从模块向物理智能体发展的问题,提出ACE-Brain-0.5统一基础模型,通过耦合的五个功能及SSR+等方法,提升空间感知等能力,在多基准测试中有进步。
用于智慧城市安全的群体驱动多智能体推理
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究智慧城市安全问题,提出基于大语言模型的多智能体方法TPSC-Sec,通过专门智能体分析并经威胁信息素群体共识机制聚合假设,还引入Adaptive Verified TPSC,实验表明该方法能实现高效安全推理。