PILOT Technical Report
PILOT技术报告
专题命中 规划推理 :planning(abstract)
AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。
Comments Technical Report, 42 pages, 10 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PILOT技术报告
专题命中 规划推理 :planning(abstract)
AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。
Comments Technical Report, 42 pages, 10 figures
HODAgent:面向物理世界人机交互的按需、响应式人形机器人
机构 * Xiaopeng(小鹏)
专题命中 规划推理 :planning(abstract)
AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。
Comments we have received a formal directive from our company requiring all company assets to undergo a mandatory internal review process before any public release. We are now required to immediately withdraw the paper to comply with this policy
利用4D纵向扩散模型生成神经退行性脑解剖结构
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Department of Radiology(放射学系) ; Department of Electrical and Computer Engineering, Department of Computer Science(电气与计算机工程系、计算机科学系)
专题命中 规划推理 :planning(abstract)
AI总结 本文提出一种4D纵向扩散模型,用于生成神经退行性疾病的脑解剖结构,通过临床变量条件生成准确的脑部变化轨迹,验证了其在疾病分类和分割中的有效性。
基于无人机的基础设施检查:面向AEC+FM的文献综述与提出框架
专题命中 规划推理 :planning(abstract)
AI总结 本文综述了无人机在基础设施检查中的应用,提出框架整合多模态数据与Transformer架构,以提高检测准确性和可靠性,未来研究方向包括轻量级AI模型和合成数据集。
Comments Accepted for publication in the Proceedings of the International Conference on Computing in Civil Engineering (i3CE 2025)
CharTool: 集成工具的视觉推理用于图表理解
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; Suzhou Laboratory(苏州实验室) ; AISpeech Co., Ltd.(思必驰科技股份有限公司)
专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。
Comments Accepted by ACMMM 2026
持续推理环境:诊断与利用持续RLVR中的共享推理
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) ; Beijing Institute of Technology(北京理工大学) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG
AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。
仅训练投影器就足够
机构 * Ramen VR(拉面VR公司) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。
图机:将边机制作为归纳偏置的探索
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究提出Graph Machine架构,含边增强注意力与以边为中心的引用两种边机制,在数独任务上优于Transformer基线,证明显式边机制是有前景的架构设计。
SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架
专题命中 视觉空间推理 :planning(abstract)
AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。
通过自我场景增强在多模态大语言模型中强化自我中心空间感知
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。
Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: this https URL (https://github.com/Chikit-WONG/spatialGraph)
OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成
机构 * Gwangju Institute of Science and Technology(全州科学技术院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。
Comments Accepted to ECCV 2026
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
面向物理视觉-语言推理的答案级信任选择
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。
Comments Preprint
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) ; Department of Computer Science, Tsinghua University(清华大学计算机系)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。
Comments 14 pages, 5 figures, submitted to CoRL
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
Zoom-IQA:基于可靠区域感知推理的图像质量评估
机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) ; SenseTime Research(商汤科技研究院)
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。
Comments ECCV 2026, Project Page: this https URL (https://ethanliang99.github.io/ZOOMIQA-Projectpage)
MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试
专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。
Comments Work in progress
PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导
机构 * KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。
Comments 26 pages, 15 figures, including appendices
快速分叉:高效估计文本生成中的不确定性动态
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。
打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。
Comments 48 pages including appendix; code, data pipeline and lab notebook at this https URL (https://github.com/RobertoOno/interrupting-the-loop)
EchoCoT:从大型推理模型中提取隐藏的思维链
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。
奖励引导自回归图生成的高效多智能体通信拓扑设计
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。
Comments Full version of extended abstract accepted at ICONIP 2026 (poster)
涌现不变性:从符号化思维到结构控制
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体
机构 * Southeast University(东南大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。
Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: this https URL (https://github.com/DEFENSE-SEU/FlowEvo)
重新标记,而非替换:扩散大语言模型中的令牌到标记细化
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL
AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。
探究优化下上下文与参数化思维链忠实性之间的相互作用
机构 * University of Copenhagen(哥本哈根大学) ; Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)
专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。
Comments The first two authors contributed equally and share first-authorship
面向安全关键工业过程异常状况管理的大型推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究提出通用大型推理模型,通过有界经程序验证的动作接口管理安全关键工业过程的异常状况,在39种异常测试中表现优于基础调节控制,可实现无需人类参与的运行时异常状况管理。
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。
AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。