Administrative Decentralization in Edge-Cloud Multi-Agent for Mobile Automation
边缘-云多智能体中的行政去中心化
专题命中 规划推理 :planning(abstract);self-correction(abstract)
AI总结 本文提出AdecPilot,通过将行政去中心化原则应用于边缘-云多智能体框架,实现边缘代理的重新定义,提升任务成功率并降低云资源消耗与延迟。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
边缘-云多智能体中的行政去中心化
专题命中 规划推理 :planning(abstract);self-correction(abstract)
AI总结 本文提出AdecPilot,通过将行政去中心化原则应用于边缘-云多智能体框架,实现边缘代理的重新定义,提升任务成功率并降低云资源消耗与延迟。
HY-Embodied-0.5:面向现实世界代理的具身基础模型
机构 * Tencent Robotics X(腾讯机器人X实验室) ; HY Vision Team(HY视觉团队)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。
多代理家庭能源管理助手
专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出HEMA,首个开源多代理系统,通过多轮对话保持上下文,支持多样化的家庭能源管理任务,结合大语言模型与领域专用工具,提供能源分析、教育支持和智能设备控制。
Comments 32 pages, 9 figures
超越随机探索:训练数据为何对代理搜索有价值
机构 * Alibaba Cloud Computing(阿里云)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Hierarchical Experience框架,通过对比分析和多级聚类机制将原始推理轨迹转化为层次经验知识,提升搜索代理的性能和训练稳定性,实现更高效的策略驱动搜索。
Comments 15 pages, ACL2026 Findings Accepted
面向领导级系统的高通量材料筛选多智能体协调
机构 * Computational Science (CPS) Division, Argonne National Laboratory(阿贡国家实验室计算科学(CPS)部) ; Argonne Leadership Computing Facility (ALCF), Argonne National Laboratory(阿贡国家实验室阿贡领导力计算设施(ALCF))
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出一种可扩展的多智能体框架,用于在领导级系统上高效执行高通量筛选任务,通过中央规划代理动态分配任务并利用并行执行代理,降低开销并提高任务完成率。
从辩论到决策:用于安全多智能体辩论的符合社会选择
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Conformal Social Choice方法,通过后处理层将辩论输出转化为校准的行动与升级决策,确保正确答案的概率覆盖,提升多智能体辩论的安全性。
NIH资助研究中人工智能采纳的分析
机构 * Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文分析了NIH资助研究中AI的采纳情况,提出了一种人机协同的方法来大规模分类和总结研究描述,发现AI在NIH portfolio中占比15.9%,存在研究到应用的差距,且健康不平等研究严重不足。
TurboAgent:一种基于大语言模型的自主多智能体框架用于涡轮机械气动设计
机构 * Digital Twin Research Center, Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所数字孪生研究中心) ; National Key Laboratory of Science and Technology on Advanced Light-duty Gas-Turbine, Chinese Academy of Sciences(中国科学院先进轻型燃气轮机科学与技术国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Hong Kong(香港大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出TurboAgent框架,通过大语言模型实现涡轮机械气动设计的端到端自主设计,结合生成设计、性能预测、多目标优化和物理验证,实现数据驱动的协作流程,提升设计效率和精度。
对人类不可见,由智能体触发:针对移动视觉-语言智能体的隐秘劫持攻击
机构 * School of Computer Science, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、清华-博世机器学习联合中心、清华脑与智能实验室、北京国家信息科学与技术研究中心)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种隐秘的劫持攻击方法,通过智能体交互时的感知注入,避免被人类察觉,同时在移动设备上有效绕过安全过滤器。
基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆
机构 * Jilin University(吉林大学) ; Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) ; Tongji University(同济大学) ; NKIARI ; Nankai University(南开大学) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。
可线性求解的连续时间一般和随机微分博弈
专题命中 规划推理 :planning(abstract)
AI总结 本文提出了一类可线性求解的连续时间有限参与者随机一般和微分博弈,通过精确的线性PDE系统求解。利用交叉对数似然比构建分布规划博弈,解决多智能体空间冲突问题,通过广义多元Cole-Hopf变换将非线性HJB方程转化为线性偏微分方程,实现高效的反馈纳什均衡策略计算。
评估基于视频的对话式聊天机器人调查在测量感知骑行安全性的可行性:纽约市试点研究
专题命中 规划推理 :planning(abstract)
AI总结 本文提出利用大语言模型结合视频调查和对话式AI聊天机器人,评估骑行安全感知的可行性,并通过纽约市九个街区的试点调查验证方法的有效性。
学习搜索:一种基于决策的知识增强视觉问答代理
机构 * Tsinghua University(清华大学) ; University of Arizona(亚利桑那大学) ; Hefei University of Technology(合肥工业大学)
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出基于决策的KB-VQA代理,通过多步骤决策过程解决视觉问答问题,改进检索与推理整合,提升对稀有实体和长尾事实的处理能力。
ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型
机构 * Dongguk University(东国大学)
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。
Comments 2026 RA-L
可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。
HiRO-Nav:混合推理实现高效具身导航
机构 * Nanyang Technological University(南洋理工大学) ; Tencent(腾讯) ; Independent Researcher(独立研究员)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 HiRO-Nav通过混合推理策略,在导航任务中根据动作熵动态决定是否进行推理,提升决策质量并降低计算开销。
MedVR:通过代理强化学习实现无标注的医学视觉推理
机构 * Tsinghua University(清华大学) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。
Comments Accepted by ICLR 2026
Lang2Act: 通过自涌现语言工具链实现细粒度视觉推理
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 Lang2Act通过自涌现语言工具链提升视觉感知与推理能力,采用强化学习框架优化VLMs的视觉感知和下游任务性能,实验显示其在视觉感知能力上有显著提升。
Brain3D: 通过多模态推理实现EEG到3D视觉表示的解码
机构 * Università Politecnica delle Marche(马尔凯理工大学) ; University of Macerata(马切拉塔大学) ; Horizon Intelligence Labs(地平线智能实验室) ; Harvard Medical School(哈佛医学院) ; Massachusetts General Hospital(麻省总医院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出Brain3D,通过多模态推理实现EEG到3D解码,分阶段生成3D网格,提升神经解码的几何理解与应用性。
Comments 17 pages, 2 figures
基于渲染的视频生成与基于代理的推理
机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) ; National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) ; Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) ; OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
专题命中 视觉空间推理 :reasoning(title)
AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。
Comments Accepted to CVPR 2026
WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Shandong University(山东大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。
基于视觉的人形代理
机构 * Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Tongji University(同济大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Michigan(密歇根大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。
Comments Project page: https://alvinyh.github.io/VGHuman/
3DrawAgent:通过早期对比经验教LLM进行3D绘制
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Jiangnan University(江南大学) ; HaoHan Data(浩瀚数据)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 3DrawAgent通过几何反馈利用大语言模型生成3D贝塞尔曲线,引入相对经验优化策略,无需参数更新提升3D空间理解与绘制质量,实现免训练的3D草图智能发展。
Comments CVPR 2026 Highlight
大型多模态模型距离人类水平的空间行动还有多远?一个面向城市空域目标导向的具身导航基准测试
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Northeastern University(东北大学) ; National University of Defense Technology(国防科技大学) ; Shandong University(山东大学) ; BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文通过构建包含5037个高质量目标导向导航样本的数据集,评估17种代表性模型在城市3D空间中具身空间行动的能力,发现尽管LMMs展现出新兴行动能力,但仍远未达到人类水平,并揭示导航误差在关键决策分歧后迅速发散的现象。
超越人类可读性:为代理开发时代重新思考软件工程惯例
机构 * Military Institute of Telecommunications and Information Technologies (MITIT)(军事电信与信息技术研究所)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨代理开发时代软件工程惯例的变革,提出语义密度优化原则,通过实验验证压缩对开发成本的影响,并提出程序骨架概念和语义意图与可读性分离的主张。
WebTestPilot: 通过符号化GUI元素推断或acles实现基于自然语言规范的端到端Web测试
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 WebTestPilot通过符号化GUI元素推断隐式或acles,解决自然语言规范下的端到端Web测试中的隐式或acles推断和概率推理挑战,实现99%的任务完成率和高精度召回率。
缓解大多模态模型中的视觉上下文退化:一种无需训练的解耦代理框架
机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Shandong University(山东大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出无需训练的解耦代理框架DRP,通过让LLM作为策略推理者与LMM作为观察者解耦,有效缓解多模态推理中的视觉退化问题,实验表明其在MathVision基准上准确率优于GPT-4o。
Accordion-Thinking:通过动态摘要实现的自我调节步骤摘要以提高LLM推理的效率和可读性
机构 * Sun Yat-Sen University(中山大学) ; ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) ; University of California, Merced(加州大学默塞德分校)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Accordion-Thinking框架,通过动态摘要实现LLM推理的自我调节,减少历史token依赖,提升效率和可读性,实验显示其在48GB GPU内存配置下实现三倍吞吐量且保持准确率。
完美验证者并非必需:在有噪声奖励下学习
机构 * Handshake AI ; ETH Zurich(苏黎世联邦理工学院)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究通过引入噪声探讨强化学习在有噪声奖励下的鲁棒性,发现15%的噪声率下验证准确率接近干净基线,表明不完美验证不影响RLVR效果。
SAT:通过分步自适应思维平衡推理准确性和效率
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Huawei Technologies(华为技术有限公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SAT框架,通过分步自适应思维在保持核心推理结构的同时实现推理步骤的动态剪枝,从而在减少推理token数量的同时维持或提升准确率。
Comments accepted to ACL2026 main conference