ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration
现在行动:通过自适应上下文整合预防治愈LVLM幻觉
机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。
高校专区
现在行动:通过自适应上下文整合预防治愈LVLM幻觉
机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。
CL-VISTA:视频大语言模型持续学习基准测试
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)
AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。
Comments Preprint
AceTone:连接词语与颜色的条件图像评分
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; ByteDance(字节跳动)
AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。
Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone
PReD:基于大语言模型的电磁感知、识别与决策基础多模态模型
机构 * Tsinghua University(清华大学) ; National University of Defense Technology(国防科技大学) ; Beihang University(北京航空航天大学) ; Tianjin University(天津大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; The Hong Kong University of Science and Technology(香港科技大学) ; Civil Aviation University of China(中国民航大学) ; Beijing Institute of Technology(北京理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出PReD,首个电磁领域基础模型,涵盖感知、识别与决策闭环,构建高质量多任务电磁数据集和评估基准,通过多阶段训练策略提升电磁领域能力,实验显示在PReD-Bench上达到最佳性能。
DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) ; School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。
Comments authors update
语义音频视觉导航在连续环境中
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院) ; Shandong Jianzhu University(山东建筑大学) ; Nankai University(南开大学) ; Tsinghua University(清华大学) ; CASIA(中国科学院自动化研究所) ; UCAS(中国科学院大学)
AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。
Comments This paper has been accepted to CVPR 2026
RoboNeuron:面向具身AI的代理驱动编排中层基础设施
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; AiRiA ; MAICRO
AI总结 本文提出RoboNeuron中层框架,解决视觉-语言-动作模型与机器人中间件间的接口不匹配问题,通过统一执行抽象实现模块化编排与后端切换。
HiMA-Ecom:面向电商场景的分层多智能体助手联合训练
机构 * JD Retail, JD.com, Inc.(京东零售,京东集团) ; Faculty of Engineering and Information Technology, The University of Melbourne(墨尔本大学工程与信息技术学院) ; School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)
AI总结 本文提出HiMA-Ecom电商多智能体基准,通过VR-GRPO算法实现多智能体联合训练,基于3B/7B开源模型在电商场景中取得优于DeepSeek-V3的性能。
Comments 39 pages, 10 figures, under review