StreamingClaw Technical Report
流式Claw技术报告
机构 * Li Auto Inc.(理想汽车)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。
Comments Under Progress
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
流式Claw技术报告
机构 * Li Auto Inc.(理想汽车)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。
Comments Under Progress
通过多模态图像融合实现眼科手术中的全面实时场景理解
机构 * Technical University of Munich(慕尼黑工业大学) ; Carl Zeiss AG(卡尔蔡司公司)
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 本文提出一种多模态实时网络架构,用于联合仪器检测、关键点定位和工具-组织距离估计,通过多模态图像融合提升手术场景理解的准确性和实时性。
弥合感知与推理:用于多模态大语言模型中RLVR的标记重加权
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; Independent Researcher(独立研究员)
专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 本文提出Token-Reweighting策略,通过动态重加权多模态大语言模型中的感知与推理标记,提升RLVR性能,实现视觉 grounding 和推理的协同优化。
AMBER: 一种自适应多模态掩码变换器用于缺失模态的波束预测
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)
AI总结 AMBER通过自适应处理多模态数据中的缺失模态问题,提升波束预测的鲁棒性和准确性,实验表明其在真实世界数据集上优于现有多模态学习基线。
Comments 13 pages, 9 figures
QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)
AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。
Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures
Photon:通过高效多模态大语言模型加速体积理解
机构 * Tsinghua University(清华大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; Hupan Lab(湖畔实验室) ; Duke University(杜克大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。
Comments Accepted by ICLR 2026
层级引导的多模态表示学习用于分类推断
机构 * Brookhaven National Laboratory(布鲁克海文国家实验室) ; Rutgers University(罗格斯大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出两种端到端的多模态学习方法,通过编码生物分类层级结构提升分类鲁棒性,在大规模生物多样性基准上实现超过14%的准确率提升。
Comments Accepted at the ICLR 2026 Workshop on Foundation Models for Science (FM4Science)
稳定多模态自编码器:融合策略的理论和经验分析
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 本文研究多模态自编码器的稳定性与鲁棒性,提出基于理论分析的正则化注意力融合方法,通过实验验证其在一致性、收敛速度和精度上的优势。
Journal ref Expert Systems with Applications, Volume 310, 10 May 2026, 131270
GRPO能否提升复杂多模态表格理解?
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) ; Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) ; Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; University of Southern California(南加州大学) ; Duke Kunshan University(杜克大学昆山分校)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。
Comments EMNLP 2025
Journal ref EMNLP 2025
一种用于国家医疗数据环境中的隐私保护去重的晚融合多模态AI框架
机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 本文提出一种多模态AI框架,通过语义嵌入、行为模式和设备元数据的晚融合方法,实现隐私保护下的去重,提升公共健康分析的可靠性。
Comments 6 pages, 1 figure, 1 table. Accepted for publication in the 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)
Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)
VOLMO:面向眼科学的多功能和开放型大模型
机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) ; Ray and Stephanie Lane Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学雷和斯蒂芬妮·兰德计算生物学系) ; Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨洛林医学院) ; Department of Radiology, Washington University in Saint Louis(圣路易斯华盛顿大学放射科) ; National Eye Institute, National Institutes of Health(国家卫生研究院眼科研究所) ; National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 VOLMO提出了一种通用框架,用于开发专门的眼科多模态大语言模型,通过预训练、微调和临床推理三个阶段,提升了眼科疾病筛查和诊断的性能。
nothing的价值:通过TikTok影响者表达的人类价值观多模态提取
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL
AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。
在基础模型时代的人工智能安全:从统一视角的综合调查
机构 * University of Central Florida(中佛罗里达大学) ; University of Copenhagen(哥本哈根大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。
Comments Published at Transactions on Machine Learning Research (TMLR)
查看文本:从分词到视觉阅读
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。
本体图像:四足机器人的本体数据图像表示用于接触估计学习
机构 * Dynamic Legged Systems (DLS) lab, Istituto Italiano di Tecnologia (IIT)(动态腿足系统实验室,意大利理工学院) ; University of Genoa(热那亚大学)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 本文提出将四足机器人本体时间序列数据转换为结构化二维图像的方法,利用卷积神经网络学习运动相关任务。通过编码多信号的时序动态,保留机器人形态结构,提升特征空间丰富性。在接触估计任务中,实验表明图像表示优于传统序列模型,接触状态准确率提升16.8个百分点。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026
NeuroStrike:对对齐大语言模型的神经层面攻击
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。
R-C2:循环一致性强化学习提升多模态推理
机构 * Rutgers University(罗格斯大学) ; Columbia University(哥伦比亚大学) ; University of Chicago(芝加哥大学)
专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 R-C2通过循环一致性强化学习解决多模态推理中的内部冲突,提升推理准确率7.6个百分点。
基于概率概念图推理的多模态虚假信息检测
机构 * University of Science and Technology Beijing(北京科技大学) ; Singapore Management University(新加坡管理大学) ; Hong Kong Baptist University(香港浸会大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。
Comments Accepted by CVPR 2026
图标记:通过基于图的视觉提示提升多模态语言模型的空间推理能力
机构 * University of Bologna(博洛尼亚大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出Graph-of-Mark,一种基于图的视觉提示方法,通过在输入图像上叠加场景图来增强多模态语言模型的空间推理能力,实验表明其在视觉问答和定位任务中提升了11个百分点的准确率。
Comments Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329
视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉
机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。
太赫兹频率下平面多模周期滤波器的演示
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 本文提出一种基于共面带状线和有限地面共面波导的平面多模周期滤波器,用于太赫兹频率操作,通过灵活设计和主动控制实现滤波特性。
Comments 18 pages, 13 figures
结构因果模型与大语言模型在医学视觉问答中的整合
机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) ; School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种因果推理框架,通过消除图像与问题间的混杂效应,提升医学视觉问答的准确性,并引入因果图结构和多变量重采样方法以增强模型对复杂医疗数据的理解能力。
Comments Accepted by IEEE TMI 2025
面向低成本精准农业的网络物理系统设计空间探索
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出一种考虑成本的设计空间探索框架,用于多模态无人机-越野车平台,通过整数线性规划和SAT验证,在预算、覆盖和载荷之间进行权衡,实现高效精准农业应用。
Comments 2026 Design, Automation & Test in Europe Conference (DATE)
一种可扩展的贝叶斯框架用于星系发射线检测和红移估计
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出一种可扩展的贝叶斯方法,用于同时估计星系红移和检测发射线,该方法在大规模数据处理中保持高效计算。