Multi-Way Representation Alignment
多向表示对齐
专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.AI
AI总结 研究M≥3模型的表示对齐,用广义普罗克汝斯忒斯分析构建共享正交空间,指出严格等距对齐对检索非最优,提出几何校正普罗克汝斯忒斯对齐,实验表明其提升任意到任意检索并保留实用共享参考空间。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多向表示对齐
专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.AI
AI总结 研究M≥3模型的表示对齐,用广义普罗克汝斯忒斯分析构建共享正交空间,指出严格等距对齐对检索非最优,提出几何校正普罗克汝斯忒斯对齐,实验表明其提升任意到任意检索并保留实用共享参考空间。
图谱是理想上下文:用于可泛化基础医学图像分割的一次性定制
机构 * Nanjing University(南京大学) ; The Ohio State University(俄亥俄州立大学) ; Stanford University(斯坦福大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 研究医学图像中解剖结构分割问题,提出图谱引导框架AtlasSegFM,通过图谱查询配准生成提示,用冻结基础模型细化分割,经自适应融合模块结合图谱先验与模型输入及预测,实现一次性定制。
Comments ECCV 2026
基于Transformer的模型与人脑网络之间拓扑对齐的统一几何空间
机构 * The Clinical Hospital of Chengdu Brain Science Institute, MOE-K Lab for NeuroInformation, Brain‑Apparatus Communication Institute, School of Life Science and Technology, University of Electronic Science and Technology of China(成都脑科学研究院临床医院,MOE-K神经信息实验室,脑-装置通信研究所,电子科技大学生命科学与技术学院) ; School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) ; Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) ; School of Computing, University of Georgia(佐治亚大学计算机学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI
AI总结 提出一个模态无关、任务无关的拓扑对齐空间,通过图组织属性将Transformer模型的注意力拓扑映射到人脑固有连接网络,揭示了不同模态和规模模型的连续弧形分布及对齐特性。
Ask-to-Clarify: 通过多轮对话解决指令歧义
机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。
Comments Accepted by IROS 2026
EPMF: 高效感知感知多传感器融合用于3D语义分割
机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) ; Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) ; School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) ; Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。
Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper
在思考之前,先学会决策:面向高效视觉推理的主动路由
机构 * Xi’an Jiaotong University(西安交通大学) ; ARC Lab, Tencent IEG(腾讯IEG ARC实验室) ; City University of Hong Kong(香港城市大学) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Harvard University(哈佛大学) ; Nanjing University(南京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。
Comments 36 pages, 20 figures
从一对一到多对多:面向深度视觉-语言融合的动态跨层注入
机构 * Tongji University(同济大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院) ; Independent Researcher(独立研究者)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。
RC-GeoCP:雷达-相机协同感知的几何一致性
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; School of Automotive Studies, Tongji University(同济大学汽车学院) ; Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。
Comments 11 pages, 6 figures, 9 tables
HunyuanImage 3.0 技术报告
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。
PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练
机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) ; National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。
面向可部署计算病理学的通路结构特权蒸馏
机构 * School of Medicine, Wake Forest University(威克森林大学医学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出MoPE框架,通过通路索引病理专家和记忆使用对齐,将多模态学习转化为仅组织学推理的特权蒸馏,提升全切片图像推理性能。
Token缩减应超越生成模型中的效率——从视觉、语言到多模态
机构 * Harvard University(哈佛大学) ; Northeastern University(东北大学) ; CAS(中国科学院) ; Wuhan University(武汉大学) ; MIT(麻省理工学院) ; Peking University(北京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。
Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction
虚拟传感实现不可达位置与不可测参数的实时监测
机构 * Plasma & Radiological Engineering Department, Grainger College of Engineering, Nuclear, University of Illinois Urbana-Champaign(等离子体与辐射工程系,格拉inger工程学院,核能,伊利诺伊大学厄巴纳-香槟分校) ; Mechanical Science and Engineering Department, Grainger College of Engineering, University of Illinois Urbana-Champaign(机械科学与工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) ; National Center for Supercomputing Applications, Urbana, IL, USA(国家超级计算应用中心,伊利诺伊州厄巴纳,美国) ; Department of Applied Mechanics, Indian Institute of Technology Delhi, New Delhi, India(应用力学系,印度理工学院德里,新德里,印度) ; Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
AI总结 针对能量系统中物理传感器无法部署的实时监测问题,提出基于神经算子的虚拟传感框架MIMONet,将稀疏边界测量映射到内部场,在多种热流体系统中实现亚毫秒级高精度推理。
Comments New analysis and results are added
子令牌路由用于KV缓存压缩
机构 * Futurewei Technologies(未来智科)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。
Comments 17 pages, 8 tables, 2 figures
离散时间高斯过程混合在机器人策略学习中的惊人有效性
机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出MiDiGap方法,利用少量演示和相机观测,通过离散时间高斯过程混合实现机器人操作策略的灵活表示与模仿学习,在长时域、高约束、动态和多模态任务上取得SOTA性能,并支持推理时引导。
Comments Submitted for publication to IEEE Transaction on Robotics
让ViT说话:生成式语言-图像预训练
机构 * Beijing Jiaotong University(北京交通大学) ; ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。
Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP
ReVision:通过时间视觉冗余减少扩展计算机使用代理
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Microsoft Research(微软研究院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 ReVision通过去除冗余视觉片段,减少token使用并提升成功率,使代理能处理更长轨迹。
医学图像分析中的因果迁移
机构 * University of Waterloo(滑铁卢大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文探讨了医学图像分析中因果迁移方法,整合因果推理与跨域表示学习,以解决领域偏移问题,提升临床AI的鲁棒性和泛化能力。
基于语义对齐的OpenStreetMap中不确定性感知分层重定位
机构 * International Digital Economy Academy(国际数字经济学院) ; School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院) ; Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出不确定性感知分层搜索框架,利用目标级DINO-ViT令牌减少跨模态差异,通过粗FFT相关和不确定性控制的局部细化实现高效定位,在精度和速度上显著优于现有方法。
Comments 7 pages, 4 figures
MatSciBench: 基准测试大型语言模型在材料科学中的推理能力
机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) ; University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) ; Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。
先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击
机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) ; School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。
群体感知的物理信息神经粒子流用于贝叶斯更新
机构 * Iowa State University(爱荷华州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出群体感知的物理信息神经粒子流(PA-PINPF),通过群体编码器增强粒子更新,在贝叶斯后验传输中优于标准方法。
从噪声心脏血流测量中学习疾病敏感的潜在交互图
机构 * Department of Computer Science, University of Bath(巴斯大学计算机科学系) ; Department of Mechanical Engineering, University of Bath(巴斯大学机械工程系) ; Christian Doppler Laboratory for Mechanical Circulatory Support, Department of Cardiac and Thoracic Aortic Surgery, Medical University of Vienna(维也纳医学大学心脏和胸主动脉外科系基督教多普勒实验室)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 本文提出了一种物理指导的潜在关系框架,用于从噪声心脏血流测量中学习疾病敏感的潜在交互图,以捕捉心脏疾病和干预的稳健标志。
学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控
机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) ; Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。
GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) ; State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。
基于智能体的人工智能助力大规模睡眠生理学研究
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。
无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。
Comments Submitted to IEEE Journal for possible publication
PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Cambricon Technologies(寒武科技) ; Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。
AvAtar: 通过主动最优输运学习对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Florida(佛罗里达大学) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。
Comments Published as a conference paper at ICML 2026
基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。
Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)
Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)