UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation
UP-Fuse:基于不确定性引导的激光雷达-摄像头融合用于3D全景分割
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 UP-Fuse通过不确定性引导的融合框架,提升激光雷达与摄像头在3D全景分割中的鲁棒性和准确性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
UP-Fuse:基于不确定性引导的激光雷达-摄像头融合用于3D全景分割
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 UP-Fuse通过不确定性引导的融合框架,提升激光雷达与摄像头在3D全景分割中的鲁棒性和准确性。
像婴儿一样:视觉情境下的神经语言习得
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 研究视觉情境对神经语言模型下一词预测的好处,引入多模态神经架构,微调预训练BERT嵌入,发现多模态环境下语言模型表现更好,符合情境认知理论,不同语言和模型中视觉情境训练优势明显。
Comments Final submission (camera-ready), accepted to ACL 2019
解开语言调查与单词计数(LIWC)的解释性和预测性作用:抑郁症相关分类中的受控替换
专题命中 多模态训练与对齐 :multimodal(abstract);分类 eess.AS
AI总结 研究探讨LIWC在抑郁症相关分类中的作用,通过与三种局部替换版本比较,在多语料库中评估其对分类的影响,结果显示其在固定表示下增益有限,作为解释层有用,但结论不适用于特定架构。
DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络
机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。
Comments Accepted by CGI
ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习
机构 * North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。
Comments 10 pages, 5 figures
用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模
机构 * LG Electronics(LG电子) ; Pusan National University(釜山国立大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。
Comments Accepted to ECCV 2026
HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。
Comments 9 pages, 7 figures
KAP:弥合大语言模型系统中知识选择与运行时消耗的差距
机构 * QiYuanLab(启元实验室)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。
Comments 3 figures, 5 tables
基于大语言模型的自动出价的策略感知参数高效适配
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。
用于电网诊断的多模态大语言模型的任务条件忠实性审计
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Brookhaven National Laboratory(布鲁克海文国家实验室) ; Southern Methodist University(南卫理公会大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。
用于多模态推理的离线-在线课程强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; BUPT Shenzhen Institute(北京邮电大学深圳研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; Lancaster University(兰卡斯特大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) ; Changsha University of Science & Technology(长沙理工大学)
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。
sheaf-Laplacian 障碍与投影难度分析跨模态兼容性在模态无关站点
机构 * Faculty of Informatics and Information Technology, Slovak Technical University(斯洛伐克技术大学信息学与信息技术学院) ; aleph0 s. r. o.
专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.AI
AI总结 本文提出统一框架分析学习表示中的跨模态兼容性,通过模态无关邻域站点和有限维实内积空间细胞sheaf,定义投影难度和sheaf-Laplacian障碍,分析两种失败模式并推导稳定性与误差界。
Comments 31 pages, 7 figures, submitted to Annals of Mathematics and Artificial Intelligence of Springer Nature, post-major revision
多模态数据理解:理解视觉-文本信息链如何影响数据解释
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 研究多模态数据理解中视觉与文本信息链对数据解释的影响,提出用可视化优先链和文本优先链呈现信息的实验范式,通过比较发现不同链的理解特点,为多模态信息整合及有效数据通信设计提供见解。
基于小冲孔试验多模态测量估计材料本构参数的摊销后验
专题命中 其他多模态 :multimodal(title,abstract)
AI总结 研究从小冲孔试验多模态测量估计材料本构参数问题,提出将高斯过程代理与条件流匹配相结合的摊销无似然框架,避免手工似然和重复采样,通过实验证明该方法能有效收缩后验,建立了强大的无似然推断框架。
近视防控3.0:人工智能驱动的风险分层、主动监测和个性化干预
机构 * Shanghai Nile Intelligent Technology Co., Ltd.(上海尼罗智能科技有限公司) ; Beijing Tanyuan Academy of Intelligent Sensing(北京潭渊智能传感研究院)
专题命中 其他多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 研究借助人工智能、数字传感等技术推动近视防控从被动变主动精准模式。通过多模态数据机器学习预测风险、可穿戴等监测及个性化干预形成闭环。评估各阶段证据,讨论相关挑战并给出未来方向。
在注意力流形中分离语义注意力与结构偏差
机构 * Fudan University(复旦大学) ; Singapore Management University(新加坡管理大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型中注意力机制对无信息视觉 tokens 关注过多的问题,提出无需训练的 SPAR 方法,通过净化噪声和重分配注意力,有效恢复真实视觉基础且计算开销小。
关于在三个公共场所使用的仿人机器人头部接受度的案例研究
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究仿人机器人头部在公共场所的接受度,通过情感模拟后端处理自然语言生成多模态响应,邀请访客交流。结果显示用户有使用意愿,公共场所更适配,多语言响应受欢迎,但响应时间待改进。
Comments accepted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan
用于30米晴空陆地表面温度无间隙重建的快速傅里叶卷积生成对抗网络
机构 * Technical University of Munich(慕尼黑工业大学) ; Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute(亥姆霍兹极地与海洋研究中心阿尔弗雷德·韦格纳研究所) ; Swiss Federal Institute of Technology Zurich (ETH Zurich)(瑞士联邦理工学院苏黎世分校)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对卫星LST数据因云层有间隙、重建难问题,提出多模态快速傅里叶卷积生成对抗网络,利用快速傅里叶卷积实现全局感受野,由卫星观测和SAR数据引导,能恢复大量缺失区域,重建效果好。
Comments 35 pages, 9 figures, Journal
SuSIE:具有无畏探索的子集模拟
专题命中 其他多模态 :multimodal(abstract)
AI总结 研究子集模拟框架在多失效区域等复杂情况下估计结构可靠性的挑战,提出用改进的无畏MCMC采样器替代传统方法,经示例验证该方法能解决复杂特征,有效估计失效概率。
跨感官协同设计工具与交互质量
专题命中 其他多模态 :multi-modal(abstract)
AI总结 研究跨感官交互设计难题,核心方法是开发Loaded Dice和Wheel of Plush工具,利用技术联觉原理及简单交互方案实现传感器与执行器映射,主要贡献为助力跨感官交互设计及探索新应用领域。
Comments In "Workshop Cross-Sensory Futures: Rewiring Perception in HCI" at CHI 2026. April 13, 2026. Barcelona, Spain