LUT: Latent Utility Training for Visual Reasoning
LUT:用于视觉推理的隐式效用训练
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
LUT:用于视觉推理的隐式效用训练
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
基于平流优化的遥感图像无训练实体级小样本分割
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 该研究针对现有跨域小样本分割方法训练成本高、预测结果碎片化的问题,提出一种基于平流优化的无训练实体级遥感图像小样本分割框架,可提升 SAM3 的相关适应能力。
重新思考医学影像中的人工智能:假设、现实与重构
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。
Comments 10 pages, 2 figures
在具有不同一致性的多感官反馈下解码错误相关电位
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究在多模态视觉、听觉和触觉反馈及可控感官一致性下的ErrP解码挑战,采用基于多分支EEGNet的架构及辅助监督学习策略,经迷宫观察任务实验,该方法在异质感官条件下分类性能一致且准确度提高,提升了ErrP解码稳定性。
关于在三个公共场所使用的仿人机器人头部接受度的案例研究
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究仿人机器人头部在公共场所的接受度,通过情感模拟后端处理自然语言生成多模态响应,邀请访客交流。结果显示用户有使用意愿,公共场所更适配,多语言响应受欢迎,但响应时间待改进。
Comments accepted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan
用于30米晴空陆地表面温度无间隙重建的快速傅里叶卷积生成对抗网络
机构 * Technical University of Munich(慕尼黑工业大学) ; Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute(亥姆霍兹极地与海洋研究中心阿尔弗雷德·韦格纳研究所) ; Swiss Federal Institute of Technology Zurich (ETH Zurich)(瑞士联邦理工学院苏黎世分校)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对卫星LST数据因云层有间隙、重建难问题,提出多模态快速傅里叶卷积生成对抗网络,利用快速傅里叶卷积实现全局感受野,由卫星观测和SAR数据引导,能恢复大量缺失区域,重建效果好。
Comments 35 pages, 9 figures, Journal
超越玩笑:用于检测和解释表情包中有害幽默的多角度推理
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。
Comments Accepted for Publication at AAAI-ICWSM 2027
通过强化学习进行推理引导的部件级视觉定位
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。
Comments ECCV 2026
GHOST:不透明表面纹理的几何引导幻觉
机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。
轻量级隐式神经表示的误差感知分布预测
机构 * Vanderbilt University(范德堡大学) ; University of Arizona(亚利桑那大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究针对隐式神经表示的预测误差问题,提出轻量级方法,将基于回归的INR训练转为分类任务,通过离散连续目标为bins实现灵活分布建模,经分析权衡表明该方法能通过不确定性估计获高重建质量和误差感知。
大型癌症助手(LCA):用于肿瘤学中可扩展临床决策支持的模型无关编排框架
机构 * Ghassen MARRAKCHI(独立研究者) ; Basarab MATEI(独立研究者)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究针对肿瘤学多模态深度学习模型设计局限,提出模型无关的LCA编排框架。利用算法不可渗透原则等方法,经概念验证验证其编排逻辑、算法不可渗透性等,为临床决策支持提供高度适应性基础,利于电子病历互操作性。
Comments 22 pages, 6 figures, 8 tables, 9 appendices, 14 references, Elsevier JBI format
基于原始校正的渐进推理用于组合零样本学习
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)
专题命中 其他多模态 :MLLM(abstract);分类 cs.CV
AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。
ASPIRE: 面向机器人的智能体技能发现
机构 * NVIDIA(英伟达) ; UMich(密歇根大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UC Berkeley(加州大学伯克利分校) ; CMU(卡内基梅隆大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。
Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/
基于物理世界建模的感知3D仿真
机构 * Stanford University(斯坦福大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。
Comments Published as a conference paper at CVPR 2026
OverFlowLight:城市交叉口实时防锁死与交通信号优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Electronic Science and Technology of China(电子科技大学) ; South China University of Technology(华南理工大学) ; Beijing Xiaocheng Intelligent Computing(北京小城智能计算) ; Tsinghua University(清华大学) ; Lanzhou University(兰州大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 针对城市交通中队列溢出导致级联锁死的问题,提出OverFlowLight框架,利用多模态传感实时检测溢出并动态插入专用相位,结合规则与强化学习混合控制,实际部署43个路口减少60.4%溢出事件并提升18.2%网络吞吐量。
利用人类阅读过程中产生的认知信号增强微博关键词抽取
专题命中 其他多模态 :multimodal(abstract);分类 cs.CL
AI总结 研究利用脑电图(EEG)和眼动追踪信号增强微博关键词抽取(AKE),发现EEG特征带来最大性能提升,两种信号部分互补但存在冗余。
Journal ref IPM, 2024
面向5G上XR中实时化身控制的集成感知与通信
机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) ; IDLab, Ghent University - imec(ID实验室,根特大学 - imec) ; Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。
OphthaDT:用于眼科视力轨迹预测的生成式数字孪生
机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) ; Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) ; Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) ; Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) ; Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) ; Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。
通过形式化理解隐私
机构 * University of Luxembourg(卢森堡大学) ; University of Bergen(卑尔根大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 本文使用多模态逻辑形式化不同隐私理论及其原则,探讨作为认知权利的隐私权在规范位置理论中的含义。
Comments Published in Proceedings of the 17th International Conference on Juris-informatics, JURISIN 2023
CABLE: 面向V2X系统的云辅助带宽高效LMM编码框架
机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出CABLE框架,通过边缘端利用自我运动补偿和残差运动线索传播云分割掩码,生成感兴趣区域(ROI)并仅上传ROI掩码图像,形成掩码-ROI-LMM反馈循环,在五个数据集上实现73-87%的ROI像素覆盖减少和5-8倍LMM预填充加速。
基于性别的连接组网络特异性差异:基于Krakencoder的分析
机构 * Centre for Brain Research, Indian Institute of Science(印度科学研究所大脑研究中心) ; Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham(阿姆里塔大学阿姆里塔人工智能学院人工智能系)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 使用Krakencoder框架模拟脑连接组模态间缺陷传播,分析702名健康被试的结构和功能连接组,发现默认模式网络扰动最大,感觉运动网络最小,完整预测连接组保留更多性别判别信息。
RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性
机构 * ShanghaiTech University(上海科技大学) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)
专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV
AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。
Comments 20 pages, 7 figures
GRAR: LiDAR点云中玻璃引起的反射伪影去除
机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) ; School of Design, Hunan University(湖南大学设计学院) ; School of Finance and Statistics, Hunan University(湖南大学金融与统计学院)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 提出两阶段框架,先利用多模态视觉基础模型和几何线索精确分割玻璃区域,再基于物理驱动的反射感知局部-全局几何相似性描述符去除反射伪影,在多个公开数据集上优于现有方法。
SPACE: 面向多模态大语言模型的无源代理锚点概念擦除
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。
单光纤积分场单元光谱学
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 提出一种多模态概率基础模型,利用掩码自编码器从宽带图像预测星系任意空间位置的高分辨率光谱,无需IFU训练数据,性能与监督基线相当。
Comments Accepted for Conference on Physics and AI at Stanford University (PAI 2026)
FMplex: 用于服务可扩展基础模型的模型虚拟化
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出FMplex系统,通过将基础模型作为虚拟化层实现多任务共享,结合批感知公平队列调度器,在7个基础模型和92个下游任务上降低延迟达80%,提升任务容量6倍。
GraspFoM:基于3D基础先验的重建驱动机器人抓取
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出GraspFoM框架,利用3D基础先验(SAM3D)构建共享3D物体潜变量,联合优化重建与抓取姿态预测,通过锚点初始化的截断姿态推理扩散器生成连续多模态抓取,实现高保真重建与最优抓取。
深度高斯过程到底有多深?组合高斯过程的尖锐阈值与非高斯极限
机构 * Technion, IIT(以色列理工学院) ; NVIDIA(英伟达)
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文研究了深度高斯过程先验在深度增长时的极限行为,识别出RBF核带宽的尖锐阈值,低于该阈值时先验收敛到非退化非高斯分布,具有非零坐标依赖。
神经外科医生需要看到的:用于脑肿瘤手术中脑移位补偿的超声合成术中MRI
机构 * Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain(西班牙巴利亚多利德里奥·奥尔特加大学医院神经外科神经血管科) ; Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC), Instituto de Investigación Biosanitaria de Valladolid (IBioVALL), Valladolid, Spain(西班牙巴利亚多利德生物医学研究与计算分析专业组(GEIBAC),巴利亚多利德生物健康研究所(IBioVALL))
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出一种端到端流水线,通过融合术前MRI、术中超声生成的合成MRI及锚定该合成图像的可变形配准,生成术前成像空间中的全脑MRI体积,以补偿脑移位,为神经导航提供类似MRI的术中视野更新。
基于Adam优化膨胀协议的极端尺寸比下的随机密堆积
专题命中 其他多模态 :multimodal(abstract)
AI总结 该研究提出基于Adam优化器的\texttt{rcpgenerator}代码,实现极端尺寸比下的高维密堆积生成,性能优于传统方法,结果与实验及理论预测吻合。
Comments 11 pages, 10 figures, 3 tables, Code: https://github.com/KD-physics/RCPGenerator; data archived at Zenodo, doi:10.5281/zenodo.21435447