V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis
V2T-CoT:从视觉到文本链式推理用于医学推理与诊断
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。
Comments 12 pages, 4 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
V2T-CoT:从视觉到文本链式推理用于医学推理与诊断
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。
Comments 12 pages, 4 figures
GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究院)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。
MECoBench:具身环境中多模态智能体协作的系统研究
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。
Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/
基于多模态智能体AI和主动波浪补偿的自主无人机稳健海上平台着陆
机构 * Fundação Para a Ciência e a Tecnologia(葡萄牙科学技术基金会)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 提出一种解耦的多飞行器着陆框架,利用双深度强化学习智能体(SAC和模态RL)实现无人机在海上平台的稳健着陆,在15次试验中达到100%成功率。
SimpleSearch-VL:多模态智能深度搜索的简单配方
机构 * Southeast University(东南大学) ; Ant Group(蚂蚁集团)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
AI总结 提出SimpleSearch-VL框架,通过因子化自适应展开和证据验证推理提升多模态智能搜索的效率与可靠性,仅用少量数据即显著超越基线。
Comments Technical Report
REMSA:通过约束感知代理进行遥感基础模型选择
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) ; U AI(5U AI) ; Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。
Comments Code and data available at https://github.com/be-chen/REMSA
人机协作的论文到网页制作
机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。
Comments Accepted by ACL2026 Findings
ReGRPO: 用于工具使用智能体的反思增强策略优化
机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。
重新思考基础模型协作:通过代理任务推理增强专用模型
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。
ELEVATE:面向可扩展与包容性教育的人本生成式AI虚拟导师设计
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 提出ELEVATE框架,通过本地执行、多模态3D虚拟形象与教师治理层,实现隐私保护、低成本的生成式AI虚拟导师,解决云端文本聊天机器人存在的隐私、成本和数字鸿沟问题。
智能体AI增强医生在临床决策中的信任
机构 * Department of Computer Science and Engineering, Lehigh University(里海大学计算机科学与工程系) ; Department of Epidemiology, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院流行病学系) ; Department of Medicine, Division of Cardiology, University of Florida(佛罗里达大学医学院心脏病学系) ; McGovern Medical School, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦戈文医学院) ; Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院放射学系) ; McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) ; Department of Health Outcomes & Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 研究通过医生评估多模态临床病例,发现智能体AI相比非智能体基线显著提升医生的认知和行为信任,尤其在治疗规划任务中,但存在对错误输出的过度依赖。
Comments Accepted by AMIA 2026 Annual Symposium
利用空侧对空侧巴士增强航空网络以加强系统在中断下的韧性
专题命中 多模态Agent :multimodal(abstract)
AI总结 提出通过空侧对空侧巴士替代短途区域航班,重构航空网络拓扑以主动提升韧性,模拟显示在1000万美元预算下转换10条航线可减少8%中断日和6%正常日的旅客延误。
关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃
机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) ; Sun Yat-sen University(中山大学) ; National Supercomputing Center in Shenzhen(国家超级计算深圳中心) ; Tsinghua University(清华大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。
Milmer: 一种基于多实例学习的多模态情感识别框架
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Milmer框架,结合面部表情分析与EEG信号,采用Transformer融合方法提升多模态情感识别性能,通过细调Swin Transformer和交叉注意力机制实现高效特征融合,实验显示在DEAP数据集上达到96.72%的四类情感识别准确率。
MSNN-LINet:通过连续线性集成进行跨模态学习
机构 * The George Washington University(乔治华盛顿大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 提出线性集成网络LINet,通过连续线性集成卷积操作实现RGB-D场景分类中的逐层跨模态学习,解决多模态融合的结构性妥协问题,并在SUN RGB-D数据集上取得领先结果。
Comments 14 pages, 6 figures, 3 tables
通过双流强化学习实现令牌稀疏的医学多模态推理
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。
Comments ICML2026
跨模态分层融合用于多传感器地面观测
机构 * University of Southern California(南加州大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出AtmoFuseNet框架,通过跨模态分层聚合、条件变分精化和相关运动估计,融合多视角天空相机、毫米波云雷达和云高仪数据,实现云微物理场和风场的4D重建。
更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; OPPO AI Center(OPPO AI中心)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。
MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样
机构 * Li Auto Inc.(理想汽车) ; East China Normal University(华东师范大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。
FedLAB: 面向联邦多模态图基础学习的可追踪语义码本
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
AI总结 提出FedLAB框架,通过类型化分层码本组织模态证据、节点语义和拓扑上下文,实现联邦多模态图学习中的可追踪语义,在10个基准和6个下游任务上提升达7.53%。
LOPA:通过潜在序数原型对齐增强口语评估
机构 * National Taiwan Normal University(国立台湾师范大学)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL、cs.MM
AI总结 提出LOPA正则化器,在潜在空间施加序数几何先验,结合SALR自适应提取Whisper编码器多层表示,以0.361 RMSE媲美十亿参数系统,无需LLM微调。
HVPNet:一种用于通用显著和伪装目标检测的仿生网络
机构 * School of Artificial Intelligence, Jiangxi Normal University(江西师范大学人工智能学院) ; Faculty of Business Information, Shanghai Business School(上海商学院商务信息学院) ; School of Computer Science and Information Engineering, Shanghai Institute of Technology(上海应用技术大学计算机科学与信息工程学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 受人类视觉过程启发,提出简单通用的仿生架构HVPNet,通过视网膜整合模块和皮层解码器实现多模态特征高效融合,在7个任务22个数据集上取得精度-效率平衡。
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。
Comments Accepted by ECCV 2026
双稀疏聚合Transformer用于多光谱目标检测
机构 * Northwestern Polytechnical University(西北工业大学) ; School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络空间安全学院) ; Shaanxi Provincial Key Laboratory of Speech and Image Information Processing(陕西省语音与图像信息处理重点实验室) ; National Engineering Laboratory for Integrated Aerospace-Ground-Ocean Big Data Application Technology(空天地海一体化大数据应用技术国家工程实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出双稀疏聚合Transformer(DSAFormer),通过空间和通道稀疏注意力机制减少冗余交互,并引入可学习加法融合模块增强多模态特征融合,在四个数据集上达到最优检测性能。
ERA:基于熵引导的视觉令牌剪枝与修正注意力机制的高效多模态大语言模型
机构 * School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab) ; OPPO Research Institute(OPPO研究院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出ERA框架,通过熵引导的视觉令牌剪枝和修正注意力机制,解决令牌减少导致的注意力对数坍塌问题,实现高效多模态大语言模型推理加速。
Comments 17 pages, 7 figures
Evo-PI:通过演化原则引导的对齐医学推理
机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) ; National Yang Ming Chiao Tung University(国立阳明交通大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。
FROST:基于冻结特征和非参数统计的无训练少样本分割
机构 * TelePIX
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出FROST,一种无训练少样本分割方法,将参考前景和背景视为冻结DINOv3特征单位球上的点云,通过非参数密度比标记查询像素,在遥感基准上超越现有方法。
Comments 20 pages
基于物理信息的条件归一化流用于仅角度地月空间轨道确定
机构 * University of Strathclyde(斯特拉斯克莱德大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出使用条件归一化流从短弧角度测量中推断地月空间初始状态的后验分布,结合物理信息采样并通过非线性最小二乘优化提供经典算法的热启动。
ViQ: 任意分辨率下的文本对齐视觉量化表示
机构 * Tencent HY Vision Team(腾讯HY视觉团队) ; Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Chinese Academy of Sciences(中国科学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。
Comments Accepted to ECCV 2026
后训练如何塑造生物学推理模型
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究院)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。