arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-11 至 2026-05-11 共收录 93 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 26 篇

2605.07760 2026-05-11 cs.AI 70%

RuleSafe-VL: Evaluating Rule-Conditioned Decision Reasoning in Vision-Language Content Moderation

RuleSafe-VL:评估视觉-语言内容审核中的规则条件决策推理

Zhifeng Lu, Dianyuan Wang, Yuhu Shang, Zhenbo Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 RuleSafe-VL通过构建93个基本规则和92种规则关系,评估视觉-语言内容审核中规则条件决策推理的诊断能力,发现规则关系恢复是主要瓶颈,最佳模型仅达到64.8 Macro-F1。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07149 2026-05-11 cs.CV 70%

Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Real-IAD MVN:一种多视角法向量数据集和基准,用于高保真工业异常检测

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng

机构 * Fudan University(复旦大学) Shanghai Ocean University(上海海洋大学) Donghua University(东华大学) Rongcheer Co., Ltd.(荣驰科技有限公司)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Real-IAD-MVN数据集,通过多视角法向量捕捉微细几何缺陷,验证密集多视角伪3D数据在工业异常检测中的优越性能。

Comments Accepted to CVPR 2025. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07338 2026-05-11 cs.CV 57%

ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs

ShellfishNet:面向海洋软体动物视觉识别的领域专用基准数据集

Ziheng Zhou, Yang Wang, Nan Wang, Chengliang Wu, Jun Yan

机构 * IT College, Shanghai Ocean University(上海海洋大学信息学院) Fudan University(复旦大学) DP Technology(DP技术)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文构建了ShellfishNet数据集,包含8691张图像,用于评估视觉模型在真实环境下的泛化能力,测试了80种神经网络模型及多模态大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07178 2026-05-11 cs.CV 57%

Masks Can Talk: Extracting Structured Text Information from Single-Modal Images for Remote Sensing Change Detection

掩码可以说话:从单模图像中提取结构化文本信息用于遥感变化检测

Kai Zheng, Hang-Cheng Dong, Jiatong Pan, Zhenkai Wu, Fupeng Wei, Wei Zhang

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院) North China University of Water Resources and Electric Power(华北水利水电大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出S2M框架,通过零额外标注成本从变化标签中直接提取结构化文本特征,提升遥感变化检测的多模态监督效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 57%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06863 2026-05-11 cs.RO cs.HC 50%

Bi3: A Biplatform, Bicultural, Biperson Dataset for Social Robot Navigation

Bi3:一个双平台、双文化、双人数据集用于社交机器人导航

Andrew Stratton, Phani Teja Singamaneni, Pranav Goyal, Rachid Alami, Christoforos Mavrogiannis

机构 * Department of Robotics, University of Michigan(机器人系,密歇根大学) LAAS-CNRS, University of Toulouse(LAAS-CNRS,图卢兹大学) INRIA, University of Lorraine(INRIA,洛林大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 Bi3数据集通过双平台、双文化、双人交互,为社交机器人导航提供多样性模型复杂性的基准,用于研究人类与机器人在受限环境中的协同活动。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2605.07510 2026-05-11 cs.CV cs.CL cs.IR 81%

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

InterLV-Search:交错多模态代理搜索基准测试

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Damo Academy, Alibaba Group(阿里达摩院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出InterLV-Search基准测试,用于评估交错语言-视觉代理搜索,包含多层级任务,涵盖主动视觉证据搜索、受控离线交错多模态搜索和开放网页交错多模态搜索,揭示当前系统在视觉证据获取、搜索控制及多模态证据整合方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16876 2026-05-11 cs.CV cs.AI cs.LG 81%

Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation

多模态多智能体强化学习在放射学报告生成中的应用

Kaito Baba, Risa Kishikawa, Satoshi Kodera

机构 * Department of Cardiovascular Medicine(心血管医学科)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MARL-Rad框架,通过多智能体强化学习提升放射学报告生成的临床效果,通过联合优化区域特定智能体和全局整合智能体,提高报告的准确性和一致性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13724 2026-05-11 cs.AI 79%

Heterogeneous Graph Neural Networks with Post-hoc Explanations for Multi-modal and Explainable Land Use Inference

异构图神经网络与事后解释方法用于多模态和可解释的土地利用推断

Xuehao Zhai, Junqi Jiang, Adam Dejl, Antonio Rago, Fangce Guo, Francesca Toni, Aruna Sivakumar

机构 * Imperial College London, Department of Civil and Environmental Engineering(帝国理工学院伦敦校区土木与环境工程系) Imperial College London, Department of Computing(帝国理工学院伦敦校区计算机系)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一种结合异构图神经网络与可解释AI的方法,用于多模态土地利用推断,提升了准确性和可解释性,尤其在办公和生活用地方面表现突出。

Journal ref Information Fusion, Volume 120, 103057. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16571 2026-05-11 cs.AI cs.IR cs.MA 70%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07101 2026-05-11 cs.MA stat.ML 50%

Decentralized Diffusion Policy Learning for Enhanced Exploration in Cooperative Multi-agent Reinforcement Learning

去中心化扩散策略学习用于增强合作多智能体强化学习中的探索

Yuyang Zhang, Haldun Balim, Na Li

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出去中心化扩散策略学习方法,通过扩散概率模型提升多智能体强化学习中的探索能力,解决了高维动作空间下的策略表达限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01166 2026-05-11 cs.RO 50%

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

隐式推理VLA:面向视觉-语言-动作模型的隐式思考与预测

Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出LaRA-VLA框架,通过连续潜在表示实现多模态推理,减少推理开销,提升机器人实时控制效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 17 篇

2512.02991 2026-05-11 cs.CV 83%

GraphFusion3D: Dynamic Graph Attention Convolution with Adaptive Cross-Modal Transformer for 3D Object Detection

GraphFusion3D: 动态图注意力卷积与自适应跨模态Transformer用于3D目标检测

Md Sohag Mia, Md Nahid Hasan, Muhammad Abdullah Adnan

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出GraphFusion3D框架,结合多模态融合与先进特征学习,通过自适应跨模态Transformer增强几何与语义信息,并引入图推理模块捕捉局部结构与全局语义,实验在SUN RGB-D和ScanNetV2上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07356 2026-05-11 cs.CV 83%

UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Share-Private Multimodal Decomposition

UniD-Shift:通过可解释的共享-私有多模态分解实现统一的语义分割

Shuai Zhang, Zhecheng Shi, Zhuxiao Li, Jing Ou, Tengxi Wang, Yuan Liu, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出UniD-Shift框架,通过结合视觉和几何编码器提取互补特征,并通过共享-私有子空间分解实现2D-3D语义分割的统一。实验表明在SemanticKITTI和nuScenes数据集上优于基线方法,且具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07817 2026-05-11 cs.CV cs.AI cs.CL 82%

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM:通过内部注意力控制实现多模态推理的主动视觉

Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院) TU Wien(维也纳技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GazeVLM通过内部注意力控制实现主动视觉,使模型在多模态推理中实现从全局空间感知到局部聚焦推理的无缝切换,无需外部工具或增加视觉token。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 79%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06990 2026-05-11 cs.CV cs.LG 79%

TRAJGANR: Trajectory-Centric Urban Multimodal Learning via Geospatially Aligned Neural Representations

TRAJGANR: 通过地理对齐的神经表示进行轨迹导向的城市多模态学习

Maria Despoina Siampou, Gengchen Mai, Ni Lao, Jinmeng Rao, Neha Arora, Cyrus Shahabi, Shushman Choudhury

机构 * Google Research, Mountain View, CA(谷歌研究,山景城,加利福尼亚州) Google LLC, Mountain View, CA(谷歌公司,山景城,加利福尼亚州) Dept. of Computer Science, University of Southern California, Los Angeles, CA(计算机科学系,南加州大学,洛杉矶,加利福尼亚州) SEAI Lab, Dept. of Geography and the Environment, The University of Texas at Austin, Austin, TX(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 TRAJGANR提出一种新的多模态自监督学习框架,通过将连续移动模式与静态位置观察对齐,提升城市理解和移动任务的性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07825 2026-05-11 cs.MM cs.CV 79%

Anisotropic Modality Align

各向异性模态对齐

Xiaomin Yu, Yijiang Li, Yuhui Zhang, Hanzhen Zhao, Yue Yang, Hao Tang, Yue Song, Xiaobin Hu, Chengwei Qin, Shuicheng Yan, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) UCSD(加州大学圣地亚哥分校) Stanford(斯坦福大学) PKU(北京大学) THU(清华大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文研究了多模态模型中模态间转换的可行性,提出各向异性模态对齐方法,通过几何修正框架提升单模态数据的多模态训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04323 2026-05-11 cs.LG cs.DB 78%

LUCAS-MEGA: A Large-Scale Multimodal Dataset for Representation Learning in Soil-Environment Systems

LUCAS-MEGA:一个大规模多模态数据集,用于土壤-环境系统的表示学习

Kuangdai Leng, Simon Jeffery, Panos Panagos, Tarje Nissen-Meyer

机构 * Earth Rover Program(Earth Rover项目) Centre for Crop and Environmental Science(作物与环境科学中心) European Commission Joint Research Centre(欧盟联合研究中心) Department of Mathematics and Statistics & Center for Environmental Intelligence(数学与统计系及环境智能中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 LUCAS-MEGA通过系统数据融合构建了大规模多模态数据集,用于提升土壤-环境系统的表示学习能力,通过SoilFuser管道标准化数据并生成统一特征空间,预训练SoilFormer模型实现了稳定的训练和预测性能。

Comments 27 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07106 2026-05-11 cs.CL 77%

Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning

检索、整合与综合:空间-语义 grounded 的潜在视觉推理

Jin Cui, Xinyue Long, Xunyong Zhang, Yadong Zhang, Chuanchang Su, Jingye Gan, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL

AI总结 本文提出RIS框架,通过空间-语义 grounded 方法改进多模态大语言模型的视觉推理,通过构建逐步 grounded 数据集并引入短语言过渡token,提升潜在状态与词汇对齐的解码能力,实验显示在多个基准上优于现有基线。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07250 2026-05-11 cs.CV cs.AI 76%

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

专题命中 多模态训练与对齐 :MLLM(title);分类 cs.CV、cs.AI

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26524 2026-05-11 cs.LG cs.AI 74%

TAP: Two-Stage Adaptive Personalization of Multi-Task and Multi-Modal Foundation Models in Federated Learning

TAP: 多任务和多模态基础模型在联邦学习中的两阶段自适应个性化

Seohyun Lee, Wenzhi Fang, Dong-Jun Han, Seyyedali Hosseinalipour, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学) University at Buffalo-SUNY(布法罗大学-苏尼尔)

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.AI

AI总结 本文提出TAP方法,通过两阶段自适应个性化在联邦学习中提升多任务和多模态基础模型的泛化能力,解决数据、任务和模态异质性问题。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07055 2026-05-11 cs.CV cs.AI 62%

Pan-FM: A Pan-Organ Foundation Model with Saliency-Guided Masking for Missing Robustness

Pan-FM:一种具有显著性引导掩码的全器官基础模型以实现缺失鲁棒性

Qiangqiang Wu, Grace McIlvain, Zhou Yu, Junhao Wen

机构 * Laboratory of AI and Biomedical Science(人工智能与生物医学科学实验室) Columbia University(哥伦比亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Pan-FM通过显著性引导掩码技术,解决多模态生物医学数据缺失问题,提升全器官表示学习的鲁棒性,优于单器官和多器官基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07019 2026-05-11 cs.CV cs.AI 62%

LensVLM: Selective Context Expansion for Compressed Visual Representation of Text

LensVLM:压缩文本视觉表示的选取性上下文扩展

Roy Xie, Dan Friedman, Donghan Yu, Bowen Pan, Christopher Fifty, Jang-Hyun Kim, Xianzhi Du, Zhe Gan, Vivek Rathod, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LensVLM通过选择性上下文扩展提升压缩视觉表示的准确性,在4.3倍压缩下表现优异,且在多模态任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07781 2026-05-11 cs.CV 57%

Differentiable Ray Tracing with Gaussians for Unified Radio Propagation Simulation and View Synthesis

基于高斯的可微射线追踪用于统一的无线传播模拟与视图合成

Niklas Vaara, Lam Huynh, Pekka Sangi, Miguel Bordallo López, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰) CubiCasa Oy, Finland(芬兰CubiCasa公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于高斯的可微射线追踪框架,实现无线传播模拟与视图合成的统一空间表示,通过可视化重建神经场景直接计算点对点路径,保留高质量视觉渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 57%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14998 2026-05-11 cs.CV 57%

Tables Guide Vision: Learning to See the Heart through Tabular Data

表格引导视觉:通过表格数据学习看见心脏

Marta Hasny, Maxime Di Folco, Keno Bressem, Julia Schnabel

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich(生物医学成像中的机器学习研究所,海德堡慕尼黑) School of Biomedical Engineering and Imaging Sciences, King’s College London(国王学院伦敦生物医学工程与成像科学学院) TUM University Hospital, Technical University of Munich(技术大学慕尼黑大学医院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于表格数据的对比学习框架,利用临床相关表格数据识别患者层面相似性,构建更有意义的配对,提升语义对齐的表示学习,并通过零样本预测验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07100 2026-05-11 stat.ML cs.LG 50%

TRACE: Transport Alignment Conformal Prediction via Diffusion and Flow Matching Models

TRACE: 通过扩散与流匹配模型进行传输对齐的置信域

Zhenhan Fang, Aixin Tan, Jian Huang

机构 * Department of Statistics and Actuarial Science University of Iowa(统计与精算科学系,爱荷华大学) Departments of Data Science and AI, and Applied Mathematics The Hong Kong Polytechnic University(数据科学与人工智能系、应用数学系,香港理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出TRACE框架,通过扩散和流匹配模型中的传输对齐定义非符合性分数,实现多维输出的有效置信域构造,验证了其在复杂生成设置中的有效性。

Comments 22 pages, 5 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏