arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-10 至 2026-06-10 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2606.09853 2026-06-10 cs.LG cs.IT math.IT 新提交 82%

SynIB: Informational Bottleneck for Maximizing Synergy in Multimodal Learning

SynIB: 多模态学习中最大化协同的信息瓶颈

Konstantinos Kontras, Teodora Gagaleska, Thomas Strypsteen, Christos Chatzichristos, Matthew Blaschko, Maarten De Vos, Paul Pu Liang

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出SynIB方法,通过信息瓶颈理论直接优化多模态协同,在训练中屏蔽单模态时惩罚高置信度,提升跨模态推理能力,在合成和真实任务上准确率提升达7.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10742 2026-06-10 cs.CR cs.LG 新提交 78%

MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents

MemVenom:网络代理中多模态记忆的触发式投毒

Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tianjin University(天津大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 提出MemVenom框架,针对网络代理的外部记忆系统,通过触发条件检索和攻击诱导,实现黑盒多模态记忆投毒,达到高成功率且不影响良性性能。

Comments Preprint. 27 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10571 2026-06-10 cs.CV cs.AI cs.CR 新提交 73%

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction

通过代理特定偏差校正提高视觉-语言预训练模型上的对抗迁移性

Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出DeBias-Attack方法,通过梯度校正消除代理特定偏差,提高对抗样本在VLP模型间的迁移性,实验验证其在多种模型和任务上的有效性。

Comments 17 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09871 2026-06-10 cs.CV cs.AI cs.LG 新提交 62%

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

SD-GRPO:面向长格式视觉-语言生成的可验证片段分解

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SD-GRPO方法,通过将长格式输出分解为片段并计算逐片段优势,解决GRPO在视觉-语言任务中粗粒度信用分配不足的问题,实验证明其在多种长格式生成任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2606.10147 2026-06-10 cs.AI cs.CL cs.CV cs.SD 新提交 85%

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

从感知到决策:多模态大语言模型中听觉与视觉感知的信息流

Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu, Sara Atito

机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) University of Surrey(萨里大学) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。

Comments 40 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10533 2026-06-10 cs.CV 新提交 83%

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

音频-视觉交换感知令牌剪枝用于高效音频-视觉字幕生成

Zihan Meng, Dexiang Hong, Weidong Chen, Ziyu Zhou, Bo Hu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出基于强化学习的AVEX-Prune方法,通过跨模态令牌交换策略选择高置信度令牌,在40%保留率下保持全令牌质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10738 2026-06-10 eess.AS cs.AI 新提交 81%

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-06-10 cs.SD cs.MM 版本更新 79%

MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10887 2026-06-10 cs.CV 新提交 70%

Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio

听、看、学:通过SAM-Audio实现无遗忘学习

Avi Gupta, Nilotpal Sinha, Vishnu Raj, Sambuddha Saha, Pratik Joshi, Koteswar Rao Jerripothula, Tammam Tillo

机构 * University of Washington(华盛顿大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出一种利用SAM-Audio多模态先验的类增量学习方法,通过引导注意力机制和双层蒸馏策略,在音频-视觉场景中缓解灾难性遗忘,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10010 2026-06-10 eess.AS cs.AI cs.MM cs.SD 新提交 67%

DeRA-MOS: Optimizing Text-to-Music Evaluation via Decoupled Listwise Ranking and Modality Alignment

DeRA-MOS:通过解耦列表排序和模态对齐优化文本到音乐评估

Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen

机构 * E.SUN Financial Holding Co., Ltd.(E.SUN财务控股公司) United Link Co., Ltd.(联合链接有限公司) Institute of Information Science, Academia Sinica(学术院信息科学研究所) Department of Computer Science and Information Engineering, National Taiwan Normal University(台湾师范大学计算机科学与信息工程系)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 提出DeRA-MOS解耦优化框架,通过批感知列表排序损失和分数锚定模态对齐损失,分别优化音乐印象和文本对齐的排名指标,在MusicEval上显著提升评估性能。

Comments Accepted to IEEE Signal Processing Letters (SPL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11033 2026-06-10 cs.LG cs.AI cs.CL 新提交 62%

AuRA: Internalizing Audio Understanding into LLMs as LoRA

AuRA: 将音频理解内化到LLM中作为LoRA

Bo Cheng, Lei Shi, Zhanyu Ma, Yuan Wu, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Jilin University(吉林大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出AuRA方法,通过层间蒸馏将ASR编码器的语音表示内化到LoRA适配的LLM中,实现紧耦合的语音-语言联合建模和高效并行端到端推理,在多个基准上优于级联系统和现有适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2606.10819 2026-06-10 cs.CV cs.AI 新提交 90%

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Earth-OneVision:将遥感多模态大语言模型扩展到更多传感器模态和任务

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing (SBIIP), Beijing Institute of Technology(北京理工大学空间智能信息处理国家重点实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) Key Laboratory of Technology in Geo-Spatial Information Processing and Application System, Chinese Academy of Sciences(中国科学院地理空间信息处理与应用系统技术重点实验室) Advanced Research Institute of Multidisciplinary Sciences, Beijing Institute of Technology(北京理工大学前沿交叉科学研究院) School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) School of Electronics, Peking University(北京大学电子学院) School of Computer Science and Hubei Key Laboratory of Intelligent Geo-Information Processing(华中科技大学计算机科学与技术学院&湖北省智能地理信息处理重点实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出Earth-OneVision,一个2B参数的RS-MLLM,通过全粒度视觉语言对齐、空间语言同构序列化和渐进式跨模态适应机制,统一六种传感器模态和九类任务,在多个基准上达到或超越4B-72B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09907 2026-06-10 cs.LG cs.AI 新提交 79%

LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

Maxx Richard Rahman, Prakhar Kumar, Wolfgang Maass

机构 * German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出LongMoE框架,通过上下文感知插补、注意力标记化、轨迹感知编码和稀疏MoE路由,联合解决临床多模态学习中模态缺失和纵向动态两大挑战,在ADNI等数据集上验证了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20850 2026-06-10 cs.CV cs.RO 版本更新 79%

Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

Glove2Hand:从多模态传感手套合成自然的手-物体交互

Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan

机构 * Meta Reality Labs(Meta现实实验室) Rutgers University(罗格斯大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出Glove2Hand框架,将多模态传感手套视频转化为逼真的裸手,并保留物理交互动态;引入3D高斯手模型和扩散手恢复器,创建HandSense数据集,提升下游任务性能。

Comments CVPR 2026 Highlight. This version includes the motion retarget process in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10651 2026-06-10 cs.CV 新提交 77%

Kwai Keye-VL-2.0 Technical Report

Kwai Keye-VL-2.0 技术报告

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

机构 * Kuaishou Group(快手集团)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出开源MoE多模态基础模型Keye-VL-2.0,首次将DeepSeek稀疏注意力适配到GQA架构,支持无损256K上下文处理,并通过跨模态多教师策略蒸馏和上下文/视频强化学习解决多任务对齐中的灾难性遗忘,在长视频理解和智能体任务上达到同类最优。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11186 2026-06-10 cs.CV 新提交 70%

AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic Inference

AnyMod-LLVE: 模态无关推理的低光照视频增强

Hangfeng Liang, Yutao Hu, Yanhan Hu, Xiaohan Wu, Wenqi Shao, Ying Fu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出AMNet统一多模态框架,通过空间-频谱双门控转换器学习辅助模态与RGB输入的对应关系,支持推理时任意模态组合,解决低光照视频增强中辅助模态缺失问题。

Comments Accepted at ICML 2026; Project page and code: https://lhfgghc.github.io/LLVE-AMNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10517 2026-06-10 cs.CV 新提交 57%

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

LAFP:通过流匹配在潜在策略学习中保留潜在动作结构

Jiexi Lyu, Xizhou Bu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

机构 * Fudan University(复旦大学) Morphi

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出LAFP方法,利用流匹配学习潜在策略,并引入推理时插值机制缓解随机性导致的错位,在模仿学习任务中成功率提升10-15%,推理开销增加不到1倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09681 2026-06-10 cs.CV 版本更新 57%

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development

GenEyePose:用于数字神经生理学生物标志物开发的无患者、基于知识的扫视眼动建模

Tianyu Lin, Jooyoung Ryu, Puvada Sreevarsha, Rahul Srinivasaragavan, Riya Satavlekar, Susan Kim, Nidhi Soley, Yujie Yan, Ishan Vatsaraj, Carl Harris, Aimon Rahman, Vishal Patel, Joseph Greenstein, Casey Taylor, Kemar E. Green

机构 * Whiting School of Engineering, Johns Hopkins University(约翰霍普金斯大学惠廷工程学院) Department of Neurology, Johns Hopkins Medicine(约翰霍普金斯医学院神经内科)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出首个全合成、无患者的多模态眼动生成流水线,用于泛化扫视分析;基于合成数据训练的深度学习分类器在真实临床数据上区分正常与异常扫视精度,AUROC达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交 50%

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10743 2026-06-10 cs.RO 新提交 50%

Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization

基于开放世界接触定位的以手为中心的人到机器人轨迹迁移

Yitian Shi, Di Wen, Zhengqi Han, Zicheng Guo, Yu Hu, Edgar Welte, Kunyu Peng, Rainer Stiefelhagen, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出HOWTransfer框架,通过接触定位从人类视频中提取接触感知的机器人轨迹,无需物体特定描述,在多样化操作任务中实现86%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2510.15470 2026-06-10 cs.CV cs.IR 79%

MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval

MSAM:多语义自适应挖掘用于跨模态无人机视频-文本检索

Jinghao Huang, Yaxiong Chen, Ganchao Liu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学与电子学院(iOPEN))

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出MSAM方法,通过多语义自适应学习机制提升无人机视频-文本跨模态检索性能,采用细粒度交互和自适应语义构建模块增强特征表示鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 57%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2606.10340 2026-06-10 cs.RO 新提交 82%

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :omni-modal(title,abstract);multi-modal(abstract)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17254 2026-06-10 cs.AI 版本更新 79%

CatalyticMLLM: A Graph-Text Multimodal Large Language Model for Catalytic Materials

CatalyticMLLM: 一种用于催化材料的图-文本多模态大语言模型

Yanjie Li, Jian Xu, Xu-Yao Zhang, Shiming Xiang, Nian Ran, Weijun Li, Cheng-Lin Liu

机构 * AnnLab(安实验室) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Zhongguancun Academy(中关村学院) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院) University of ChineseAcademy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种统一的图-文本多模态大语言模型QE-Catalytic-V2,用于催化材料的性质预测和逆向设计,通过共享的表示空间实现两者的联合建模,从而形成闭环优化流程。

Comments 71 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 57%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10413 2026-06-10 cs.AI 新提交 57%

Soul Computing: A Theoretical Framework and Technical Architecture for Intelligent Agents with Independent Consciousness

灵魂计算:具有独立意识的智能体的理论框架与技术架构

Jinshan Zhang, Xishi Zhou, Qiu Peng, Jianwei Yin

机构 * Innovation and Management Center, School of Software Technology, Zhejiang University (Ningbo)(浙江大学(宁波)软件学院创新与管理中心) School of Software Technology, Zhejiang University, Ningbo(浙江大学软件学院(宁波))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出“灵魂计算”范式,区分狭义与广义概念,构建以意向性核心为特征的智能体架构,实现AI从工具到生命体的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03963 2026-06-10 cs.RO cs.AI 版本更新 57%

AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation

面向视觉条件的无人机导航的自优化智能体强化学习

Roohan Ahmed Khan, Yasheerah Yaqoot, Amir Atef Habel, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出AgenticRL框架,利用多模态GPT智能体自动设计奖励函数、通过闭环自改进优化策略,在多种无人机导航任务中提升性能并实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22192 2026-06-10 cs.CV 版本更新 57%

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09851 2026-06-10 cs.HC 新提交 50%

ECHO: Explainable Co-editing with Human-in-the-loop Operations for Presentation Refinement

ECHO: 基于人在环操作的可解释协同编辑用于演示文稿优化

Yu Fu, Yongqi Kang, Yujia Zhou, Yong Zhao

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对演示文稿创作中用户缺乏细粒度控制的问题,提出ECHO系统,通过多模态意图理解和可解释操作计划,结合“自然语言+视觉选择”范式和解耦的“计划-确认-执行”循环,实现可控的局部编辑,显著降低认知负荷并提升意图映射与空间定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2606.10194 2026-06-10 cs.LG cs.AI 新提交 83%

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

MMClima:多模态气候科学数据与评估框架

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Missouri(密苏里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出MMClima,一个包含10万+专家验证问答对的多模态气候问答框架,覆盖文本、视频和图表,用于评估多模态语言模型在气候科学中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏