arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 177 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 24 篇

2605.18018 2026-05-19 cs.CV cs.AI cs.HC 73%

See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding

See What I Mean: 对齐视觉与语言表示以实现视频细粒度物体理解

Boyuan Sun, Bowen Yin, Yuanming Li, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Lab, Alibaba Group(阿里云实验室) NKIARI, Shenzhen Futian(深圳福田国家信息研究所)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SWIM方法,通过对齐视觉和语言表示,仅从文本提示中实现细粒度物体理解,解决了传统方法需要显式视觉提示的问题,通过构建NL-Refer数据集和多层交叉注意力图提升文本-视觉对齐性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16481 2026-05-19 cs.CV cs.AI 73%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18176 2026-05-19 cs.CV cs.AI 62%

MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

MARS:EgoVis 2026 CASTLE挑战的技术报告

Haoyu Zhang, Qiaohui Chu, Yisen Feng, Meng Liu, Weili Guan, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MARS系统,用于EgoVis 2026的CASTLE挑战,通过多模态代理推理解决需要多源信息的复杂问题,核心方法是多模态证据选择,主要贡献是实现了在多源数据上的有效推理。

Comments The Runner-up Solution for CASTLE Challenge @ EgoVis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15735 2026-05-19 cs.CV cs.AI 62%

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

UAM:VL A训练中遗忘的双流视角

Jianke Zhang, Yuanfei Luo, Yucheng Hu, Xiaoyu Chen, Yanjiang Guo, Ziyang Liu, Hongbin Xu, Tian Lan, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UAM模型,通过双流架构解决VL A训练中因单一编码器导致的多模态能力下降问题,展示了通过架构分离而非冻结权重或辅助数据可实现语义保留,并在多种任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16419 2026-05-19 cs.CV cs.AI cs.RO 62%

Agentic Pipeline for Self-Synchronized Multiview Joint Angle Monitoring in Uncalibrated Environments

基于代理的自同步多视角关节角度监控管道:在无标定环境中

Juncheng Yu, Lusi A, Haoxuan Xie, Weiming Wang

机构 * National Engineering Research Center of Neuromodulation, School of Aerospace Engineering, Tsinghua University(神经调制国家工程研究中心,航空航天工程学院,清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于代理的自同步多视角关节角度监控方法,利用两台摄像头在无标定环境下实现自动视频同步和自验证,通过多模态大语言模型和先进单目2D姿态估计模型提取候选姿态,并通过代理选择机制自动识别和跟踪目标个体,以在多人和遮挡情况下产生一致的2D姿态,从而估计关节角度。

Comments Accepted by EMBC 2026. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18636 2026-05-19 cs.CV 57%

SPIKE: An Adaptive Dual Controller Framework for Cost-Efficient Long-Horizon Game Agents

SPIKE:一种适应性双控制器框架,用于成本效益高的长周期游戏智能体

Wencan Jiang, Jiangning Zhang, Jianbiao Mei, Jinzhuo Liu, Yu Yang, Xiaobin Hu, Zhucun Xue, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SPIKE框架,通过双控制器设计实现成本高效长周期游戏智能体,通过事件触发机制和分层记忆结构提升目标导向性和任务完成率,实验表明在StarDojo数据集上显著提升成功率并降低资源消耗。

Comments https://wencanjiang.github.io/projects/SPIKE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18320 2026-05-19 cs.LG cs.AI 57%

ISEP: Implicit Support Expansion for Offline Reinforcement Learning via Stochastic Policy Optimization

ISEP: 通过随机策略优化实现离线强化学习的隐式支持扩展

Yifei Chen, Shaoqin Zhu, Xiaoqiang Ji

机构 * The Chinese University of Hong Kong, Shenzhen Longgang(香港中文大学(深圳)松山湖校区)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ISEP方法,通过随机策略优化实现离线强化学习中的隐式支持扩展,以解决传统方法在安全约束下难以发现最优行为的问题,核心贡献是通过价值函数插值和随机动作选择策略提高策略改进的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12978 2026-05-19 cs.RO cs.AI 57%

Learning Native Continuation for Action Chunking Flow Policies

学习原生延续以实现动作分块流策略

Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, Dequan Wang, Yang Gao

机构 * Spirit AI

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Legato方法,通过训练时的延续技术改进动作分块流基于VLA策略,减少动作边界不连续性和伪多模态切换,提升轨迹平滑度和任务完成效率。

Comments Accepted by Robotics: Science and Systems 2026 (RSS 2026). Project page: https://lyfeng001.github.io/Legato/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16452 2026-05-19 cs.LG cs.AI 57%

Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign

峰值检测器:通过指令调优的大语言模型实现可解释的多模态峰值检测

Jiahui Li, Yida Zhang, Zixuan Zeng, Jiayu Chen, Yingjian Song, Yin Xiao, Nishan Dong, Junjie Lu, Younghoon Kwon, Xiang Zhang, Jin Lu, Wenzhan Song, Fei Dou

机构 * University of Georgia(佐治亚大学) Yixing People’s Hospital(宜兴人民医院) University of Washington(华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Peak-Detector框架,利用指令调优的大语言模型实现跨模态、可解释的峰值检测,通过峰表示技术压缩时间序列数据并提升检测准确性,同时生成解释性内容以支持验证与错误分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16442 2026-05-19 cs.RO cs.AI cs.LG 57%

Hierarchical Two-Stage Framework for Environment-Aware Long-Horizon Vessel Trajectory Prediction

面向环境的长航程船舶轨迹预测分层两阶段框架

Ganeshaaraj Gnanavel, Tharindu Fernando, Sridha Sridharan, Clinton Fookes

机构 * SAIVT Research Group, Queensland University of Technology(SAIVT研究组,昆士兰理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出分层两阶段框架,结合长短期预测器与网格感知短期预测器,通过分层融合机制提升船舶轨迹预测精度,实验显示在ADE和FDE上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18687 2026-05-19 math.OC 50%

Implementation-Based Incentive Design for Autonomous Mobility-on-Demand and Transit Systems

基于实施的激励设计用于自动驾驶出行按需和公共交通系统

Xinling Li, Runyu Zhang, Gioele Zardini

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于实施的激励设计方法,用于解决自动驾驶出行按需和公共交通系统在追求自私目标时如何实现社会最优运行点的问题,通过分解支付来解决运营商单方面偏离不具有吸引力的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06866 2026-05-19 cs.LG 50%

T-STAR: A Context-Aware Transformer Framework for Short-Term Probabilistic Demand Forecasting in Dock-Based Shared Micro-Mobility

T-STAR: 一种基于上下文的Transformer框架用于基于码头的共享微出行短期概率需求预测

Jingyi Cheng, Gonçalo Homem de Almeida Correia, Oded Cats, Shadi Sharif Azadeh

机构 * Transport and Planning, Delft University of Technology(代尔夫特理工大学交通与规划)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出T-STAR框架,通过两级结构分离一致需求模式和短期波动,提升短期概率需求预测的准确性,实验表明其在确定性和概率性准确性上均优于现有方法,且具备良好的时空鲁棒性。

Comments This work has been submitted to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17701 2026-05-19 eess.SY cs.SY 50%

Architecture Dependent Temporal Observability Under Deployment Interference in Edge Inference Systems

边缘推理系统中部署干扰影响下的时间可观性依赖于架构

Akul Swami, Nikhil Chougule

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了在边缘推理系统中部署干扰对时间可观性的影响,通过对比不同架构下的延迟分布和内存压力,发现单一时间源的统计信息可能掩盖了独立外部观察者可见的故障模式。

Comments 13 pages, 7 figures, 1 table. Workshop preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17123 2026-05-19 cs.HC cs.RO 50%

ATRACT: A Trustworthy Robotic Autonomous system to support Casualty Triage

ATRACT: 一种可靠的机器人自主系统以支持伤员分诊

Tasweer Ahmad, Rafael Pina, Sandip Pradhan, Arindam Sikdar, Mindula Illeperuma, Khizer Saeed, Peter Lee, Varuna De Silva, Ardhendu Behera

机构 * Department of Computer Science, Edge Hill University(埃德希尔大学计算机科学系) Institute for Digital Technologies, Loughborough University London(洛斯伯勒大学伦敦数字技术研究所) School of Architecture, Technology and Engineering, University of Brighton(布莱顿大学建筑、技术与工程学院) School of Criminology and Criminal Justice, University of Portsmouth(普茅斯大学犯罪学与刑事司法学院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出ATRACT,一种人机协同的决策支持系统,通过多模态学习整合无人机视频与可穿戴传感器数据,以提高战场伤员分诊的准确性,同时减少前线医疗人员的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03147 2026-05-19 eess.SP 50%

Real-Time Non-Invasive Imaging and Detection of Spreading Depolarizations through EEG: An Ultra-Light Explainable Deep Learning Approach

实时非侵入式成像与检测扩散性去极化通过EEG:一种超轻量可解释深度学习方法

Yinzhe Wu, Sharon Jewell, Xiaodan Xing, Yang Nan, Anthony J. Strong, Guang Yang, Martyn G. Boutelle

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出一种超轻量多模态深度学习网络,通过融合EEG频谱图像和时间功率向量,提升单电极上的扩散性去极化检测精度,实现低密度EEG下的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16285 2026-05-19 cs.HC cs.CY 50%

Making Sense of the Weather, Together: Collaborative Sensemaking in Severe Weather Livestreams

共同解读天气:在恶劣天气直播中协作意义建构

Julie A. Vera, Mark Zachry, David W. McDonald

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究恶劣天气事件中通过'天气主播'直播解读气象现象的协作意义建构,分析其如何利用多源信息、时间衔接技术和平台适应性,挑战传统危机沟通模式。

Comments Accepted to CSCW 2026; 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 11 篇

2604.11043 2026-05-19 cs.AI 88%

EmergentBridge: Improving Zero-Shot Cross-Modal Transfer in Unified Multimodal Embedding Models

EmergentBridge: 提升统一多模态嵌入模型中的零样本跨模态迁移

Jincheng Xie, Xingchen Xiao, Runheng Liu, Zhongyi Huang, Yu Zheng, Heyan Huang

机构 * Tsinghua University(清华大学) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出EmergentBridge框架,通过学习噪声桥梁锚点和子空间对齐,提升未配对模态对的零样本迁移性能,无需 exhaustive pairwise 监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17509 2026-05-19 eess.AS 83%

Audio-Image Cross-Modal Retrieval with Onomatopoeic Images

音频-图像跨模态检索与拟声图像

Keisuke Imoto, Yamato Kojima, Takao Tsuchiya

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种双向检索框架,用于将拟声图像与对应声音片段进行跨模态检索,通过训练模态特定的投影头来重新对齐视觉拟声和声音的嵌入表示,并构建了包含50种声音事件类别的多模态图像-音频拟声数据集MIAO,实验结果表明该方法在两个方向上的检索效果均优于基于预训练CLIP和CLAP嵌入的零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14787 2026-05-19 cs.CV cs.CL 81%

Do Composed Image Retrieval Benchmarks Require Multimodal Composition?

组合图像检索基准是否需要多模态组合?

Matteo Attimonelli, Alessandro De Bellis, Aryo Pradipta Gema, Rohit Saxena, Monica Sekoyan, Wai-Chung Kwan, Claudio Pomo, Alessandro Suglia, Dietmar Jannach, Tommaso Di Noia, Pasquale Minervini

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马萨皮恩扎大学) University of Edinburgh(爱丁堡大学) University of Klagenfurt(克雷格弗特大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究发现组合图像检索任务中,许多查询可通过单一模态解决,而非真正的多模态组合,揭示了多模态组合的假设不成立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16638 2026-05-19 cs.AI 79%

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

TTE-Flash: 通过思考-然后-嵌入标记加速基于推理的多模态表示

Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

机构 * Meta AI

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TTE-Flash模型,通过引入隐式思考标记替代显式推理链,实现多模态表示的高效推理。模型在MMEB-v2基准上优于显式CoT方法,且在零样本评估中展示了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 78%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00505 2026-05-19 cs.IR cs.AI cs.CL 62%

LLM-Oriented Information Retrieval: A Denoising-First Perspective

面向大语言模型的信息检索:一种去噪优先的视角

Lu Dai, Liang Sun, Fanpu Cao, Ziyang Rao, Cehao Yang, Hao Liu, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种以去噪为核心的信息检索方法,强调在信息检索全流程中,最大化可利用证据密度和可验证性是关键瓶颈,通过四个阶段框架和信号-噪声优化技术分类,探讨了信息检索中的挑战和解决方案。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18434 2026-05-19 cs.IR cs.CV 57%

TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval

TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索

Xinyu Sun, Huangyu Dai, Lingtao Mao, Zexin Zheng, Zihan Liang, Ben Chen, Chenyi Lei, Wenwu Ou

机构 * Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18029 2026-05-19 cs.CV 57%

What Matters for Grocery Product Retrieval with Open Source Vision Language Models

在开源视觉语言模型中,什么因素影响杂货产品检索

Emmanuel G. Maminta, Rowel O. Atienza

机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。

Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16755 2026-05-19 cs.LG cs.AI 57%

Learning Unbiased Permutations via Flow Matching

通过流匹配学习无偏排列

Yimeng Min, Carla P. Gomes

机构 * Department of Computer Science(计算机科学系) Cornell University(康奈尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出PermFlow框架,通过在具有单位行和列和的矩阵仿射子空间上直接操作,学习多模态排列分布,避免了基于熵正则化Sinkhorn方法在模糊性下的崩溃问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18750 2026-05-19 cs.DC cs.LG 50%

A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability

一种面向运行时变异的流水线并行训练的准备驱动运行时

Ruitao Liu, Xinyang Tian, Shuo Chen, Tingrui Zhang, Guang Yang, Alan Zhao, Wei Xu

机构 * Tsinghua University(清华大学) Scitix AI

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种准备驱动的流水线运行时,以解决流水线并行训练中由于运行时变异导致的阶段对齐问题和空闲泡现象,通过非绑定提示顺序来优化当前就绪工作的排序,从而提高资源利用率。

Comments 29 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17152 2026-05-19 cs.DB 50%

LSM-VEC: A Large-Scale Disk-Based System for Dynamic Vector Search

LSM-VEC:一种大规模磁盘基系统用于动态向量搜索

Shurui Zhong, Dingheng Mo, Siqiang Luo

专题命中 跨模态检索 :multimodal(abstract)

AI总结 LSM-VEC结合分层图索引与LSM树存储,实现高效的动态向量搜索,支持出地更新,降低I/O开销,实验显示其在大规模数据集上优于现有磁盘基ANN系统。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 25 篇

2601.16527 2026-05-19 cs.LG cs.AI cs.CL cs.CV 82%

Beyond Superficial Unlearning: Sharpness-Aware Robust Erasure of Hallucinations in Multimodal LLMs

超越表面遗忘:多模态大语言模型中Hallucinations的锐度感知鲁棒擦除

Xianya Fang, Feiyang Ren, Xiang Chen, Yu Tian, Zhen Bi, Haiyang Yu, Sheng-Jun Huang

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Huzhou University(湖州大学) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合性国家科学中心数据空间研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出SARE方法,通过目标导向的min-max优化和Targeted-SAM机制,解决多模态大语言模型中 hallucinations 的鲁棒擦除问题,提升模型稳定性与擦除效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17907 2026-05-19 cs.CV cs.AI 81%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01593 2026-05-19 cs.CV cs.MM 81%

Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

超越补丁:面向多模态少样本字体生成的全局感知自回归模型

Haonan Cai, Yuxuan Luo, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学轩计算机技术研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GAR-Font,一种多模态少样本字体生成的自回归框架,通过全局感知分词器、多模态风格编码器和后处理流程,提升了字体生成的全局风格一致性和质量。

Comments 28 pages, Accepted as CVPR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏