arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 315 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 315 篇

2608.10983 2026-08-12 cs.IR cs.AI 新提交 79%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08469 2026-08-11 cs.AI 新提交 79%

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

Aero Realtime:用于低延迟流式多模态生成的完全对齐输入输出流

Kaichen Zhang, Wei Huang, Keming Wu, Bo Li, Xiaojuan Qi

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出4B参数流式多模态模型Aero Realtime,采用双工架构实现输入输出流完全对齐,通过时隙对齐等技术降低延迟,在4块NVIDIA A6000 GPU上验证了其低延迟多模态交互的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05648 2026-08-07 cs.CV 新提交 79%

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IR:长视频统一多模态身份替换生成模型

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。

Comments Project page: https://vorch-project.github.io/Vorch-IR-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 79%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 79%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 79%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 79%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26411 2026-07-30 cs.CV 新提交 79%

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

统一多模态模型是否在同一空间中思考?通过跨分支引导的视角

Yu Wang, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交 79%

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23673 2026-07-28 cs.CV 新提交 79%

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

用于多模态遥感图像生成的对比参数解缠

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) Unit 92728 of PLA(中国人民解放军92728部队)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 79%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18917 2026-07-22 cs.CV 新提交 79%

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

TAP-RAG:用于长文档多模态问答的任务感知策略控制

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) The International Joint Institute of Tianjin University(天津大学国际联合学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。

Comments 18 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15686 2026-07-20 cs.AI 新提交 79%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14005 2026-07-16 cs.CV cs.RO 新提交 79%

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13936 2026-07-16 cs.CV cs.LG physics.med-ph 新提交 79%

A novel unsupervised machine learning strategy to handle multimodal cardiac PET/MRI data

一种处理多模态心脏PET/MRI数据的新型无监督机器学习策略

Brunnhilde Ponsi, Thomas Carlier, Lara Marteau, Aurélien Monnet, Thomas Eugène, Jean-Michel Serfaty, Nicolas Piriou, Hatem Necib

机构 * Nantes Université, CHU Nantes(南特大学,南特大学医院中心) Siemens Healthineers France(西门子医疗法国公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对致心律失常性左心室心肌病诊断难题,利用PET/MRI数据,采用两步聚类等方法,对患者图像进行处理分析,生成健康报告,经交叉验证和在更大队列上验证,能准确识别异常,有助于表征心肌异质性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09892 2026-07-14 eess.IV cs.AI 新提交 79%

Next-Dense-Stride Prediction for Multimodal Autoregressive Visual Modeling

用于多模态自回归视觉建模的下密集步长预测

Chicago Y. Park, Jialin Mao, Xiaojian Xu, Taha Kass-Hout, Ulugbek S. Kamilov, Cao Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) GE HealthCare(通用电气医疗)

专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 研究提出DenseAR范式,将自回归图像生成重构成下密集步长预测,解决现有模型局限。基于此扩展为统一模型处理多模态和成像任务,在医学和自然图像验证,在多对比脑MRI及ImageNet上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10287 2026-07-14 cs.CV 新提交 79%

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

InterPet4D:用于宠物运动生成的多模态4D人宠交互数据集

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

机构 * Institute of Science Tokyo(东京科学研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 因缺乏高质量数据集,人宠交互研究不足。本文提出InterPet4D多模态数据集及InterPetMoGen框架,通过同步多视图系统记录交互并标注,含多类型数据,所提模型FID得分11.21,优于基线,有效模拟人宠交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交 79%

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08434 2026-07-10 cs.CV 新提交 79%

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi Inc.(小米公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08227 2026-07-10 cs.CV 新提交 79%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 79%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16673 2026-07-09 cs.CV 新提交 79%

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

MMDiff: 扩展扩散变换器用于多模态生成

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 79%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04636 2026-07-07 cs.CV 新提交 79%

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

通过场景感知文档合成增强关键信息提取中的大型多模态模型

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03349 2026-07-07 cs.LG cs.AI 新提交 79%

PedestrianDiffusion: Multimodal Generative Denoising and Dense State Estimation for Inertial Navigation

行人扩散:用于惯性导航的多模态生成去噪和密集状态估计

I-Hao Lu, Dongsoo Han

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交 79%

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31959 2026-07-01 cs.CV 新提交 79%

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer

AnyBokeh: 物理引导的任意到任意散景编辑与光学指纹迁移

Xinyu Hou, Xiaoming Li, Zongsheng Yue, Chen Change Loy

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV

AI总结 提出AnyBokeh框架,通过估计源模糊状态的光学指纹并迁移到目标焦点和光圈设置,实现任意到任意散景编辑,避免全聚焦重建和测试时校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31451 2026-07-01 cs.RO cs.AI 新提交 79%

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Oxford(牛津大学) MIT(麻省理工学院) Shanghai Jiaotong University(上海交通大学) UNIX AI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 79%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏