arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-06 至 2026-03-06 共收录 72 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2510.18876 2026-03-06 cs.CV cs.AI cs.CL 82%

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04957 2026-03-06 cs.CV cs.CL 81%

VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters

VisionPangu:一个紧凑且细粒度的多模态助手,参数为17亿

Jiaxin Fan, Wenpo Song

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 VisionPangu通过高效多模态对齐和高质量监督,实现17亿参数紧凑多模态模型,在无需激进扩展的情况下提升图像描述的结构和细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04894 2026-03-06 cs.AI 79%

Differentially Private Multimodal In-Context Learning

差分隐私多模态上下文学习

Ivoline C. Ngong, Zarreen Reza, Joseph P. Near

机构 * University of Vermont, Burlington, VT, USA(佛罗里达大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DP-MTV是首个实现多样本多模态上下文学习的差分隐私框架,通过激活空间中的任务向量聚合,在保持隐私的前提下提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04878 2026-03-06 cs.CV 79%

Structure Observation Driven Image-Text Contrastive Learning for Computed Tomography Report Generation

基于结构观测的图像-文本对比学习用于CT报告生成

Hong Liu, Dong Wei, Qiong Peng, Yawen Huang, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康医学数据科学研究院) Jarvis Research Center, Tencent YouTu Lab, Shenzhen, China(腾讯YouTu实验室 Jarvis研究部) Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou, China(西湖大学医学人工智能实验室)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 本文提出基于结构观测的图像-文本对比学习框架,用于提升CT报告生成的临床效率和准确性。

Comments Accept to IPMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2603.05275 2026-03-06 cs.MM cs.CL cs.SD 84%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 83%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05270 2026-03-06 eess.AS cs.AI 62%

Visual-Informed Speech Enhancement Using Attention-Based Beamforming

基于视觉信息的语音增强使用注意力束形成

Chihyun Liu, Jiaxuan Fan, Mingtung Sun, Michael Anthony, Mingsian R. Bai, Yu Tsao

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种结合视觉信息和注意力机制的神经束形成网络,用于提升语音增强在低信噪比和复杂环境下的性能。

Comments 15 pages, 14 figures

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, Volume: 33, pp. 4941-4955, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09984 2026-03-06 cs.CV cs.AI cs.SD 62%

InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions

InterActHuman: 多概念人类动画与布局对齐的音频条件

Zhenzhi Wang, Jiaqi Yang, Jianwen Jiang, Chao Liang, Gaojie Lin, Zerong Zheng, Ceyuan Yang, Yuan Zhang, Mingyuan Gao, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 InterActHuman通过引入布局对齐的音频条件,实现多概念人类动画,支持多身份的精确控制与高质量视频生成。

Comments ICLR 2026 Camera Ready Version. TL;DR: The first multi-person dialogue video generation method from pairs of reference image and audio via explicit layout-aligned condition injection. Project page https://zhenzhiwang.github.io/interacthuman/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2603.04509 2026-03-06 cs.CV 79%

Recognition of Daily Activities through Multi-Modal Deep Learning: A Video, Pose, and Object-Aware Approach for Ambient Assisted Living

通过多模态深度学习识别日常活动:一种面向环境辅助养老的视频、姿态和物体感知方法

Kooshan Hashemifard, Pau Climent-Pérez, Francisco Florez-Revuelta

机构 * Alicante Institute for Health and Biomedical Research (ISABIAL)(阿利坎特健康与生物医学研究所(ISABIAL)) ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦尔格AI——瓦伦西亚人工智能研究生院与研究网络)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习方法,结合视频、姿态和物体信息,用于老年人日常活动识别,提升环境辅助养老系统的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00141 2026-03-06 cs.CV cs.AI 62%

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

FLoC:基于设施定位的高效视觉令牌压缩用于长视频理解

Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FLoC提出了一种基于设施定位函数的高效视觉令牌压缩方法,通过懒惰贪心算法实现紧凑且多样化的令牌选择,有效提升长视频理解的处理效率和性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG 57%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21039 2026-03-06 cs.IR cs.LG 50%

Agentic Multi-Persona Framework for Evidence-Aware Fake News Detection

代理多角色框架用于证据感知的虚假新闻检测

Roopa Bukke, Soumya Pandey, Suraj Kumar, Soumi Chattopadhyay, Chandranath Adak

机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。

Comments 10 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2602.13704 2026-03-06 cs.IR cs.AI cs.CV 84%

Pailitao-VL: Unified Embedding and Reranker for Real-Time Multi-Modal Industrial Search

Pailitao-VL:统一的嵌入与重排序用于实时多模态工业搜索

Lei Chen, Chen Ju, Xu Chen, Zhicheng Wang, Yuheng Jiao, Hongfeng Zhan, Zhaoyang Li, Shihao Xu, Zhixiang Zhao, Tong Jia, Lin Li, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Pailitao-VL通过统一嵌入与重排序方法,解决多模态工业搜索中的高精度、实时性和抗噪声问题,实现先进检索架构的高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 81%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05446 2026-03-06 cs.CV 79%

NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries

NaiLIA:基于密集意图描述和调色板查询的多模态美甲设计检索

Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 NaiLIA通过密集意图描述和调色板查询实现美甲设计图像的多模态检索,提升检索精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04614 2026-03-06 cs.CV 70%

SGR3 Model: Scene Graph Retrieval-Reasoning Model in 3D

SGR3模型:三维场景图检索-推理模型

Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan, Kunyu Peng, Di Wen, Jiale Wei, Jiaming Zhang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Shenzhen University(深圳大学) Hunan University(湖南大学)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SGR3模型通过多模态大语言模型与检索增强生成技术,实现无需训练的三维场景图生成,提升场景关系推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04598 2026-03-06 cs.CV 57%

PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing

PinPoint:评估组合图像检索的综合基准,包含显式负样本、多图像查询和同义词测试

Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV

AI总结 PinPoint提出一个综合基准测试,通过多正确答案、显式负样本和同义词测试评估组合图像检索的鲁棒性和公平性。

Comments Accepted for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04516 2026-03-06 cs.LG astro-ph.IM cs.AI 57%

Augmenting representations with scientific papers

用科学论文增强表示

Nicolò Oreste Pinciroli Vago, Rocco Di Tella, Carolina Cuesta-Lázaro, Michael J. Smith, Cecilia Garraffo, Rafael Martínez-Galarza

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。

Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03201 2026-03-06 cs.NE cond-mat.dis-nn math.DS q-bio.NC 50%

A Dynamical Theory of Sequential Retrieval in Input-Driven Hopfield Networks

输入驱动型Hopfield网络中序列检索的动力学理论

Simone Betteti, Giacomo Baggio, Sandro Zampieri

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文提出输入驱动型Hopfield网络中序列检索的动力学理论,通过双时间尺度架构分析记忆转换条件,揭示联想记忆模型的序列性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 12 篇

2510.00507 2026-03-06 cs.CL cs.AI 81%

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11190 2026-03-06 cs.AI cs.CL 81%

Enhancing multimodal analogical reasoning with Logic Augmented Generation

通过逻辑增强生成增强多模态类比推理

Anna Sofia Lippolis, Andrea Giovanni Nuzzolese, Aldo Gangemi

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究 council 信息与系统技术研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出逻辑增强生成框架,通过结合语义知识图谱和提示启发法,提升多模态类比推理能力,在隐喻检测和理解任务中优于基线和人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04868 2026-03-06 cs.AI 79%

K-Gen: A Multimodal Language-Conditioned Approach for Interpretable Keypoint-Guided Trajectory Generation

K-Gen:一种多模态语言条件方法用于可解释的关键点引导轨迹生成

Mingxuan Mu, Guo Yang, Lei Chen, Ping Wu, Jianxun Cui

机构 * Harbin Institute of Technology Chongqing Research Inst. of HIT(哈尔滨工业大学重庆研究院) Changan Automobile Co., Ltd Chongqing, China(长安汽车有限公司重庆)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 K-Gen通过多模态语言模型结合关键点引导方法,提升自动驾驶轨迹生成的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04466 2026-03-06 cs.RO cs.LG 78%

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

动作-观察-重写:多模态编码代理作为机器人操作的上下文政策学习者

Vaishak Kumar

机构 * General Bionix, Inc.(通用生物交叉公司)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 AOR框架通过生成可执行代码使机器人操作策略学习无需演示或奖励工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 70%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04790 2026-03-06 cs.LG cs.RO 67%

Diffusion Policy through Conditional Proximal Policy Optimization

通过条件近端策略优化实现扩散策略

Ben Liu, Shunpeng Yang, Hua Chen

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01776 2026-03-06 cs.CL cs.AI cs.CV 67%

FreeAct: Freeing Activations for LLM Quantization

FreeAct: 为LLM量化释放激活

Xiaohao Liu, Xiaobo Xia, Manyi Zhang, Ji-Fu Li, Xianzhi Yu, Fei Shen, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Huawei Technology(华为技术有限公司) Central South University(中央南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。

Comments 26 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 67%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23589 2026-03-06 cs.AI cs.CV cs.LG 62%

BridgeDrive: Diffusion Bridge Policy for Closed-Loop Trajectory Planning in Autonomous Driving

BridgeDrive: 基于扩散桥的闭环轨迹规划扩散策略

Shu Liu, Wenlin Chen, Weihao Li, Zheng Wang, Lijin Yang, Jianing Huang, Yipin Zhang, Zhongzhan Huang, Ze Cheng, Hao Yang

机构 * Bosch (China) Investment Ltd(博世(中国)投资有限公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 BridgeDrive提出一种基于锚点的扩散桥策略,通过实时闭环轨迹规划提升自动驾驶的安全性和效率。

Comments Accepted for publication at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04980 2026-03-06 cs.CV 57%

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

一种通过 vanilla next-token 预测统一理解、生成和编辑的简单基线

Jie Zhu, Hanghang Ma, Jia Wang, Yayong Guan, Yanbing Zeng, Lishuai Gao, Junqiang Wu, Jie Hu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学),教育部,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出 Wallaroo,一种通过 vanilla next-token 预测统一多模态理解、生成和编辑的简单基线模型,展示了其在多任务中的竞争力。

Comments Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 57%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏