arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5048 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5048 篇

2603.00983 2026-03-03 cs.CV 70%

Event-Anchored Frame Selection for Effective Long-Video Understanding

基于事件的帧选择用于有效长视频理解

Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG 70%

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04932 2026-03-03 cs.CV 70%

UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features

UniView: 通过统一参考特征从单张图像增强新颖视角合成

Haowang Cui, Rui Chen, Jiaze Wang, Tao Guo, Zheng Qin

机构 * Tianjin University(天津大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22283 2026-03-03 cs.CV 70%

Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment

重新审视在跨模态不匹配下的LVLMs视觉标记减少

Rui Xu, Yunke Wang, Yong Luo, Bo Du

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出VisionDrop方法,通过视觉-only修剪框架减少LVLMs中的视觉标记,无需额外训练,提升推理效率并保持性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23746 2026-03-02 cs.HC cs.CV 70%

Shape vs. Context: Examining Human--AI Gaps in Ambiguous Japanese Character Recognition

形状与上下文:考察人类与AI之间的模糊日文字符识别差距

Daichi Haraguchi

机构 * CyberAgent

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究通过比较人类与VLMs在模糊日文字符识别中的决策模式,揭示了形状上下文对人类与AI对齐的影响。

Comments Accepted to CHI 2026 Poster track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23699 2026-03-02 cs.CV cs.CL 70%

HiDrop: Hierarchical Vision Token Reduction in MLLMs via Late Injection, Concave Pyramid Pruning, and Early Exit

HiDrop:通过晚期注入、凹形金字塔剪枝和早期退出实现MLLM中的层次视觉令牌减少

Hao Wu, Yingqi Fan, Jinyang Dai, Junlong Tong, Yunpu Ma, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究所,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习中心,慕尼黑大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 HiDrop通过晚期注入、凹形金字塔剪枝和早期退出机制,实现多模态大语言模型中视觉令牌的高效减少,提升训练效率并保持性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23061 2026-03-02 cs.CV 70%

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

赋能小型视觉语言模型进行动态记忆与探索

Jiazhen Liu, Yuchuan Deng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23363 2026-02-27 cs.CV 70%

MediX-R1: Open Ended Medical Reinforcement Learning

MediX-R1:开放端医疗强化学习

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学) Jubilee Mission Medical College(jubilee mission 医学院) Research Institute(研究院) JJM Medical College(JJM 医学院)

专题命中 VLM训练与架构 :VLM(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MediX-R1通过综合奖励信号和LLM评估,实现医疗多模态模型的开放端强化学习,提升临床推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23229 2026-02-27 cs.CV 70%

Large Multimodal Models as General In-Context Classifiers

大多模态模型作为通用上下文分类器

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出CIRCLE方法,通过伪标签迭代优化,使LMM在开放世界分类中超越VLM,展示LMM作为统一分类器的潜力。

Comments CVPR Findings 2026. Project website at https://circle-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22689 2026-02-27 cs.CV cs.CR 70%

No Caption, No Problem: Caption-Free Membership Inference via Model-Fitted Embeddings

无标题,无问题:通过模型拟合嵌入进行无标题成员推断

Joonsung Jeon, Woo Jae Kim, Suhyeon Ha, Sooel Son, Sung-Eui Yoon

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出MoFit框架,通过模型拟合嵌入实现无标题成员推断,克服了传统方法对真实标题的依赖,提升了在无标注场景下的成员推断性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22098 2026-02-26 cs.CV 70%

Brain3D: Brain Report Automation via Inflated Vision Transformers in 3D

Brain3D: 通过膨胀视觉变换器实现脑部报告自动化

Mariano Barone, Francesco Di Serio, Giuseppe Riccio, Antonio Romano, Marco Postiglione, Antonino Ferraro, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering and Information Technology(那不勒斯费德里科二世大学电子工程与信息技术系) Northwestern University, Dept. of Computer Science, McCormick School of Engineering and Applied Science(西北大学计算机科学系,工程与应用科学学院) Pegaso University, Department of Information Science and Technology(佩加索大学信息科学与技术系)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Brain3D通过膨胀视觉变换器实现3D脑肿瘤MRI的自动化报告生成,通过分阶段对齐提升神经放射学解读的准确性和结构化输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20500 2026-02-25 cs.RO cs.CV 70%

Strategy-Supervised Autonomous Laparoscopic Camera Control via Event-Driven Graph Mining

基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制

Keyu Zhou, Peisen Xu, Yahao Wu, Jiming Chen, Gaofeng Li, Shunlei Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出基于事件驱动图挖掘的策略监督自主腹腔镜摄像机控制方法,通过结合视觉-语言推理与闭环控制,提升手术视野稳定性与可解释性,实验表明其在减少视野偏移和图像抖动方面表现优异。

Comments Submitted to IEEE Transactions on Robotics (T-RO). 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19870 2026-02-24 cs.CV 70%

ApET: Approximation-Error Guided Token Compression for Efficient VLMs

ApET:基于近似误差的令牌压缩用于高效的视觉语言模型

Qiankun Ma, Ziyao Zhang, Haofei Wang, Jie Chen, Zhen Song, Hairong Zheng

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Peng Cheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ApET通过近似误差指导的令牌压缩,在不使用注意力机制的情况下高效压缩视觉语言模型的令牌预算,提升推理效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18612 2026-02-23 cs.CV 70%

Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter

Mod-Adapter:通过调制适配器实现无需微调的多概念个性化

Weizhi Zhong, Huan Yang, Zheng Liu, Huiguo He, Zijian He, Xuesong Niu, Di Zhang, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队) Shenzhen Loop Area Institute, Shenzhen, China(深圳循环区研究所) Guangdong Key Laboratory of Big Data Analysis and Processing, Guangzhou, China(广东大数据分析与处理重点实验室) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出Mod-Adapter方法,通过调制适配器实现无需微调的多概念个性化,有效定制物体和抽象概念,提升生成质量。

Comments Accepted by ICLR 2026, project page: https://weizhi-zhong.github.io/Mod-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17625 2026-02-20 cs.LG cs.DC 70%

Catastrophic Forgetting Resilient One-Shot Incremental Federated Learning

抗灾难性遗忘的一次式联邦学习

Obaidullah Zaland, Zulfiqar Ahmad Khan, Monowar Bhuyan

机构 * Linköping University(利厄普大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 OSI-FL通过一次通信轮次生成类别特定嵌入并结合选择性样本保留技术,有效解决增量联邦学习中的通信开销和灾难性遗忘问题。

Comments Accepted for publication in the IEEE International Conference on Big Data (IEEE BigData) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21370 2026-02-16 cs.RO cs.CV 70%

Language-in-the-Loop Culvert Inspection on the Erie Canal

Erie运河的循环检测

Yash Turkar, Yashom Dighe, Karthik Dantu

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VISION通过结合视觉-语言模型和受限视角规划,实现Erie运河涵洞的自主检测,生成高分辨率图像并提升专家评估一致性。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11957 2026-02-13 cs.LG 70%

Are Two LLMs Better Than One? A Student-Teacher Dual-Head LLMs Architecture for Pharmaceutical Content Optimization

两个大语言模型是否比一个更好?一种学生-教师双头大语言模型架构用于药学内容优化

Suyash Mishra, Qiang Li, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.LG

AI总结 本研究提出一种学生-教师双头大语言模型架构,用于提升药学内容的合规性与准确性,通过模块化设计和规则过滤实现高效质量控制。

Comments Submitted to the Demo Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 70%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05809 2026-02-10 cs.CV 70%

Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning

聚焦-扫描-精炼:从人类视觉感知到高效的视觉令牌修剪

Enwei Tong, Yuanchao Bai, Yao Zhu, Junjun Jiang, Xianming Liu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FSR是一种受人类视觉感知启发的高效视觉令牌修剪框架,通过聚焦关键证据、全局扫描和上下文精炼,提升视觉-语言模型的准确率与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04739 2026-02-05 cs.CL cs.AI cs.HC 70%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09554 2026-02-05 cs.CV 70%

RF-DETR: Neural Architecture Search for Real-Time Detection Transformers

RF-DETR:实时检测Transformer的神经架构搜索

Isaac Robinson, Peter Robicheaux, Matvei Popov, Deva Ramanan, Neehar Peri

机构 * Roboflow Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RF-DETR通过轻量级检测Transformer和神经架构搜索,在实时检测中实现更高的精度和速度,超越现有方法。

Comments This work has been accepted to the International Conference on Learning Representations (ICLR) 2026. Project Page: https://rfdetr.roboflow.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03230 2026-02-04 cs.CV 70%

EventFlash: Towards Efficient MLLMs for Event-Based Vision

EventFlash: 向基于事件的视觉高效MLLMs迈进

Shaoyu Liu, Jianing Li, Guanghui Zhao, Yunjian Zhang, Wen Jiang, Ming Li, Xiangyang Ji

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 EventFlash通过时空令牌稀疏化技术,实现高效事件视觉处理,提升吞吐量并支持更长的事件流处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 70%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01817 2026-02-03 cs.CV 70%

SciTextures: Collecting and Connecting Visual Patterns, Models, and Code Across Science and Art

SciTextures: 收集和连接科学与艺术中的视觉模式、模型和代码

Sagi Eppel, Alona Strugatski

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 SciTextures通过连接视觉模式与生成机制,提供大规模数据集评估VLMs对物理系统多层抽象的理解与模拟能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22796 2026-02-02 cs.GR cs.CV 70%

HeatMat: Simulation of City Material Impact on Urban Heat Island Effect

HeatMat:城市材料对城市热岛效应的模拟

Marie Reinbigler, Romain Rouffet, Peter Naylor, Mikolaj Czerkawski, Nikolaos Dionelis, Elisabeth Brunet, Catalin Fetita, Rosalie Martin

机构 * SAMOVAR, Inria Saclay, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR、Inria Saclay、 Télécom SudParis、 Institut Polytechnique de Paris) Adobe Research Asterisk Labs SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR、 Télécom SudParis、 Institut Polytechnique de Paris)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 HeatMat通过街景图像和预训练视觉-语言模型,高分辨率模拟城市材料对热岛效应的影响,利用2.5D模拟器提升热传递建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 70%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20075 2026-01-29 cs.CV 70%

Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning

稀疏CLIP:在对比学习中协同优化可解释性与性能

Chuan Qin, Constantin Venhoff, Sonia Joseph, Fanyi Xiao, Stefan Scherer

专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 稀疏CLIP通过在对比学习中直接整合稀疏性,实现了可解释性与性能的协同优化,保留了多模态能力并提升了下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18493 2026-01-27 cs.CV 70%

DisasterInsight: A Multimodal Benchmark for Function-Aware and Grounded Disaster Assessment

DisasterInsight: 一种多模态基准,用于功能感知和基于事实的灾害评估

Sara Tehrani, Yonghao Xu, Leif Haglund, Amanda Berg, Michael Felsberg

机构 * Computer Vision Laboratory, Linköping University, Sweden(林奈大学计算机视觉实验室) Vantor, Linköping, Sweden(林奈瑞典)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DisasterInsight提出一种多模态基准,用于评估视觉-语言模型在灾害分析任务中的性能,通过DI-Chat模型在损害识别和报告生成方面取得显著提升。

Comments Under review at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17814 2026-01-27 cs.AI 70%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17152 2026-01-27 cs.CL cs.AI 70%

Dynamic Role Assignment for Multi-Agent Debate

多智能体辩论中的动态角色分配

Miao Zhang, Junsik Kim, Siyuan Xiang, Jian Gao, Cheng Cao

机构 * New York University(纽约大学) Amazon AGI(亚马逊人工智慧)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出动态角色分配框架,通过元辩论选择适合的智能体,提升多代理辩论系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏