arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 602 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 143 篇

2603.03915 2026-06-30 cs.CL cs.AI 73%

Rethinking Role-Playing Evaluation: Anonymous Benchmarking and a Systematic Study of Personality Effects

重新思考角色扮演评估:匿名基准测试与对性格效应的系统研究

Ji-Lun Peng, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出匿名基准测试方法,揭示角色扮演能力与角色识别的关联,通过性格增强方法提升匿名场景下的角色扮演性能。

Comments SIGdial 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09066 2026-06-30 cs.SD cs.AI cs.CL 73%

ORCA: Open-ended Response Correctness Assessment for Audio Question Answering

ORCA:面向音频问答的开放性回答正确性评估

Šimon Sedláček, Sara Barahona, Bolaji Yusuf, Laura Herrera-Alarcón, Santosh Kesiraju, Cecilia Bolaños, Alicia Lozano-Diez, Sathvik Udupa, Fernando López, Allison Ferner, Ramani Duraiswami, Jan Černocký

机构 * Brno University of Technology(布尔诺科技大学) Universidad Autónoma de Madrid(马德里自治大学) University of Buenos Aires(布宜诺斯艾利斯大学) Tufts University(塔夫茨大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ORCA模型,通过三阶段标注流程实现轻量级回答正确性与分歧建模,实验显示其在已见和未见基准上均优于基线模型,且能有效识别问题项。

Comments Accepted to TACL; pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15529 2026-06-30 cs.CL cs.AI 73%

XRAG: eXamining the Core -- Benchmarking Foundational Components in Advanced Retrieval-Augmented Generation

XRAG:深入核心——在高级检索增强生成中评估基础组件

Qili Zhang, Qianren Mao, Yangyifei Luo, Yashuo Luo, Hanwen Hao, Zhilong Cao, Weifeng Jiang, Zhijun Chen, Junnan Liu, Feng Yan, Xiaolong Wang, Jinlong Zhang, Zhenting Huang, Zhixing Tan, Jie Sun, Bo Li, Jianxin Li, Philip S. Yu

机构 * Zhongguancun Laboratory(中关村实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 XRAG通过系统分析RAG各核心阶段性能,提供全面基准,揭示系统潜在故障点并提出优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29232 2026-06-30 cs.CV 71%

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT

合成CT何时迁移?一种无标签的供体/宿主诊断方法用于真实肺CT上的医学视觉-语言模型路由

Fakrul Islam Tushar

专题命中 评测与基准 :language model(title)

AI总结 本文提出一种无标签方法,通过合成数字双胞胎区分供体驱动和宿主驱动的模型能力,预测合成CT到真实CT的迁移性,并在肺CT视觉-语言任务上验证。

Comments 10 pages, 7 figures, 1 table, 1 supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30312 2026-06-30 cs.CL 70%

DialogPII: A multilingual dataset of synthetic dialog transcripts to detect personal information

DialogPII:用于检测个人信息的多语言合成对话记录数据集

Roland Roller, Vera Czehmann, Derya Erman, Luke Flanagan, Ibrahim Baroud, Frédéric Blain, Viviana Cotik, Eletta Giusto, Akhil Juneja, Mariana Neves, Maria Słowińska, Christine Hovhannisyan, Aaron Louis Eidt, Lisa Raithel, Sebastian Möller, Maija Poikela

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Technical University Berlin(柏林技术大学) Berlin Institute of Health (BIH)(柏林健康研究所(BIH)) Tilburg University(蒂尔堡大学) Universidad de Buenos Aires(布宜诺斯艾利斯大学) Independent Researcher(独立研究者) Bundesinstitut für Risikobewertung (BfR)(风险评估联邦机构(BfR))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DialogPII多语言合成对话数据集,覆盖8种场景、19种实体类型和11种语言,通过半自动生成、语音合成与转录、人工校正构建,并发布基线模型和验证结果。

Comments currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30306 2026-06-30 cs.MA cs.AI 70%

Always-OnAgents:A Survey of Persistent Memory, State, and Governance in LLMAgents

Always-On Agents:关于LLM智能体中持久记忆、状态与治理的综述

Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang

专题命中 评测与基准 :LLM(title_cn);分类 cs.AI

AI总结 本文提出持久状态系统视角,通过六个诊断轴和生命周期分析435篇文献,发现现有研究重状态积累与检索而轻治理,并引入Always-On评估协议(AOEP-v0)以强化状态治理要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30259 2026-06-30 cs.CL 70%

Multi-Agentic System Leveraging Open-Source LLMs to Mitigate Disinformation Threats

利用开源大语言模型的多智能体系统缓解虚假信息威胁

Sebastian Kula, Martin Tamajka

机构 * Kempelen Institute of Intelligent Technologies(凯普伦智能技术研究所) West Pomeranian University of Technology in Szczecin(什切切尼西波美拉尼亚理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种模拟人类标注者决策过程的多智能体系统,结合共识机制、认知与知识多样性及层次结构,在虚假信息检测中优于GPT-4等个体模型,并利用开源模型提升透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30059 2026-06-30 cs.LG 70%

From Failure Taxonomy to Intervention: A Diagnostic Methodology for Industry-Scale AVLM in Video and Live-Streaming Platform Moderation

从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法

Shuchang Ye, Jinqiang Yu, Zhujun Xiao, Yajing Kong, Yist Y. Lin, Yang Ma, Jiaxi Liu, Xiaolei Xu, Zheng Yu

机构 * TikTok The University of Sydney(悉尼大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30026 2026-06-30 cs.CV cs.AI 70%

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

MuseBench: 多模态大语言模型中意图级视听艺术理解的基准测试

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

机构 * NTU Singapore(南洋理工大学) The University of Hong Kong(香港大学) Johns Hopkins University(约翰霍普金斯大学) AI2(人工智能研究所) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MuseBench基准,通过4016道涵盖电影、视觉艺术、舞台表演和游戏艺术的选择题,评估多模态大模型对艺术创作意图的理解,发现最佳模型准确率仅48.29%,远低于人类专家的87.18%。

Comments Project page: https://musebench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29808 2026-06-30 cs.HC cs.AI 70%

Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架

Yuchen He, Peizhi Ying, Liqi Cheng, Kuilin Peng, Yuan Tian, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Guangdong University of Technology(广东工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。

Comments Accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29571 2026-06-30 cs.CL 70%

Anisotropy Decides Cosine vs. Rank Metrics for Text Embeddings

各向异性决定文本嵌入的余弦度量与排序度量

V. S. Raghu Parupudi

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过19个编码器和7个数据集的实验,发现嵌入空间的各向异性决定余弦相似度与其他度量(如基于排序的度量)的相对性能,各向异性时排序度量平均提升约20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29556 2026-06-30 cs.LG cs.MA 70%

Persona-Trained Monte Carlo: Estimating Market-Outcome Distributions via Swarms of Persona-Conditioned Neural Policy Bots in a Limit Order Book

人格训练蒙特卡洛:通过限价订单簿中人格条件神经策略机器人群体估计市场结果分布

Salavat Ishbulatov

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出人格训练蒙特卡洛方法,通过模拟人格条件神经策略交易机器人群体在限价订单簿中的交互,估计市场结果统计量的分布,并给出形式化估计器、跨学科设计理由和验证路线图。

Comments 58 pages, 3 figures, 9 tables, 3 algorithms. Survey and proposed framework; no implementation or empirical results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29493 2026-06-30 cs.AI 70%

Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving

我们形式化基准测试中的缺陷:Lean定理证明中的数据集缺陷与评估失败

Pawan Sasanka Ammanamanchi, Siddharth Bhat, Stella Biderman

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过大规模静态检查器审计五个Lean定理证明基准,发现398个机械可验证问题(如反例、空洞定理),并提出缺陷分类、自动检查工具和评估标准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI 70%

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28960 2026-06-30 cs.AI q-bio.QM stat.AP 70%

Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries

临床AI工具在真实点-of-care临床查询上的专家评估

Jean Feng, Vishal Patel, Patrick Heagerty, Yifan Mai, Venkatesh Sivaraman, Patrick Vossler, Jialin Ouyang, Anupam B. Jena

机构 * Harvard Medical School(哈佛医学院) Brigham and Women’s Hospital(布莱尔妇女医院) Massachusetts General Hospital(麻省总医院) National Bureau of Economic Research(美国经济研究局)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过620个真实临床查询和149名医生评估,比较了专用临床AI工具与通用模型在准确性、实用性等五维度的表现,发现专用工具在所有维度上显著优于通用模型,并发布了公开基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28620 2026-06-30 cs.IR cs.CY cs.LG 70%

Reproducing FACTER: Fairness via Conformal Thresholding and Prompt Repair

复现FACTER:通过一致性阈值和提示修复实现公平性

Oscar Miró López-Feliu, Daimy van Loo, Xanthos Kekkos, Mikel Blom, Clara Rus

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究复现了FACTER框架,发现其在严格复现下推荐效用存在差异,并引入静态公平零样本基线,表明动态修复机制在约束重排序中收益有限。

Comments 29 pages. Accepted by Transactions on Machine Learning Research (TMLR), 2026. OpenReview: https://openreview.net/forum?id=4BPFVex4EM. Code: https://github.com/oscar-omlf/facter-repr

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28480 2026-06-30 cs.SE cs.AI 70%

TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents

TUA-Bench:通用终端使用代理的基准测试

Shoufa Chen, Luyuan Wang, Xuan Yang, Zhiheng Liu, Yuren Cong, Yuanfeng Ji, Feiyan Zhou, Xiaohui Zhang, Fanny Yang, Belinda Zeng

机构 * Meta AI Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TUA-Bench,包含120个跨五类任务的终端代理基准,涵盖日常数字活动与科学工程工作流,通过执行评分评估,发现最强模型Claude Opus 4.8仅达65.8%,揭示通用终端代理的显著差距。

Comments Website: https://www.tuabench.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28471 2026-06-30 cs.AI 70%

Data and Evaluation Closed-Loop for Model Capability Enhancement

数据与评估闭环用于模型能力增强

Zhixuan Li, Jiangan Yuan, Han Xu

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出“能力切片”单元,构建评估-数据闭环,将基准失败转化为可验证的数据干预,在两项案例中分别排除和确认数据问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28374 2026-06-30 cs.AI 70%

Recursive Self-Evolving Agents via Held-Out Selection

通过保留集选择的递归自演化智能体

Michael Nguyen, Quoc Nguyen, Paul Vuong

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RSEA递归自演化智能体,通过三层自然语言状态(策略、技能、规程)和严格保留集选择机制实现安全自演化,在四个基准上表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28326 2026-06-30 cs.IR cs.AI 70%

ADEPT: An Entropy-Driven Dual-Strategy Agent for Interactive Video Retrieval

ADEPT: 一种熵驱动的双策略交互式视频检索智能体

Ke Chen, Shengyuan Han, Yongfeng Huang, Yujin Zhu, Jingwei Xiong, Liang Xu, Jundong Liu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ADEPT框架,通过熵驱动的决策引擎动态选择ASK或REFINE策略,解决用户意图与查询之间的鸿沟,在交互式视频检索中显著超越现有基线。

Comments 5 pages, 3 figures. Published in IEEE ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 9442-9446, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17064 2026-06-30 cs.AI 70%

Towards Human-Level Book-Writing Capability

迈向人类水平的书籍写作能力

Jan Zierstek, Matteo Batelic, Maya Medjad, Tim Schönenberger

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种用于大规模创意写作的 dataset 构建和训练框架,通过将监督微调重新定义为提示到书籍生成任务,以人类创作的虚构作品为基础,旨在提升生成文本的文学性。

Comments 72 pages, 13 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16527 2026-06-30 cs.CV cs.LG 70%

Contrastive vision-language learning with paraphrasing and negation

基于改写与否定的对比视觉-语言学习

Kwun Ho Ngan, Saman Sadeghi Afgeh, Joe Townsend, Artur d'Avila Garcez

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SemCLIP模型,通过结合改写与否定的对比损失函数,提升视觉-语言模型在处理语义变化时的鲁棒性,实验证明其在零样本下游任务中表现稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05121 2026-06-30 cs.CL cs.SD eess.AS 70%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-06-30 cs.AI 70%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: https://weihaotan.github.io/StarDojo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07971 2026-06-30 cs.HC cs.AI 70%

SPHERE: An Evaluation Card for Human-AI Systems

SPHERE:人类-人工智能系统评估卡

Qianou Ma, Dora Zhao, Xinran Zhao, Chenglei Si, Chenyang Yang, Ryan Louie, Ehud Reiter, Diyi Yang, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SPHERE评估卡,从五个维度评估人类-人工智能系统,通过审查39个系统揭示当前评估实践及改进方向,并提出三项提升评估有效性和严谨性的建议。

Journal ref ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30580 2026-06-30 eess.AS cs.SD 67%

MeloDISinger: Melody-Aware & Duration-Preserving Singing Voice Editing with Audio Infilling

MeloDISinger: 旋律感知与时长保持的歌唱声音编辑与音频填充

Yoonjeong Park, Jaekwon Im, Juhan Nam

机构 * Graduate School of Artificial Intelligence, KAIST, South Korea(韩国釜山科学技术院人工智能研究生院) Graduate School of Culture Technology, KAIST, South Korea(韩国釜山科学技术院文化科技研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出基于流匹配的MeloDISinger模型,通过MeloDRP模块预测固定预算时长比率实现旋律感知的时长分配,结合流匹配梅尔解码器进行音频填充,在歌唱声音编辑任务上达到最优性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30546 2026-06-30 cs.MA 67%

MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems

MAS-Lab:面向可靠多智能体系统的规范驱动验证框架

Jordan Augé, Giovanna Carofiglio, Giulio Grassi, Jacques Samain

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MAS-Lab框架,通过声明式规范、状态化操作系统和实验覆盖层,将多智能体系统从脚本集合转变为可验证的工程化分布式系统。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29953 2026-06-30 cs.NE 67%

Semantics-Aware Bilevel Co-Evolution: Towards Automated Multicomponent Algorithm Design

语义感知双层协同进化:迈向自动化多组件算法设计

Zhiyao Zhang, Shenghao Wu, Xingyu Wu, Kay Chen Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出STABLE方法,通过结构化算法表述和语义驱动进化,实现多组件算法的自动化设计,在搜索效率和性能上优于人工设计和现有LES方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28742 2026-06-30 cs.ET 67%

MetaMorphQ: Physics-Based Metamorphic Testing of Variational Quantum Circuits

MetaMorphQ: 基于物理的变分量子电路蜕变测试

Ngoc Nhi Nguyen, John Le, Thai T. Vu, Thi Thuy Nga Nguyen, Jun Shen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对变分量子本征求解器(VQE)因基态能量未知导致的测试预言困境,提出MetaMorphQ框架,利用量子力学性质定义五个物理不变量,无需真实输出即可验证电路正确性,在2469个变异体上实现零误报,诊断效果显著优于收敛测试。

Comments 10 pages, 3 figures, IEEE QSW 2026 (IEEE International Conference on Quantum Software)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02482 2026-06-30 cs.CV 67%

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

X-Stream: 探索多模态大语言模型作为多流理解的多路复用器

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Fang Liu, Rui Liu, Xiangyu Yue

机构 * MMLab, Chinese University of Hong Kong(中大香港人工智能实验室) Huawei Inc.(华为公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为解决多流视频理解评估缺失的问题,提出首个基准X-Stream,包含4220个QA对和932个视频,覆盖多窗口、多视角和多设备场景,并基于信号多路复用理论评估MLLM作为多路复用器的性能,发现现有模型在并发流上仅达约50%分数。

Comments Project Page: https://peiwensun2000.github.io/xstream/

详情

展开后加载摘要…

URL PDF HTML 收藏