arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-05-12 至 2026-05-12 共收录 43
2605.10833 2026-05-12 cs.CV cs.AI

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10663 2026-05-12 cs.AI

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

Evolving-RL: 端到端优化经验驱动的自我进化能力

Zhiyuan Fan, Wenwei Jin, Feng Zhang, Bin Li, Yihong Dong, Yao Hu, Jiawei Li

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10470 2026-05-12 cs.CV

Adaptive Context Matters: Towards Provable Multi-Modality Guidance for Super-Resolution

适应性上下文至关重要:迈向可证明的多模态引导超分辨率

Jinyi Luo, Minghao Liu, Yifan Li, Zejia Fan, Jiaying Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究院)

AI总结 本文提出M$^3$ESR框架,通过动态模态融合提升超分辨率的泛化和语义一致性,理论分析揭示了多模态SR的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10445 2026-05-12 cs.CV

Uni-Synergy: Bridging Understanding and Generation for Personalized Reasoning via Co-operative Reinforcement Learning

Uni-Synergy:通过协作强化学习实现个性化推理的理解与生成弥合

Zijun Shen, Sihan Yang, Ruichuan An, Ziyu Guo, Hao Liang, Ming Lu, Renrui Zhang, Wentao Zhang

机构 * Peking University(北京大学) Nanjing University(南京大学) CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出Sync-R1框架,通过协作强化学习统一优化个性化理解和生成,结合Sync-GRPO和DGS方法提升双任务协同效率,实验证明其在跨任务推理和鲁棒个性化方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10335 2026-05-12 cs.LG cs.AI cs.CL cs.NA math.NA math.OC

PowerStep: Memory-Efficient Adaptive Optimization via $\ell_p$-Norm Steepest Descent

PowerStep: 通过ℓp-范数最速下降实现内存高效的自适应优化

Yao Lu, Dengdong Fan, Shixun Zhang, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 PowerStep是一种内存高效的自适应优化器,通过非线性变换直接作用于动量缓冲区实现坐标自适应,无需存储二阶统计量,具有最优收敛速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10275 2026-05-12 cs.CV

PolarVSR: A Unified Framework and Benchmark for Continuous Space-Time Polarization Video Reconstruction

PolarVSR:连续时空极化视频重建的统一框架和基准

Chenggong Li, Yidong Luo, Junchao Zhang, Boxin Shi, Degui Yang

机构 * School of Automation, Central South University(中南大学自动化学院) Hunan Provincial Key Laboratory of Optic-Electronic Intelligent Measurement and Control(湖南省光学电子智能测量控制重点实验室) Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工程学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,北京大学计算机学院)

AI总结 本文提出首个时空极化视频重建框架,通过极化感知隐式神经表示实现高保真重建,并建立首个大规模彩色DoFP极化视频基准,验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10268 2026-05-12 cs.CL cs.AI

MemReread: Enhancing Agentic Long-Context Reasoning via Memory-Guided Rereading

MemReread: 通过记忆引导重读增强代理长上下文推理

Baibei Ji, Xiaoyang Weng, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

AI总结 MemReread通过记忆引导重读机制,在线性处理文档片段时避免二次检索,实现非线性推理并保持文档理解的逻辑流,通过强化学习框架提升长上下文推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10230 2026-05-12 cs.LG

FORGE: Fragment-Oriented Ranking and Generation for Context-Aware Molecular Optimization

FORGE:面向上下文的分子优化片段排序与生成

Qingchuan Zhang, He Cao, Hao Li, Yanjun Shao, Zhiyuan Liu, Shihang Wang, Shufang Xie, Shenghua Gao, Xinwu Ye

机构 * University of Science and Technology of China(中国科学技术大学) International Digital Economy Academy(国际数字经济学院) Peking University(北京大学) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Macao Polytechnic University(澳门理工学院) Zhongguancun Academy(中关村学院) University of Hong Kong(香港大学)

AI总结 FORGE通过上下文感知的局部编辑方法改进分子结构,在保持起始化合物相似性的同时,利用自动挖掘的低到高编辑对进行片段排序与生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00370 2026-05-12 cs.LG cs.CY cs.MM

Group Cognition Learning: Making Everything Better Through Governed Two-Stage Agents Collaboration

群体认知学习:通过受控的双阶段智能体协作使一切变得更好

Chunlei Meng, Pengbin Feng, Rong Fu, Hoi Leong Lee, Xiaojing Du, Zhaolu Kang, Zeyu Zhang, Weilin Zhou, Chun Ouyang, Zhongxue Gan

机构 * University of Macau(澳门大学) Universiti Malaysia Perlis(马来西亚霹雳大学) Peking University(北京大学) Xinjiang University(新疆大学)

AI总结 本文提出群体认知学习框架,通过双阶段智能体协作解决多模态学习中的模态主导和虚假耦合问题,实验表明其在回归和分类任务中达到最优性能。

Comments This study has been Accepted by ICML 2026. The current version is a manuscript, please refer to the official version released at ICML 2026 for the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11566 2026-05-12 cs.CV

R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection

R4Det:用于高性能3D目标检测的4D雷达-摄像头融合

Zhongyu Xia, Yousen Tang, Yongtao Wang, Zhifeng Wang, Weijun Qin

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) EBTech Co. Ltd(EBTech公司)

AI总结 R4Det通过全景深度融合模块提升深度估计,设计变形门控时间融合模块以不依赖车辆姿态,结合实例引导动态细化模块,实现更准确的3D目标检测。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06527 2026-05-12 cs.AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

HyPER:通过假设路径扩展与缩减实现可扩展的大语言模型推理中的探索与利用平衡

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(北京大学人工智能研究院) Huawei(华为) School of Integrated Circuits, Peking University, Beijing(北京大学集成电路学院)

AI总结 HyPER通过动态扩展-缩减控制问题优化多路径解码,提升推理准确性与计算效率,实验显示在不同基准上准确率提升8-10%,token使用减少25-40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11233 2026-05-12 cs.CL

CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis

CNSocialDepress:一种用于抑郁症风险检测和结构化分析的中文社交媒体数据集

Jinyuan Xu, Tian Lan, Xintao Yu, Xue He, Hezhi Zhang, Ying Wang, Pierre Magistry, Mathieu Valette, Lei Li

机构 * Ertim Inalco Milkuya Studio Sorbonne Université(索邦大学) IRD Lab(IRD实验室) Faculty of Psychology, Peking University(北京大学心理学系) Faculty of Psychology and Cognitive Science, Beijing Normal University(北京师范大学心理学与认知科学系) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出CNSocialDepress数据集,用于中文社交媒体中抑郁症风险检测与结构化分析,包含44178条帖子及10306个抑郁症相关片段,支持多维度心理属性分析及NLP任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10027 2026-05-12 cs.CL cs.AI

Speech-based Psychological Crisis Assessment using LLMs

基于语音的心理危机评估使用大语言模型

Terumi Chiba, Yang Luo, Ziyun Cui, Yongsheng Tong, Chao Zhang

机构 * Tsinghua University(清华大学) Peking University Huilongguan Clinical Medical School(北京大学回龙guan临床医学院) WHO Collaborating Centre for Research and Training in Suicide Prevention(世界卫生组织自杀预防研究与培训协作中心)

AI总结 本文提出利用大语言模型自动分类危机等级,通过引入语音学注入方法和增强推理训练策略,提升热线服务质量。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09972 2026-05-12 cs.RO cs.CV

HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving

HiDrive:面向高级自动驾驶的闭环基准测试

Zhongyu Xia, Guanyu Zhu, Guo Tang, Wenhao Chen, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(王炫计算机技术研究所,北京大学)

AI总结 HiDrive提出一个强调长尾场景的闭环基准测试,评估驾驶能力的更全面系统,包含碰撞避免、交通规则合规和道德推理指标,提供更真实的测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09856 2026-05-12 cs.CV cs.AI

MoPO: Incorporating Motion Prior for Occluded Human Mesh Recovery

MoPO:结合运动先验进行遮挡人体网格恢复

Tao Tang, Hong Liu, Xinshun Wang, Wanruo Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(一般人工智能国家重点实验室,北京大学,深圳研究生院,中国)

AI总结 本文提出MoPO,通过结合运动先验来提高遮挡人体网格恢复的鲁棒性,采用时空遮挡检测和轻量运动预测模块,结合图像特征进行融合与优化,提升恢复精度和时间一致性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09387 2026-05-12 cs.AI cs.RO

NEXUS: Continual Learning of Symbolic Constraints for Safe and Robust Embodied Planning

NEXUS:用于安全和稳健体素规划的符号约束连续学习

Tiehan Cui, Peipei Liu, Yanxu Mao, Congying Liu, Mingzhe Xing, Datao You

机构 * School of Artificial Intelligence and Automation(人工智能与自动化学院) Huazhong University of Science and Technology(华中科技大学) School of Software(软件学院) Henan University(河南大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) School of Cyberspace Security(网络空间安全学院) University of the Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 NEXUS通过模块化框架实现体素代理的连续学习,将符号 artifacts 用于符号 grounding 和知识演化,将概率风险评估转化为确定性硬约束,提升任务成功率并抵御对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09299 2026-05-12 cs.GR cs.LG

LagrangianSplats: Divergence-Free Transport of Gaussian Primitives for Fluid Reconstruction

LagrangianSplats: 用于流体重建的无散度传输高斯原语

Ningxiao Tao, Baoquan Chen, Mengyu Chu

机构 * School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

AI总结 本文提出一种基于无散度核的框架,通过拉格朗日3D高斯点散布实现流体重建,确保流体不可压缩性和远距离传输一致性,实验显示其在传输一致性和物理准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09276 2026-05-12 cs.LG cs.CV

Uncertainty-Aware Token Importance Estimation in Spiking Transformers

在脉冲变换器中考虑不确定性的标记重要性估计

Wenxuan Liu, Zecheng Hao, Tong Bu, Yuran Wang, Zhaofei Yu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Computer Science, Peking University. Institute for Artificial Intelligence, Peking University(北京大学计算机科学学院。人工智能研究所) Peking University(北京大学)

AI总结 本文提出Uncert框架,通过建模类证据和时间不确定性模式,提升脉冲变换器的标记重要性估计,实现更高效的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13630 2026-05-12 cs.CR cs.AI

SafeHarness: Lifecycle-Integrated Security Architecture for LLM-based Agent Deployment

SafeHarness:面向LLM代理部署的生命周期集成安全架构

Xixun Lin, Yang Liu, Yancheng Chen, Yongxuan Wu, Yucheng Ning, Yilong Liu, Nan Sun, Shun Zhang, Bin Chong, Chuan Zhou, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Institute of Applied Physics and Computational Mathematics(应用物理与计算数学研究所) Peking University(北京大学)

AI总结 本文提出SafeHarness架构,通过四个防御层集成到代理生命周期中,解决现有安全方法的结构性不匹配问题,降低不安全行为和攻击成功率。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08960 2026-05-12 cond-mat.mtrl-sci cs.LG physics.chem-ph physics.comp-ph

CrystalREPA: Transferring Physical Priors from Universal MLIPs to Crystal Generative Models

CrystalREPA: 从通用机器学习 interatomic 势能中转移物理先验到晶体生成模型

Chengqian Zhang, Yucheng Jin, Duo Zhang, Tiejun Li, Han Wang

机构 * AI for Science Institute, Beijing, China(人工智能科学研究院,北京,中国) Center for Data Science, Peking University, Beijing, China(数据科学中心,北京大学,北京,中国) LMAM and School of Mathematical Sciences, Peking University, Beijing, China(LMAM与数学科学学院,北京大学,北京,中国) Center for Machine Learning Research, Peking University, Beijing, China(机器学习研究中心,北京大学,北京,中国) National Key Laboratory of Computational Physics, Institute of Applied Physics and Computational Mathematics, Beijing, China(国家计算物理重点实验室,应用物理与计算数学研究所,北京,中国) HEDPS, CAPT, College of Engineering, Peking University, Beijing, China(HEDPS、CAPT、工程学院,北京大学,北京,中国)

AI总结 CrystalREPA 通过在训练时对齐生成编码器的原子隐藏状态与冻结的 MLIP 表示,转移稳定性感知的原子先验,提升生成晶体的热力学稳定性、结构有效性及结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08762 2026-05-12 cs.SD cs.LG

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

Omni-DeepSearch:一种基于音频的多模态深度搜索基准

Tao Yu, yiming ding, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Xinming Wang, Xinlong Chen, Zhaolu Kang, Junhao Gong, Yuxuan Zhou, Haopeng Jin, Zhiqing Cui, Jiabing Yang, YiFan Zhang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA UCAS BAAI Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08761 2026-05-12 cs.MA cs.LG

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

超越全能代理:企业工作流中角色专业化多代理协作的基准测试

Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang

机构 * BAAI(北京人工智能研究院) CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出EntCollabBench,用于评估企业多代理协作,模拟权限隔离组织,包含工作流和审批两个子集,通过执行轨迹、数据库验证和确定性政策裁决评估代理系统,实验表明当前模型在企业协作中仍存在缺陷。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏