arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-10 至 2026-03-10 共收录 35 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 35 篇

2603.08706 2026-03-10 cs.AI cs.CL cs.LG 87%

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08329 2026-03-10 cs.CL cs.AI cs.IR 86%

SPD-RAG: Sub-Agent Per Document Retrieval-Augmented Generation

SPD-RAG:基于文档的子代理检索增强生成

Yagiz Can Akay, Muhammed Yusuf Kartal, Esra Alparslan, Faruk Ortakoyluoglu, Arda Akpinar

机构 * TOBB University of Economics and Technology(托布大学经济与技术学院) OSTIM Technical University(OSTIM技术大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 SPD-RAG通过文档级子代理和集中融合提升多文档问答性能,实现高效检索与生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 84%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06884 2026-03-10 cs.AI 83%

Distributed Legal Infrastructure for a Trustworthy Agentic Web

分布式法律基础设施用于可信代理网络

Tomer Jordi Chaffer, Victor Jiawei Zhang, Sante Dino Facchini, Botao Amber Hu, Helena Rong, Zihan Guo, Xisen Wang, Carlos Santana, Giovanni De Gasperis

机构 * Institute for Technoscience and Society(科技与社会研究所) Berkeley Center for Law & Technology(伯克利法与科技中心) U.C. Berkeley Law School(伯克利法学院) Technical University of Munich(慕尼黑技术大学) Università degli Studi dell’Aquila(阿奎拉大学) University of Oxford(牛津大学) Existential Risk Alliance(存在风险联盟) NYU Shanghai(纽约大学上海分校) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06583 2026-03-10 cs.HC cs.CY cs.LG 81%

XInsight: Integrative Stage-Consistent Psychological Counseling Support Agents for Digital Well-Being

XInsight:集成化阶段一致的心理咨询支持代理用于数字福祉

Fei Wang, Jiangnan Yang, Junjie Chen, Yuxin Liu, Kun Li, Yanyan Wei, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Intelligent Interconnected Systems Laboratory of Anhui Province (HFUT)(安徽省智能互联系统实验室(HFUT))

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);multi-agent(abstract)

AI总结 XInsight是一种集成化多代理框架,通过阶段一致的工作流程和统一循环,提升网络应用中数字福祉的心理支持效果。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08429 2026-03-10 cs.CL cs.AI cs.IR 81%

One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States

一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09021 2026-03-10 cs.LG 79%

A Champion-level Vision-based Reinforcement Learning Agent for Competitive Racing in Gran Turismo 7

一款冠军级基于视觉的强化学习代理用于Gran Turismo 7中的竞争赛车

Hojoon Lee, Takuma Seno, Jun Jet Tai, Kaushik Subramanian, Kenta Kawamoto, Peter Stone, Peter R. Wurman

机构 * KAIST(韩国科学技术院) Sony AI(索尼人工智能) Coventry University(科文特大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于视觉的自主赛车代理,通过仅使用车载传感器数据和摄像头视角,在Gran Turismo 7中实现了冠军级的赛车性能。

Comments Accepted for Publication at the IEEE Robotics and Automation Letters (RA-L) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07842 2026-03-10 q-bio.PE 78%

Simulating nationwide coupled disease and fear spread in an agent-based model

在基于代理的模型中模拟全国范围的疾病和恐惧传播

Joy Kitson, Prescott C. Alexander, Joseph Tuccillo, David J. Butts, Christa Brelsford, Abhinav Bhatele, Sara Y. Del Valle, Timothy C. Germann

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种基于代理的模型,模拟疾病和恐惧的传播,通过分析不同疾病状态和行为反应,揭示了耦合动态对流行病波的影响。

Comments 21 pages, 8 figures, 2 tables

Journal ref Scientific Reports, 15(1), 42235 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07391 2026-03-10 cs.AI cs.MA 77%

NAAMSE: Framework for Evolutionary Security Evaluation of Agents

NAAMSE:用于智能体进化安全评估的框架

Kunal Pai, Parth Shah, Harshil Patel

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 NAAMSE通过进化框架提升智能体的安全评估,利用遗传突变和探索发现隐藏漏洞,提供更真实鲁棒性评估。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07886 2026-03-10 cs.CL cs.AI 73%

CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases

CCR-Bench:一个全面的评估基准,用于评估大语言模型在复杂约束、控制流和现实世界案例中的能力

Xiaona Xue, Yiqiao Huang, Jiacheng Li, Yuanhang Zheng, Huiqi Miao, Yunfei Ma, Rui Liu, Xinbao Sun, Minglu Liu, Fanyu Meng, Chao Deng, Junlan Feng

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 CCR-Bench是一个用于评估大语言模型在复杂约束、控制流和现实世界案例中表现的全面基准,通过现实工业场景的样本揭示了当前模型在复杂指令理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19223 2026-03-10 cs.AI cs.LG cs.MA 73%

Characterizing MARL for Energy Control: A Multi-KPI Benchmark on the CityLearn Environment

对MARL在能源控制中的特性进行表征:在CityLearn环境中的一项多KPI基准测试

Aymen Khouja, Imen Jendoubi, Oumayma Mahjoub, Oussama Mahfoudhi, Ruan De Kock, Siddarth Singh, Claude Formanek

机构 * InstaDeep

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多KPI基准测试,评估了MARL在城市能源管理中的性能,揭示了DTDE在平均和最坏情况下的优越性,并探讨了时间依赖学习对电池操作的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07890 2026-03-10 cs.AI cs.CV 70%

Visualizing Coalition Formation: From Hedonic Games to Image Segmentation

从享乐博弈到图像分割:联盟形成的可视化

Pedro Henrique de Paula França, Lucas Lopes Felipe, Daniel Sadoc Menasché

机构 * UFRJ(里约热内卢联邦大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过图像分割技术研究享乐博弈中联盟形成的过程,揭示细粒度参数对均衡结构的影响,并将多代理系统与图像分割联系起来。

Comments The First Workshop on AI for Mechanism Design and Strategic Decision Making -- Workshop AIMS at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07169 2026-03-10 cs.LG stat.ML 70%

Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts

使LLMs像专家一样优化多场景CUDA内核

Yuxuan Han, Meng-Hao Guo, Zhengning Liu, Wenguang Chen, Shi-Min Hu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出CUDAMaster系统,通过多代理和硬件感知方法,实现对多场景CUDA内核的高效优化,显著提升性能并超越现有闭源库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01528 2026-03-10 cs.CV cs.AI cs.RO 70%

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen:自主驾驶中生成视频世界模型的综合性基准

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven L. Waslander

机构 * University of Toronto(多伦多大学) CUHK MMLab(香港中文大学MMLab)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。

Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08685 2026-03-10 cs.NI 67%

Predicting Conflict Impact on Performance in O-RAN

预测O-RAN中冲突对性能的影响

Pietro Brach del Prever, Niloofar Mohamadi, Salvatore D'Oro, Leonardo Bonati, Michele Polese, Łukasz Kułacz, Piotr Jaworski, Adrian Kliks, Heiko Lehmann, Tommaso Melodia

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 本文提出了一种方法,通过分析代理生成动作的频率,预测O-RAN中冲突对性能的影响。

Comments INFOCOM 2026 Workshop - 6G AI-RAN: AI Native Distributed Intelligence for 6G Networks. 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07605 2026-03-10 cs.IR 67%

Deep Research for Recommender Systems

深度研究推荐系统

Kesha Ou, Chenghao Wu, Xiaolei Wang, Bowen Zheng, Wayne Xin Zhao, Weitao Li, Long Zhang, Sheng Chen, Ji-Rong Wen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出RecPilot多代理框架,通过生成用户为中心的报告替代传统物品列表,主动提升用户体验并减少用户决策负担。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15322 2026-03-10 cs.AI cs.CL 66%

Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents

可重播的金融代理:用于工具使用LLM代理的确定性-忠实性保证框架

Raffi Khatchadourian

专题命中 Agent评测 :agentic(abstract,comments);分类 cs.AI、cs.CL

AI总结 本文提出DFAH框架,用于评估金融代理的确定性和忠实性,发现决策确定性与准确性无显著相关性,强调需独立测量两者的多维评估方法。

Comments 27 pages, 5 figures, 9 tables | Code and data: https://github.com/ibm-client-engineering/output-drift-financial-llms | To appear in the 2nd ICLR Workshop on Advances in Financial AI: Towards Agentic and Responsible Systems (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08455 2026-03-10 cs.AI cs.LG 62%

The Boiling Frog Threshold: Criticality and Blindness in World Model-Based Anomaly Detection Under Gradual Drift

青蛙沸腾阈值:世界模型基于异常检测中的临界性与盲目性

Zhe Hong

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了世界模型在异常检测中的临界阈值,发现检测阈值受噪声底座、检测器和环境动态的三重交互影响,且正弦漂移无法被检测到。

Comments 10 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20152 2026-03-10 cs.CL cs.AI 62%

Goal Alignment in LLM-Based User Simulators for Conversational AI

基于对话AI的LLM用户模拟器中的目标对齐

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出UGST框架,通过三阶段方法改进用户模拟器的目标对齐能力,并在两个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS 62%

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06671 2026-03-10 cs.LG cs.AI 62%

ERP-RiskBench: Leakage-Safe Ensemble Learning for Financial Risk

ERP-RiskBench: 用于金融风险的泄漏安全集成学习

Sanjay Mishra

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ERP-RiskBench通过泄漏安全的集成学习方法,提升ERP系统中金融风险检测的准确性和可解释性。

Comments 12 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 57%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07978 2026-03-10 cs.AI 57%

OSExpert: Computer-Use Agents Learning Professional Skills via Exploration

OSExpert: 通过探索学习专业技能的计算机使用智能体

Jiateng Liu, Zhenhailong Wang, Rushi Wang, Bingxuan Li, Jeonghwan Kim, Aditi Tiwari, Pengfei Yu, Denghui Zhang, Heng Ji

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OSExpert通过引入GUI-DFS探索算法和技能集,提升智能体在复杂任务中的表现和效率,实现专家级计算机使用。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI 57%

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06585 2026-03-10 cs.HC cs.AI 57%

Right Move, Right Time: Multi-Sport Space Evaluation Platform for Ultimate Frisbee, Basketball, and Soccer

正确移动,正确时机:多运动空间评估平台用于极限飞盘、篮球和足球

Shunsuke Iwashita, Titouan Jeannot, Braden Eberhard, Jacob Miller, Rikako Kono, Calvin Yeung, Keisuke Fujii

机构 * Nagoya University(名古屋大学) Aix-Marseille Université(阿维尼翁-马赛大学) University of Pennsylvania(宾夕法尼亚大学) Shown Space Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出一个多运动空间评估平台,通过标准化输入和时间感知评估,实现极限飞盘、篮球和足球之间的空间度量比较,为不同运动的评估一致性提供实用解决方案。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08680 2026-03-10 quant-ph 50%

Metriq: A Collaborative Platform for Benchmarking Quantum Computers

Metriq: 一个用于量子计算机基准测试的协作平台

Alessandro Cosentino, Changhao Li, Vincent Russo, Bradley A. Chase, Tom Lubinski, Siyuan Niu, Neer Patel, Nathan Shammah, William J. Zeng

专题命中 Agent评测 :workflow(abstract)

AI总结 Metriq是一个开源协作平台,用于可重复的跨平台量子计算机基准测试,通过统一的工作流程整合基准定义、执行、数据收集和公开展示,提供系统级和应用级的性能评估,并引入Metriq分数作为综合性能指标。

Comments 41 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08603 2026-03-10 econ.GN q-fin.EC 50%

A Dynamic Equilibrium Model for Automated Market Makers

自动市场 maker 的动态均衡模型

Chengqi Zang, Zhenghui Wang, Weitong Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个动态均衡模型,研究自动市场 maker 中套利者、噪音交易者和流动性提供者之间的互动,揭示流动性提供与波动性的非单调关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08364 2026-03-10 cs.CV 50%

Diffusion-Based Data Augmentation for Image Recognition: A Systematic Analysis and Evaluation

基于扩散的数据增强用于图像识别:系统分析与评估

Zekun Li, Yinghuan Shi, Yang Gao, Dong Xu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出UniDiffDA框架,系统分析DiffDA方法的三个核心组件,通过全面评估揭示不同策略的优劣,提供可复现的代码和配置以促进研究。

Journal ref Int J Comput Vis 134, 126 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08050 2026-03-10 math.OC math.AP 50%

Finite-Horizon Optimal Consumption and Investment with Time-Varying Job-Switching Costs

有限时间 horizon 最优消费与投资及时间变化就业转换成本问题

Gugyum Ha, Junkee Jeon, Jihoon Ok

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在时间变化就业转换成本下,经济代理人在有限时间 horizon 内的最优消费、投资及就业转换策略问题,通过PDE理论分析了双障碍问题的解及其自由边界性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 50%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏