arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2606.20002 2026-06-19 cs.LG cs.AI cs.CL 新提交 75%

Connect the Dots: Training LLMs for Long-Lifecycle Agents with Cross-Domain Generalization Via Reinforcement Learning

Connect the Dots:通过强化学习训练具备跨域泛化能力的长期生命周期智能体

Yanxi Chen, Weijie Shi, Yuexiang Xie, Boyi Hu, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Connect the Dots框架,通过端到端强化学习训练LLM在长期任务中自我更新上下文并泛化到新领域,实验验证了跨域泛化能力。

Comments Work in progress; we will continuously update the codebase and arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22222 2026-06-18 cs.IR cs.MA 版本更新 75%

TWICE: Modeling the Temporal Evolution of Personalized User Behavior via Event-Driven Agents

TWICE:通过事件驱动代理建模个性化用户行为的时间演化

Bingrui Jin, Kunyao Lan, Baihan LI, Mengyue Wu

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract)

AI总结 提出TWICE框架,结合结构化用户画像、事件驱动记忆模块和两阶段工作流,利用LLM模拟用户行为的时间演化,在Twitter数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新 75%

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

机构 * Michigan Technological University, Houghton(密歇根技术大学) Birmingham City University(伯明翰城市大学) University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17164 2026-06-17 cs.CL cs.AI cs.HC cs.PL cs.SE 新提交 75%

PromptMN: Pseudo Prompting Language

PromptMN: 伪提示语言

Enkhzol Dovdon

机构 * ICT Group(ICT集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出PromptMN,一种伪提示领域特定语言,通过紧凑的%前缀类型指令注释自然语言,减少上下文歧义,提升人机交互的清晰度和可审查性。

Comments 32 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00384 2026-06-09 cs.AI cs.CL cs.CV cs.LG stat.CO 版本更新 75%

VESTA: Visual Exploration with Statistical Tool Agents

VESTA: 基于统计工具代理的视觉探索

William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Greg Durrett, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出VESTA框架,通过动态增长的工具集指导数据变换、假设驱动可视化和统计检验,提升视觉语言模型在复杂统计建模任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.02937 2026-06-04 eess.SY cs.SY 75%

Simple synchronization protocols for heterogeneous networks: beyond passivity (extended version)

异构网络简单同步协议:超越被动性(扩展版)

Anton V. Proskurnikov, Manuel Mazo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文研究了非被动但满足弱输入前馈被动性条件的异构代理同步问题,提出了一种简单线性协议实现同步,适用于强连通交互图和弱耦合情况。

Comments accepted to IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.04346 2026-06-04 stat.ME econ.GN q-fin.EC 75%

Explicit solutions to a vector time series model and its induced model for business cycles

向量时间序列模型及其诱导模型的显式解

Xiongzhi Chen

专题命中 Agent评测 :agent(summary_cn,abstract_cn)

AI总结 本文给出了一种描述异质 agent 在不确定性下根据凯恩斯原理交互的向量时间序列模型的显式解,并通过 agent 增长率的加权平均诱导出商业周期模型,从而更深入理解模型的数学性质和经济计量特性。

Comments 16 page2, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 75%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19667 2026-05-27 cs.CL cs.AI cs.CV cs.LG cs.MA 75%

Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language

Chat2Workflow: 用自然语言生成可执行可视化工作流的基准

Yi Zhong, Buqiang Xu, Yijun Wang, Zifei Shan, Shuofei Qiao, Guozhou Zheng, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Chat2Workflow基准,用于评估大语言模型从自然语言生成可执行可视化工作流的能力,并设计了一个智能体基线以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19838 2026-05-20 cs.HC 75%

From Role to Person: Trust Calibration Challenges in Twin Agents

从角色到个体:双代理中的信任校准挑战

Hugo Andersson, Niklas Elmqvist

专题命中 Agent评测 :agentic(abstract,abstract_cn);agent(abstract)

AI总结 本文探讨了双代理在专业环境中作为个体知识工作者代表时所面临的信任校准问题,指出传统框架无法处理因双代理消除了AI与人类决策者之间边界而产生的新挑战。

Comments Accepted to AutomationXP26 Workshop at CHI 2026, Barcelona, Spain. Non-archival

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18824 2026-05-20 cs.LG cs.AI cs.CL 75%

Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

细粒度基准生成用于基础模型的全面评估

Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki, Afshin Cheraghi, Ali Kore, Shayaan Mehdi, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究院) York University(约克大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种自动化基准生成框架,用于生成覆盖广泛、元数据丰富且抗污染的评估问题,从而提升基础模型的全面评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02262 2026-05-19 cs.SE cs.AI cs.CL 75%

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10034 2026-05-12 cs.RO 75%

Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving

超越自我博弈与规模:面向自动驾驶泛化的行为基准

Aron Distelzweig, Faris Janjoš, Andreas Look, Anna Rothenhäusler, Daniel Jost, Oliver Scheel, Raghu Rajan, Daphne Cornelisse, Eugene Vinitsky, Joschka Boedecker

机构 * University of Freiburg(弗赖堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University of Applied Sciences(科堡应用科学大学) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出BehaviorBench,通过评估、复杂性和行为多样性三个维度,解决自动驾驶大规模强化学习政策在标准化评估中的性能问题,并提出混合规划器提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09930 2026-05-12 cs.GT 75%

Fair Allocation under Conflict Constraints

在冲突约束下公平分配

Sarfaraz Equbal, Rohit Gurjar, Ayumi Igarashi, Yatharth Kumar, Pasin Manurangsi, Swaprava Nath, Raghuvansh Saxena, Rohit Vaish, Hirotaka Yoneda

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究在冲突约束下如何公平高效分配不可分割物品,针对两agent和一般数量agent情况,探讨EF1和最大分配的存在性及计算复杂性。

Comments This article unifies and extends the results in arXiv:2402.04353 and arXiv:2506.14149

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08647 2026-05-12 cs.CL cs.AI cs.LG 75%

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

AgentCollabBench: 评估好代理为何会成为差合作者

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan

机构 * University of Utah(犹他大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Dhaka(达卡大学) Vellore Institute of Technology(韦洛雷理工学院) University of Virginia(弗吉尼亚大学) Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学) Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) BRAC University(BRAC大学) Islamic University of Technology(伊斯兰技术大学) Comilla University(科摩拉大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AgentCollabBench,通过900个经人类验证的任务评估多代理系统中四个行为风险:指令衰减、虚假信念传播、上下文泄露和追踪耐久性,揭示模型在多跳信息生存中的结构问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG 75%

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09554 2026-04-14 cs.AI cs.CL cs.LG 75%

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

LABBench2:一种改进的AI系统进行生物研究的基准测试

Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques

机构 * Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出LABBench2,一个包含近1900个任务的改进基准,用于评估AI在真实世界中执行科学任务的能力,展示了当前前沿模型在不同子任务上的性能差异,并提供了数据集和评估工具以促进社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04247 2026-04-07 cs.AI cs.CL cs.LG 75%

Combee: Scaling Prompt Learning for Self-Improving Language Model Agents

Combee:用于自我改进语言模型代理的提示学习扩展

Hanchen Li, Runyuan He, Qizheng Zhang, Changxiu Ji, Qiuyang Mang, Xiaokun Chen, Lakshya A Agrawal, Wei-Liang Liao, Eric Yang, Alvin Cheung, James Zou, Kunle Olukotun, Ion Stoica, Joseph E. Gonzalez

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh Gradient Network

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Combee通过并行扫描和增强洗牌机制,提升提示学习效率,实现多代理并行训练,同时保持学习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01128 2026-04-02 cs.CL cs.AI cs.LG 75%

Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

论文重构评估:评估AI论文中的表现和幻觉

Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko Yamasaki, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。

Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29322 2026-04-01 cs.HC 75%

VACP: Visual Analytics Context Protocol

VACP:视觉分析上下文协议

Tobias Stähle, Péter Ferenc Gyarmati, Thilo Spinner, Rita Sevastjanova, Dominik Moritz, Mennatallah El-Assady

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 本文提出VACP协议,旨在使视觉分析应用'agent友好',通过显式暴露应用状态和交互机制,提升AI代理在视觉分析任务中的执行效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 75%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26996 2026-03-31 cs.AI cs.CL cs.LG cs.PL 75%

FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?

FormalProofBench:模型能否写出经过形式验证的研究生级数学证明?

Nikil Ravi, Kexing Ying, Vasilii Nesterov, Rayan Krishnan, Elif Uskuplu, Bingyu Xia, Janitha Aswedige, Langston Nashold

机构 * Vals AI École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Indiana University, Bloomington(印第安纳大学布卢明顿分校) Independent Researcher(独立研究员)

专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 FormalProofBench评估AI能否生成经过形式验证的研究生级数学证明,通过自然语言问题与Lean 4形式陈述配对,测试模型生成Lean证明的能力,结果显示最佳模型准确率为33.5%。

Comments Accepted at ICLR 2026 Workshop: VerifAI-2: The Second Workshop on AI Verification in the Wild. Live leaderboard hosted here: https://www.vals.ai/benchmarks/proof_bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05244 2026-03-24 cs.CR 75%

Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?

间接提示注入:防火墙足够吗,还是需要更强的基准?

Rishika Bhagwatkar, Kevin Kasa, Abhay Puri, Gabriel Huang, Irina Rish, Graham W. Taylor, Krishnamurthy Dj Dvijotham, Alexandre Lacoste

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 75%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08640 2026-03-11 cs.SE cs.AI cs.LG 75%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01864 2026-03-03 cs.CV cs.RO 75%

Streaming Real-Time Trajectory Prediction Using Endpoint-Aware Modeling

基于端点意识建模的流式实时轨迹预测

Alexander Prutsch, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出了一种基于端点意识建模的轻量高效流式轨迹预测方法,通过连续时间上下文传播提升预测精度并降低推理延迟,适用于自动驾驶场景。

Comments WACV 2026 Oral. Project Page at https://a-pru.github.io/seam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03447 2026-02-26 cs.RO cs.CV 75%

HetroD: A High-Fidelity Drone Dataset and Benchmark for Autonomous Driving in Heterogeneous Traffic

HetroD:一种用于异质交通中自动驾驶的高保真无人机数据集和基准

Yu-Hsiang Chen, Wei-Jer Chang, Christian Kotulla, Thomas Keutgens, Steffen Runde, Tobias Moers, Christoph Klas, Wei Zhan, Masayoshi Tomizuka, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) UC Berkeley(伯克利大学) fka GmbH

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 HetroD通过高保真无人机数据集和基准,解决异质交通中自动驾驶面临的复杂行为预测与规划挑战。

Comments IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14242 2026-02-24 cs.CL cs.AI cs.LG 75%

APEX-Agents

AI代理生产力指数(APEX-Agents)

Bertie Vidgen, Austin Mann, Abby Fennelly, John Wright Stanly, Lucas Rothman, Marco Burstein, Julien Benchek, David Ostrofsky, Anirudh Ravichandran, Debnil Sur, Neel Venugopal, Alannah Hsia, Isaac Robinson, Calix Huang, Olivia Varones, Daniyal Khan, Michael Haines, Austin Bridges, Jesse Boyle, Koby Twist, Zach Richards, Chirag Mahapatra, Brendan Foody, Osvald Nitski

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 APEX-Agents是一个评估AI代理执行长期跨应用任务的基准,通过测试八个代理展示了Gemini 3 Flash的高分表现,并开源了相关资源和基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17058 2026-01-27 cs.DB cs.AI cs.CL cs.LG 75%

Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs

大模型能帮你清理数据吗?基于大模型的应用级数据准备综述

Wei Zhou, Jun Zhou, Haoyu Wang, Zhenghao Li, Qikang He, Shaokun Han, Guoliang Li, Xuanhe Zhou, Yeye He, Chunwei Liu, Zirui Tang, Bin Wang, Shen Tang, Kai Zuo, Yuyu Luo, Zhenzhe Zheng, Conghui He, Jingren Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Microsoft Research(微软研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文综述了基于大语言模型的应用级数据准备方法,探讨了数据清洗、整合与丰富三大任务的技术、优势与局限,并提出了可扩展的大语言模型-数据系统和稳健评估协议的未来研究方向。

Comments Please refer to our repository for more details: https://github.com/weAIDB/awesome-data-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15016 2026-01-22 cs.CV 75%

LiViBench: An Omnimodal Benchmark for Interactive Livestream Video Understanding

LiViBench:面向交互式直播视频理解的多模态基准测试

Xiaodong Wang, Langling Huang, Zhirong Wu, Xu Zhao, Teng Xu, Xuhong Xia, Peixi Peng

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 LiViBench是首个面向交互式直播视频的多模态基准测试,通过定制化两阶段指令微调和视频到评论检索模块,提升模型对直播视频的理解能力,并在多个基准测试中取得优异成绩。

Comments AAAI 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏