arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2601.10122 2026-01-16 cs.CL cs.AI cs.HC 73%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 73%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13291 2026-01-15 cs.CL cs.AI 73%

Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems

更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告

Xuxin Cheng, Ke Zeng, Zhiquan Cao, Linyi Dai, Wenxuan Gao, Fei Han, Ai Jian, Feng Hong, Wenxing Hu, Zihe Huang, Dejian Kong, Jia Leng, Zhuoyuan Liao, Pei Liu, Jiaye Lin, Xing Ma, Jingqing Ruan, Jiaxing Song, Xiaoyu Tan, Ruixuan Xiao, Wenhui Yu, Wenyu Zhan, Haoxing Zhang, Chao Zhou, Hao Zhou, Shaodong Zheng, Ruinian Chen, Siyuan Chen, Ziyang Chen, Yiwen Dong, Yaoyou Fan, Yangyi Fang, Yang Gan, Shiguang Guo, Qi He, Chaowen Hu, Binghui Li, Dailin Li, Xiangyu Li, Yan Li, Chengjian Liu, Xiangfeng Liu, Jiahui Lv, Qiao Ma, Jiang Pan, Cong Qin, Chenxing Sun, Wen Sun, Zhonghui Wang, Abudukelimu Wuerkaixi, Xin Yang, Fangyi Yuan, Yawen Zhu, Tianyi Zhai, Jie Zhang, Runlai Zhang, Yao Xu, Yiran Zhao, Yifan Wang, Xunliang Cai, Yangen Hu, Cao Liu, Lu Pan, Xiaoli Wang, Bo Xiao, Wenyuan Yao, Qianlin Zhou, Benchang Zhu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 73%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02369 2026-01-14 cs.CL cs.AI 73%

AutoContext: Instance-Level Context Learning for LLM Agents

AutoContext:LLM代理的实例级上下文学习

Kuntai Cai, Juncheng Liu, Xianglin Yang, Zhaojie Niu, Xiaokui Xiao, Xing Chen

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 AutoContext通过解耦探索与任务解决,为LLM代理构建结构化的实例上下文,显著提升了任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07606 2026-01-13 cs.CL cs.AI 73%

Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments

证明时间:评估科学思想判断的基准

Bingyang Ye, Shan Chen, Jingxuan Tu, Chen Liu, Zidi Xiong, Samuel Schmidgall, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Brandeis University(布兰迪大学) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 73%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24959 2026-01-01 cs.LG cs.AI 73%

Semi-overlapping Multi-bandit Best Arm Identification for Sequential Support Network Learning

半重叠多臂老虎机最佳臂识别用于序列支持网络学习

András Antos, András Millinghoffer, Péter Antal

机构 * Department of Artificial Intelligence and Systems Engineering(人工智能与系统工程系) Budapest University of Technology and Economics(布达佩斯技术与经济大学) E-Group ICT Software Zrt.(E-Group ICT软件公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半重叠多臂老虎机模型,用于高效学习支持网络,改进多老虎机最佳臂识别的误差界并提升性能保证。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09602 2025-12-30 physics.flu-dyn cs.AI cs.CL 73%

Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations

针对计算流体力学模拟的大型语言模型微调

Zhehao Dong, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。

Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16530 2025-12-19 cs.CL cs.AI 73%

Plain language adaptations of biomedical text using LLMs: Comparision of evaluation metrics

利用大语言模型对生物医学文本进行plain language改编:评估指标的比较

Primoz Kocbek, Leon Kopitar, Gregor Stiglic

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 73%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13764 2025-12-17 cs.AI cs.LG 73%

Mathematics and Coding are Universal AI Benchmarks

数学与编码是通用AI的通用基准

Przemyslaw Chojecki

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了数学和编码在AI评估中的通用性,证明了编码任务在电池空间中的稠密性,而纯数学并非如此,揭示了形式数学作为递归自我改进的自然起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12443 2025-12-16 cs.AI cs.SE 73%

AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline

AI透明度地图:框架、评分与实时模型卡片评估流程

Akhmadillo Mamirov, Faiaz Azmain, Hanyu Wang

机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23046 2025-12-16 cs.CL cs.AI cs.CV cs.RO 73%

SoMi-ToM: Evaluating Multi-Perspective Theory of Mind in Embodied Social Interactions

SoMi-ToM:评估具身社会互动中的多视角理论之心假设

Xianzhe Fan, Xuhui Zhou, Chuanyang Jin, Kolby Nottingham, Hao Zhu, Maarten Sap

机构 * The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。

Comments 24 pages, 6 figures

Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 73%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07785 2025-12-10 physics.data-an cs.AI cs.LG hep-ex 73%

Automating High Energy Physics Data Analysis with LLM-Powered Agents

利用LLM代理自动化高能物理数据分析

Eli Gendreau-Distler, Joshua Ho, Dongwon Kim, Luc Tomas Le Pottier, Haichen Wang, Chengxi Yang

机构 * Department of Physics, University of California, Berkeley, Berkeley, CA 94720, USA(加州大学伯克利分校物理系) Physics Division, Lawrence Berkeley National Laboratory, Berkeley, CA 94720, USA(伯克利国家实验室物理部)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本研究利用LLM代理自动化高能物理数据分析,通过混合系统结合LLM和Snakemake工作流管理器,评估代理在多阶段工作流中的性能。

Comments 16 pages, 6 figures, 2 tables, the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) - Machine Learning and the Physical Sciences (ML4PS) workshop (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 73%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17467 2025-12-03 cs.LG cs.AI 73%

PersonaAgent with GraphRAG: Community-Aware Knowledge Graphs for Personalized LLM

具有图RAG的PersonaAgent:面向个性化LLM的社区感知知识图谱

Siqi Liang, Yudi Zhang, Yue Guo

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 PersonaAgent结合图RAG技术,通过构建社区感知的知识图谱,提升个性化LLM在新闻分类、电影标签和产品评分任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07663 2025-12-02 cs.AI cs.CL cs.CY cs.HC 73%

Human Decision-making is Susceptible to AI-driven Manipulation

人类决策易受AI驱动的操控

Sahand Sabour, June M. Liu, Siyang Liu, Chris Z. Yao, Shiyao Cui, Xuanming Zhang, Wen Zhang, Yaru Cao, Advait Bhat, Jian Guan, Wei Wu, Rada Mihalcea, Hongning Wang, Tim Althoff, Tatia M. C. Lee, Minlie Huang

机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ANT Group(ANT集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 73%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA 73%

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19489 2025-11-26 cs.SE cs.AI 73%

Evolution without an Oracle: Driving Effective Evolution with LLM Judges

无Oracle的进化:通过LLM裁判驱动有效进化

Zhe Zhao, Yuheng Yang, Haibin Wen, Xiaojie Qiu, Zaixi Zhang, Qingfu Zhang

机构 * Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MADE框架,通过问题规范减少LLM反馈噪声,实现无Oracle的进化优化,在软件需求满足和复杂指令跟随任务中取得显著成效。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18036 2025-11-25 cs.AI cs.CL cs.IR 73%

Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers

Paper2SysArch: 从科学论文生成结构约束的系统架构图

Ziyi Guo, Zhou Liu, Wentao Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Paper2SysArch通过多智能体协作从科学论文生成结构化的系统架构图,建立首个大规模基准以推动自动化科学可视化的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15958 2025-11-21 cs.AI cs.CL 73%

JudgeBoard: Benchmarking and Enhancing Small Language Models for Reasoning Evaluation

JudgeBoard: 对小语言模型进行推理评估的基准测试与增强

Zhenyu Bi, Gaurav Srivastava, Yang Li, Meng Lu, Swastik Roy, Morteza Ziyadi, Xuan Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 JudgeBoard通过多代理框架提升小语言模型的推理判断能力,展示其在数学和常识推理任务中与大模型相当的性能。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15370 2025-11-20 cs.CL cs.AI 73%

The Empowerment of Science of Science by Large Language Models: New Tools and Methods

Guoqiang Liang, Jingqian Gong, Mengxuan Li, Gege Lin, Shuo Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

Comments The manuscript is currently ongoing the underreview process of the journal of information science

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11654 2025-11-19 cs.IR cs.AI cs.CL 73%

FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection

Daniel Berhane Araya, Duoduo Liao

机构 * College of Engineering and Computing(工程与计算学院) George Mason University(乔治·马歇尔大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11576 2025-11-18 cs.LG cs.AI 73%

DAOpt: Modeling and Evaluation of Data-Driven Optimization under Uncertainty with LLMs

WenZhuo Zhu, Zheng Cui, Wenhan Lu, Sheng Liu, Yue Zhao

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07871 2025-11-10 cs.RO cs.AI cs.CV cs.LG 73%

Learning to Navigate Socially Through Proactive Risk Perception

Erjia Xiao, Lingfeng Zhang, Yingbo Tang, Hao Cheng, Renjing Xu, Wenbo Ding, Lei Zhou, Long Chen, Hangjun Ye, Xiaoshuai Hao

机构 * HKUST (GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Institute of Automation, CAS(中国科学院自动化研究所) Xiaomi EV(小米电动车)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03757 2025-11-07 cs.LG cs.AI 73%

Laugh, Relate, Engage: Stylized Comment Generation for Short Videos

Xuan Ouyang, Senan Wang, Bouzhou Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22751 2025-11-05 stat.ML cs.AI cs.LG 73%

Variance-Bounded Evaluation of Entity-Centric AI Systems Without Ground Truth: Theory and Measurement

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏