arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-21 至 2026-04-21 共收录 324 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 47 篇

2604.16353 2026-04-21 cs.IR cs.AI 70%

AgriIR: A Scalable Framework for Domain-Specific Knowledge Retrieval

AgriIR:一个可扩展的领域特定知识检索框架

Shuvam Banerji Seal, Aheli Poddar, Alok Mishra, Dwaipayan Roy

机构 * Indian Institute of Science Education Research, Kolkata, India Institute of Engineering \& Management, Kolkata, India , , , Contributed equally

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 AgriIR通过模块化设计实现领域特定知识检索,结合大语言模型与自适应检索器,确保在资源受限下提供可信答案,推动农业领域的AI应用。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10159 2026-04-21 cs.CL cs.DB cs.IR cs.MA 70%

ODUTQA-MDC: A Task for Open-Domain Underspecified Tabular QA with Multi-turn Dialogue-based Clarification

ODUTQA-MDC:一个面向开放领域未指定表格问答的任务

Zhensheng Wang, ZhanTeng Lin, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出ODUTQA-MDC任务及首个综合基准,包含大规模数据集、细粒度标注方案和动态澄清界面,提出MAIC-TQA框架以检测歧义、通过对话澄清并优化答案。

Comments This paper has been accepted by ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18046 2026-04-21 cs.CE cs.MA 67%

EvoMarket: A High-Fidelity and Scalable Financial Market Simulator

EvoMarket:一种高保真且可扩展的金融市场模拟器

Muyao Zhong, Zhenhua Yang, Yuxiang Liu, Ke Tang, Peng Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出EvoMarket,一种多资产和跨日环境下的多智能体金融市场模拟器,通过高吞吐量执行核心和显式机构机制,实现高保真度、可扩展性和计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16818 2026-04-21 cs.HC 67%

Beyond Serendipity: From Exposing the Unknown to Fostering Engagement through Peer Recommendation

超越偶然性:通过同伴推荐暴露未知并促进参与

Sosui Moribe, Taketoshi Ushiama

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出Peer Recommendation框架,通过用户与AI代理基于对话的协作探索未知内容,发现偏好距离对用户兴趣扩展和参与价值有显著影响。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16538 2026-04-21 cs.SE cs.AI cs.LG cs.PL 67%

Understanding Tool-Augmented Agents for Lean Formalization: A Factorial Analysis

理解用于精益形式化的工具增强代理:因子分析

Ke Zhang, Patricio Gallardo, Maziar Raissi, Sudhir Murthy

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文通过因子分析评估三种工具类型在自然语言数学自动转换为Lean 4代码中的有效性,发现工具增强代理在编译成功率和语义等价性上有显著提升。

Comments 15 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18375 2026-04-21 cs.CL cs.AI 62%

IceBreaker for Conversational Agents: Breaking the First-Message Barrier with Personalized Starters

对话代理的IceBreaker:通过个性化开场白打破第一消息障碍

Hongwei Zheng, Weiqi Wu, Zhengjia Wang, Guanyu Jiang, Haoming Li, Tianyu Wu, Yongchun Zhu, Jingwu Chen, Feng Zhang

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出IceBreaker,通过生成个性化开场白帮助对话代理克服用户初始对话时的障碍,提升用户活跃度和点击率。

Comments ACL 2026 Accepted Paper (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17730 2026-04-21 cs.CL cs.AI cs.HC 62%

MHSafeEval: Role-Aware Interaction-Level Evaluation of Mental Health Safety in Large Language Models

MHSafeEval:面向大语言模型中心理健康安全的交互层面角色感知评估

Suhyun Lee, Palakorn Achananuparp, Neemesh Yadav, Ee-Peng Lim, Yang Deng

机构 * Department of Artificial Intelligence, Hanyang University(翰艺大学人工智能系) School of Computing and Information Systems, Singapore Management University(新加坡国立管理学院信息系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MHSafeEval框架,通过角色感知模型评估大语言模型在多轮对话中的心理健康安全问题,揭示角色依赖性和累积性安全故障,提升故障模式覆盖和诊断精度。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 62%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17894 2026-04-21 cs.CL 57%

Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions

基于用户定义动态模板和自然语言指令的自动幻灯片更新

Kun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出DynaSlide基准,结合多模态解析和自然语言指令,实现幻灯片动态更新,保留布局与样式,并设计评估协议揭示未来研究挑战。

Comments To appear in Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL 57%

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01943 2026-04-21 cs.LG 57%

SynRXN: An Open Benchmark and Curated Dataset for Computational Reaction Modeling

SynRXN:计算反应建模的开放基准和精心编纂的数据集

Tieu-Long Phan, Nhu-Ngoc Nguyen Song, Peter F. Stadler

机构 * Bioinformatics Group, Department of Computer Science \& Interdisciplinary Center for Bioinformatics \& School for Embedded Composite Artificial Intelligence (SECAI), Leipzig University, H \"a rtelstra e 16–18, D-04107 Leipzig, Germany School of Pharmacy, University of Medicine

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 SynRXN 提供了一个统一的基准框架和开放数据资源,用于计算机辅助合成规划。通过分解端到端合成规划为五个任务家族,提供透明的评估流程和定制化的评估指标,支持严谨的消融测试和压力测试。

Comments 31 pages (including references), 3 figures, 7 tables

Journal ref Scientific Data 13, 625 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17596 2026-04-21 cs.CR cs.AI 57%

Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories

终端 wrench:331个可奖励黑客环境和3,632条exploit轨迹的数据集

Ivan Bercovich, Ivgeni Segal, Kexun Zhang, Shashwat Saxena, Aditi Raghunathan, Ziqian Zhong

机构 * Fewshot Corp(Fewshot公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文发布了一个包含331个终端代理基准环境和3,632条exploit轨迹的数据集,展示了不同任务中的特定exploit方法,并通过LLM评估检测性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16821 2026-04-21 cs.LG 57%

R&F-Inventory: A Large-Scale Dataset for Monotonic Inventory Estimation in Reach and Frequency Advertising

R&F-Inventory:用于可达性与频率广告中单调库存估计的大型数据集

Yunshan Peng, Ji Wu, Wentao Bai, Yunke Bai, Jinan Pang, Wenzheng Shu, Yanxiang Zeng, Xialong Liu, Peng Jiang

机构 * Kuaishou Technology(快手科技)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出并发布了R&F合同库存估计数据集,用于研究结构约束学习、单调回归和R&F合同规划等问题,通过提供预算-性能曲线的完整数据支持系统研究。

Comments Accepted by SIGIR 2026; 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16472 2026-04-21 cs.GT cs.AI cs.MA econ.GN econ.TH q-fin.EC 57%

Training Language Models for Bilateral Trade with Private Information

利用私人信息训练语言模型进行双边贸易

Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

机构 * Department of Economics, Yale University(耶鲁大学经济学系) Yale School of Management, Yale University(耶鲁大学管理学院) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了在不完全信息下双边谈判中语言模型的能力,通过结构化谈判环境评估模型表现,发现有效策略通过连续报价实现价格歧视,训练实验表明监督微调和强化学习影响收益分配和交易完成率。

Comments 67 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16280 2026-04-21 cs.CR cs.AI cs.CY 57%

Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams

爱情、谎言与语言模型:探讨人工智能在情爱诱骗诈骗中的作用

Gilad Gressel, Rahul Pankajakshan, Shir Rozenfeld, Ling Li, Ivan Franceschini, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham, Amritapuri(网络安全系统与网络中心,阿米特大学,阿米塔普里) Ca’ Foscari University of Venice(威尼斯卡弗斯卡里大学) University of Melbourne(墨尔本大学) Ben Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨AI在情爱诱骗诈骗中的角色,通过访谈和实验发现LLM已被广泛用于诈骗,且安全过滤器无法有效阻止其扩张。

Journal ref USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01936 2026-04-21 cs.CL cs.CY 57%

The Thin Line Between Comprehension and Persuasion in LLMs

在语言模型中理解与说服之间的微妙界限

Adrian de Wynter, Tangming Yuan

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究通过人机辩论探讨LLM的说服能力是否反映真实理解,发现其能维持连贯对话但缺乏深层对话结构理解,揭示了部署在解释关键场景中的伦理与实践问题。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18351 2026-04-21 cs.MA cs.CY cs.DB 56%

Persona Alchemy: Designing, Evaluating, and Implementing Psychologically-Grounded LLM Agents for Diverse Stakeholder Representation

人格炼金术:为多样化利益相关者代表设计、评估和实现心理基础的LLM代理

Sola Kim, Dongjune Chang, Jieshu Wang

专题命中 Agent评测 :agent(abstract);agentic(comments)

AI总结 本文提出基于社会认知理论的LLM代理设计框架,通过四个个人因素、六个可量化构念和图数据库架构,提升LLM代理在多样化利益相关者代表中的心理一致性与可解释性。

Comments Accepted at ICLR 2026 Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17786 2026-04-21 q-bio.CB 50%

Spatial dynamic modelling to understand how dendritic cell clustering affects T cell activation

空间动态建模以理解树突状细胞聚集如何影响T细胞激活

Domenic P. J. Germano, Federico Frascoli, Robyn P. Araujo, Peter P. Lee, Peter S. Kim

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过空间动态模型研究树突状细胞聚集对T细胞激活的影响,提出一种新的概率代理模型,并推导出描述T细胞激活和运动的确定性偏微分方程,揭示了树突状细胞聚集促进T细胞激活的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20260 2026-04-21 cs.GT 50%

Fair and efficient allocation of indivisible items under category constraints

在类别约束下公平且高效的不可分割物品分配

Ayumi Igarashi, Frédéric Meunier

专题命中 Agent评测 :agent(abstract)

AI总结 研究在类别约束下公平分配不可分割物品的问题,提出在任意数量的代理人中总存在帕累托最优分配,通过重新分配最多min{k+1,n}(n-1)件物品可使每个代理人无怨恨,且在代理人数量固定时给出多项式时间算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17057 2026-04-21 cs.GT cs.MA 50%

From Necklaces to Coalitions: Fair and Self-Interested Distribution of Coalition Value Calculations

从项链到联盟:公平且利己的联盟价值计算分配

Terry R. Payne, Luke Riley

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出N-DCA算法,通过增量数组框架实现无需通信的公平联盟价值分配,满足均衡、无冗余、负载平衡和自利性等五项属性。

Comments 69 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2504.15304 2026-04-21 cs.AI cs.CY 79%

AI Agents and Hard Choices

AI代理与艰难抉择

Kangyu Wang

机构 * The University of Hong Kong(香港大学)

专题命中 其他Agent :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨AI代理在面对多目标不可比情况下的局限性,提出识别与解决难题,并提出集体解决方案以增强自主决策能力。

Comments 20 pages. v2: Substantially revised and rewritten; now typeset in LaTeX. Reflects the version presented at ACM FAccT 2026 (non-archival track). A revised version is under submission to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16521 2026-04-21 cs.CR cs.AI 79%

CAMP: Cumulative Agentic Masking and Pruning for Privacy Protection in Multi-Turn LLM Conversations

CAMP:累积代理掩码与剪枝用于多轮LLM对话中的隐私保护

Aman Panjwani

机构 * Independent Researcher(独立研究员)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI

AI总结 CAMP通过跨轮次隐私保护框架,解决多轮对话中累积PII暴露问题,通过会话级注册、共现图和CPE评分实现有效隐私保护,同时保持对话实用性。

Comments Submitted to arXiv. Finance-domain multi-turn demo evaluated on 4 synthetic scenarios. Independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17653 2026-04-21 cs.AI cs.DB 57%

PV-SQL: Synergizing Database Probing and Rule-based Verification for Text-to-SQL Agents

PV-SQL:数据库探查与基于规则的验证相结合用于文本到SQL代理

Yuan Tian, Tianyi Zhang

机构 * Purdue University(普渡大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 PV-SQL通过探查和验证组件提升文本到SQL系统的上下文理解能力,实验显示其在执行准确率和有效效率上优于现有基准,且消耗更少token。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17106 2026-04-21 cs.LG 57%

Live LTL Progress Tracking: Towards Task-Based Exploration

实时LTL进度追踪:面向基于任务的探索

Noel Brindise, Cedric Langbort, Melkior Ornik

机构 * Coordinated Science Laboratory, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室)

专题命中 其他Agent :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出实时LTL进度追踪框架,通过复杂多阶段任务跟踪自主体进展,利用LTL规范建立跟踪向量,为新的性能指标、多样化探索和奖励塑造提供工具。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏