arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-23 至 2026-03-23 共收录 104 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 4 篇

2302.13426 2026-03-23 econ.GN q-fin.EC 50%

Arrow-Debreu Meets Kyle: Price Discovery Across Derivatives

阿罗-德布雷-凯尔模型:跨衍生品的价格发现

Christian Keller, Michael C. Tseng

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了在信息知情者拥有状态概率私有信息并交易状态依赖证券的模型中价格发现。该模型结合了阿罗-德布雷和凯尔的关键要素,当证券为期权时,知情者拥有标的资产收益分布的任意信息并交易期权组合。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 13 篇

2603.19583 2026-03-23 cs.SE cs.AI 86%

Skilled AI Agents for Embedded and IoT Systems Development

嵌入式与物联网系统开发中的技能型AI代理

Yiming Li, Yuhan Cheng, Mingchen Ma, Yihang Zou, Ningyuan Yang, Wei Cheng, Hai "Helen" Li, Yiran Chen, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出技能型AI代理框架与IoT-SkillsBench基准,通过实测验证,展示结构化专家知识在嵌入式编程中的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19993 2026-03-23 cs.CV 78%

MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI

MedSPOT: 一种面向临床GUI的流程感知序列接地基准

Rozain Shakeel, Abdul Rahman Mohammad Ali, Muneeb Mushtaq, Tausifa Jan Saleem, Tajamul Ashraf

机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) e\& Group, UAE(e&集团,阿联酋) Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)

专题命中 Agent评测 :workflow(title,abstract)

AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。

Comments Project page: https://rozainmalik.github.io/MedSPOT_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17417 2026-03-23 cs.CY cs.MA 78%

Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)

你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack

Zichen Tang, Zirui Zhang, Qian Wang, Zhenheng Tang, Bo Li, Xiaowen Chu

专题命中 Agent评测 :agent(title);agentic(abstract)

AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 75%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20101 2026-03-23 cs.AI 70%

Pitfalls in Evaluating Interpretability Agents

评估可解释性代理中的陷阱

Tal Haklay, Nikhil Prakash, Sana Pandey, Antonio Torralba, Aaron Mueller, Jacob Andreas, Tamar Rott Shaham, Yonatan Belinkov

机构 * Kempner Institute at Harvard University(哈佛大学 Kempner 机构) Northeastern University(东北大学) Boston University(波士顿大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了自动化电路分析中可解释性代理的评估挑战,提出基于模型组件功能互换性的无监督内在评估方法,揭示了复制评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19668 2026-03-23 cs.CL 70%

Structured Prompting for Arabic Essay Proficiency: A Trait-Centric Evaluation Approach

结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法

Salim Al Mandhari, Hieu Pham Dinh, Mo El-Haj, Paul Rayson

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。

Comments 13 pages

Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05710 2026-03-23 q-fin.CP cs.AI 70%

FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation

FinReflectKG -- EvalBench:基于多维评估的金融知识图谱基准测试

Fabrizio Dimino, Abhinav Arun, Bhaskarjit Sarmah, Stefano Pasquali

机构 * New York, US(美国纽约) Gurugram, India(印度古尔冈)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出FinReflectKG-EvalBench,通过多维评估框架对金融知识图谱提取进行基准测试,证明基于反思的提取方法在全面性、精度和相关性上表现最佳,同时验证LLM作为评判者在成本效率和结构化错误分析中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19988 2026-03-23 econ.GN cs.GT q-fin.EC 67%

Market Power and Platform Design in Decentralized Electricity Trading

电力市场力量与去中心化电力交易平台设计

Nicolas Eschenbaum, Nicolas Greber

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文研究平台设计如何影响去中心化电力交易中的战略行为,通过动态博弈模型分析了prosumers在平台中的行为机制,发现平台设计对市场力量和存储利用有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 62%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19461 2026-03-23 cs.AI 57%

Hyperagents

超智能体

Jenny Zhang, Bingchen Zhao, Wannan Yang, Jakob Foerster, Jeff Clune, Minqi Jiang, Sam Devlin, Tatiana Shavrina

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) University of Edinburgh(爱丁堡大学) New York University(纽约大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) FAIR at Meta(Meta 的 FAIR 部门) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出超智能体,通过整合任务智能体和元智能体,实现自我改进。DGM-H在多个领域表现出色,持续改进搜索方法。

Comments Code at https://github.com/facebookresearch/Hyperagents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09097 2026-03-23 math.OC 50%

Adaptive Polyak Stepsize with Level-value Adjustment for Distributed Optimization

自适应Polyak步长与级别-值调整的分布式优化

Chen Ouyang, Yongyang Xiong, Jinming Xu, Keyou You, Yang Shi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出DPS-LA算法,通过每个节点解决高效的线性可行性问题,避免依赖全局最优值,实现线性加速收敛。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19414 2026-03-23 q-fin.RM 50%

Dynamic Pareto Optima in Multi-Period Pure-Exchange Economies

多期纯交换经济中的动态帕累托最优

Brandon Tam, Mario Ghossoub, Silvana M. Pesenti

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了多期纯交换经济中动态帕累托最优分配过程的构造方法,基于时间一致动态风险度量,提出递归构建方法并推导了共变量改进定理。

Comments 42 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20063 2026-03-23 q-fin.MF q-fin.PM 50%

Optimal consumption under loss-averse multiplicative habit-formation preferences

在损失厌恶的乘法习惯形成偏好下最优消费

Bahman Angoshtari, Xiang Yu, Fengyi Yuan

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了损失厌恶的乘法习惯形成偏好及其对应的无限时间 horizon 内最优投资与消费策略。通过考虑S型效用函数的凹包络及其关联的对偶价值函数,分析了凹化问题的HJB方程,并通过相关非线性自由边界问题获得反馈形式的最优消费与投资策略。

Comments 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏