arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-16 至 2026-04-16 共收录 159 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 11 篇

2508.06433 2026-04-16 cs.CL cs.AI cs.LG cs.MA 82%

Memp: Exploring Agent Procedural Memory

Memp:探索代理程序记忆

Runnan Fang, Yuan Liang, Xiaobin Wang, Jialong Wu, Shuofei Qiao, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10696 2026-04-16 cs.AI cs.CL 81%

Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution

记住我,精进我:一种面向经验驱动代理进化的动态过程记忆框架

Zouying Cao, Jiaji Deng, Li Yu, Weikang Zhou, Zhaoyang Liu, Bolin Ding, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReMe框架,通过多维蒸馏、情境适应重用和基于效用的精炼机制,解决传统静态记忆存储的不足,实验证明其在BFCL-V3和AppWorld上达到新状态,展示了自进化记忆在终身学习中的高效性。

Comments 20 pages, 10 figures, 15 tables, ACL'26-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13824 2026-04-16 cs.LG 70%

Beyond State Consistency: Behavior Consistency in Text-Based World Models

超越状态一致性:文本基础世界模型中的行为一致性

Youling Huang, Guanqiao Chen, Junchi Yao, Lu Wang, Fangkai Yang, Chao Du, ChenZhuo Zhao, Pu Zhao, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Dalian University of Technology(大连理工大学) MBZUAI Peking University(北京大学) Microsoft(微软)

专题命中 记忆与上下文管理 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出行为一致性训练方法,通过改进世界模型与真实环境的功能一致性,提升长期对齐效果,实验显示在WebShop和TextWorld中表现优异,同时保持单步预测质量。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13777 2026-04-16 cs.CL cs.AI 62%

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

从锚点到监督:基于记忆图的无语料去学习框架

Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai University of Electric Power(上海电力大学) School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MAGE框架,通过用户提供的轻量锚点识别目标实体,利用记忆图恢复相关记忆并生成监督,实现无语料的去学习,有效提升隐私保护和审计能力。

Comments 15 pages, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13890 2026-04-16 physics.soc-ph cs.LG econ.EM econ.TH stat.ML 57%

Sandpile Economics: Theory, Identification, and Evidence

沙堆经济学:理论、识别与证据

Diego Vallarino

机构 * Counselor to the Board of Directors, Inter-American Development Bank and IDB Invest(美洲开发银行董事会顾问,国际开发银行(IDB Invest))

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出沙堆经济学理论,揭示生产网络失衡导致宏观经济不稳定,通过曲率分析证明其非平稳性,并通过实证数据验证曲率对经济韧性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13371 2026-04-16 cs.CL 57%

Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints

大语言模型在有限离散状态空间问题中复杂性诱导限制的实证证据

Md. Fahad Ullah Utsho, Mohd. Ruhul Ameen, Akif Islam, Md. Golam Rashed, Dipankar Das

机构 * Department of Information and Communication Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学信息与通信工程系,孟加拉国) College of Engineering and Computer Sciences, Marshall University, Huntington, WV, USA(马歇尔大学工程与计算机科学学院,美国,亨廷顿,西弗吉尼亚) Department of Computer Science and Engineering, University of Rajshahi, Bangladesh(拉贾沙希大学计算机科学与工程系,孟加拉国)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.CL

AI总结 本文通过构建九个经典推理任务,系统评估大推理模型在逐渐增加的复杂性下的鲁棒性,发现模型在低复杂度时表现良好,但超过特定阈值后显著退化,提出推理崩溃现象。

Comments 45 pages, 36 figures, 7 tables, Journal Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03280 2026-04-16 cs.LG 57%

MDPs with a State Sensing Cost

具有状态感知成本的MDP

Vansh Kapoor, Jayakrishnan Nair

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文研究了在序列决策问题中,状态跟踪的成本问题,提出了一种考虑感知成本的MDP模型,并设计了高效算法SPI以近似最优策略。

Comments Accepted at AISTATS 2026

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05294 2026-04-16 math.OC 50%

Mean Field Games and Control on Large Expander Graphs

均场博弈与在大规模扩张图上的控制

Tao Zhang, Peter E. Caines

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了稀疏网络上的均场博弈与控制,在大规模扩张图中,利用graphexon框架分析极限拓扑,证明了有限图上的经验graphexon测度序列弱收敛到连续状态空间上的极限graphexon测度,并建立了离散平均算子序列强收敛到连续算子的性质,从而构建了线性二次均场博弈模型。

Comments The short version of this manuscript has been submitted to the 65th IEEE Conference on Decision and Control (CDC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13633 2026-04-16 cs.CV cs.RO 50%

ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation

ESCAPE:基于长周期移动操作的片段空间记忆与自适应执行策略

Jingjing Qian, Zeyuan He, Chen Shi, Lei Xiao, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) LiAuto Inc.(LiAuto公司)

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文提出ESCAPE框架,通过融合感知-地面-执行流程,解决长周期移动操作中的鲁棒性、空间一致性及执行灵活性问题,在ALFRED基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16715 2026-04-16 physics.soc-ph q-bio.PE 50%

When to Boost: How Dose Timing Determines the Epidemic Threshold

何时加强:剂量时间如何决定流行病阈值

Alessandro Celestini, Francesca Colaiori, Stefano Guarino, Enrico Mastrostefano, Francesca Pelusi, Lena Rebecca Zastrow

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究探讨了疫苗剂量时间对流行病阈值的影响,通过优先分配首剂和二剂可改变流行病状态,提出优化的优先策略和间隔方案。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 28 篇

2604.13452 2026-04-16 cs.CL 87%

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12213 2026-04-16 cs.AI cs.MA cs.SE 86%

Modality-Native Routing in Agent-to-Agent Networks: A Multimodal A2A Protocol Extension

代理到代理网络中的模态本原路由:一种多模态A2A协议扩展

Vasundra Srinivasan

机构 * AI Architect, Author—Data Engineering for Multimodal AI (O’Reilly)(人工智能架构师,作者—多模态AI的数据工程(O’Reilly)) Stanford School of Engineering (April 2026)(斯坦福大学工程学院(2026年4月))

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MMA2A架构,通过多模态本原路由提升任务准确率,其在跨模态任务中表现优于文本瓶颈基线,尤其在视觉依赖任务中效果显著,但增加了1.8倍的延迟。

Comments 14 pages, 4 figures (TikZ). PDFLaTeX. Supplementary code and experiment artifacts: https://github.com/vasundras/modality-native-routing-a2a-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12102 2026-04-16 cs.AI cs.CV cs.LG 84%

Spatial Atlas: Compute-Grounded Reasoning for Spatial-Aware Research Agent Benchmarks

空间图谱:面向空间感知研究代理的计算导向推理

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出计算导向推理(CGR)框架,通过确定性计算解决子问题后再由语言模型生成答案,构建了空间图谱系统,用于评估FieldWorkArena和MLE-Bench两个挑战性基准,通过结构化空间场景图引擎和熵引导动作选择提升空间推理的准确性和可解释性。

Comments 11 pages. Code: https://github.com/arunshar/spatial-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 82%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 Agent评测 :agentic(title,abstract);planning(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13954 2026-04-16 cs.LG cs.AI 81%

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

HINTBench:地平线代理内在非攻击轨迹基准

Jiacheng Wang, Jinchang Hou, Fabian Wang, Ping Jian, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究内在风险审计,提出HINTBench基准,包含629条轨迹,评估风险检测、风险步定位和内在故障识别,发现强LLM在风险步定位上表现差,揭示内在风险审计的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18436 2026-04-16 cs.OS cs.AI cs.FL cs.SE 81%

VeruSAGE: A Study of Agent-Based Verification for Rust Systems

VeruSAGE:Rust系统代理验证的研究

Chenyuan Yang, Natalie Neamtu, Chris Hawblitzel, Jacob R. Lorch, Shan Lu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM在Rust系统验证中的能力,提出VeruSAGE-Bench基准测试集,并设计不同代理系统以匹配不同LLM的特性,结果显示最佳组合能完成超过80%的验证任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13047 2026-04-16 cs.SI cs.AI cs.CY 79%

Integration of Deep Reinforcement Learning and Agent-based Simulation to Explore Strategies Counteracting Information Disorder

深度强化学习与基于代理的仿真整合以探索对抗信息紊乱的策略

Luigi Lomasto, Andrea Camoia, Alfonso Guarino, Nicola Lettieri, Delfina Malandrino, Rocco Zaccagnino

机构 * Department of Computer Science, University of Salerno(萨勒诺大学计算机科学系) National Institute for Public Policy Analysis (INAPP)(公共政策分析国家研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文整合深度强化学习与基于代理的仿真,研究如何通过科学模拟复杂假新闻动态及遏制策略,以对抗信息紊乱现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13418 2026-04-16 cs.CL cs.AI cs.CV 79%

MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments

MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境

Han Wang, David Wan, Hyunji Lee, Thinh Pham, Mikaela Cankosyan, Weiyuan Chen, Elias Stengel-Eskin, Tu Vu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。

Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 78%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 Agent评测 :agent(title,abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13552 2026-04-16 cs.CL cs.AI 73%

Training-Free Test-Time Contrastive Learning for Large Language Models

无需训练的测试时对比学习用于大语言模型

Kaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出无需训练的测试时对比学习(TF-TTCL),通过动态'探索-反思-引导'循环提升冻结大语言模型的在线推理能力,优于零样本基线和代表性测试时适应方法。

Comments Accepted by Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13686 2026-04-16 cs.CL cs.AI cs.DB 62%

IndicDB -- Benchmarking Multilingual Text-to-SQL Capabilities in Indian Languages

IndicDB -- 评估印度语言多语言文本到SQL能力的基准测试

Aviral Dawar, Roshan Karanth, Vikram Goyal, Dhruv Kumar

机构 * National Data and Analytics Platform(国家数据与分析平台) India Data Portal(印度数据门户) NDAP(国家数据与分析平台) ICRISAT(国际作物研究所) IHDS(印度家庭与育儿调查)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 IndicDB是一个多语言文本到SQL基准测试,用于评估跨语言语义解析能力,包含20个数据库和237张表,通过迭代三代理框架生成15617个任务,揭示了印度语言在SQL解析中的性能差距。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13059 2026-04-16 cs.CL cs.AI 62%

A Proactive EMR Assistant for Doctor-Patient Dialogue: Streaming ASR, Belief Stabilization, and Preliminary Controlled Evaluation

一种主动的电子病历助手:面向医生-患者对话的流式语音识别、信念稳定化和初步受控评估

Zhenhai Pan, Yan Liu, Jia You

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种主动电子病历助手,通过流式语音识别、标点恢复、状态提取、信念稳定化、对象化检索、行动规划和可回放报告生成,提升医生-患者对话中的病历记录效率与前瞻性支持。

Comments 10 pages, 1 figure, 6 tables. Companion systems manuscript. Preliminary controlled evaluation in a simulated pilot setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 57%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13381 2026-04-16 cs.HC cs.AI 57%

Young people's perceptions and recommendations for conversational generative artificial intelligence in youth mental health

青少年对对话生成人工智能在青少年心理健康中的认知与建议

Adam Poulsen, Ian B. Hickie, Carla Gorban, Zsofi de Haan, William Capon, Ebenezer Eyeson-Annan, Jalal Radwan, Elizabeth M. Scott, Frank Iorfino, Haley M. LaMonica

机构 * Brain and Mind Centre, The University of Sydney(悉尼大学脑与心灵中心) Uncapt

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨青少年对生成式AI聊天机器人在心理健康中的看法及改进建议,揭示其态度与需求,为服务整合提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 57%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 57%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13049 2026-04-16 cs.SI cs.AI 57%

Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems

劫持在线评论:流行度偏向评分系统中的稀疏操控与行为缓冲

Itsuki Fujisaki, Kunhao Yang

机构 * College of Knowledge and Library Science, School of Informatics, Tsukuba University(知识与图书馆科学学院,信息学院,筑波大学) College of Engineering, Shibaura Institute of Technology(工学院,柏市技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨恶意评论者如何利用流行度偏向的评分动态,并分析用户行为异质性对损害的缓解作用,发现稀疏攻击比广泛攻击更具破坏性,且用户异质性能部分缓冲评分扭曲。

Comments 18page, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08230 2026-04-16 cs.AI 57%

Empowerment Gain and Causal Model Construction: Children and adults are sensitive to controllability and variability in their causal interventions

赋能增益与因果模型构建:儿童和成人对干预可控性和变异性敏感

Eunice Yiu, Kelsey Allen, Shiry Ginosar, Alison Gopnik

机构 * Department of Psychology, University of California, Berkeley(加州大学伯克利分校心理学系) Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了赋能增益在因果学习中的作用,通过实验验证儿童和成人如何利用赋能信号推断因果关系并设计干预措施。

Comments Accepted to Philosophical Transactions A, Special issue: World models, AGI, and the hard problems of life-mind continuity. Expected publication in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 57%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 57%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏