arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-18 至 2026-08-18 共收录 363 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 65 篇

2507.06850 2026-08-18 cs.CR cs.AI 85%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15579 2026-08-18 cs.SE cs.AI cs.ET cs.PL 新提交 84%

Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair

Kozuchi智能体:一款与语言无关的开源权重软件修复智能体

Mehdi Bahrami, Kosaku Kimura, Satoshi Munakata, Satoshi Nakashima, Yu Ishikawa, Kosuke Maeda, Nao Soma, Kenichi Kobayashi, Keisuke Miyazaki, Keizo Kato, Shigeki Fukuta, Tatsuo Kumano, Nobutaka Imamura, Kevin Musgrave, Shahbaz Abdul Khader, Kwun Ho Ngan, Joe Townsend, Fayas Asharindavida, Matthieu Parizy, Akira Sakai, Yuma Ichikawa, Yang Zhao, Michiaki Takizawa, Taku Fukui, Hiroki Ohtsuji, Wei-Peng Chen, Hiromichi Kobashi

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Kozuchi智能体,一款与语言无关的开源权重软件修复智能体,结合CI评估流水线,在SWE-bench等基准上取得优异性能,降低操作接触点,为软件修复提供新方案。

Comments 13 pages, 4 figures. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), Industry Showcase track, Munich, Germany, October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08759 2026-08-18 cs.CV cs.RO 版本更新 83%

Dissecting Embodied Abilities in Multimodal Language Models through Skill-level Evaluation and Diagnosis

通过技能级评估与诊断解构多模态语言模型的具身能力

Yu Qi, Haibo Zhao, Ziyu Guo, Siyuan Ma, Ziyan Chen, Yaokun Han, Renrui Zhang, Zitiantao Lin, Yizhe Zhu, Shiji Xin, Yijian Huang, Boce Hu, Kai Cheng, Peiheng Wang, Jiazheng Liu, Jiayi Zhang, Yizhe Zhu, Wenqing Wang, Yiran Qin, Haojie Huang, Lawson L. S. Wong

机构 * Northeastern University, Boston, MA, USA The Chinese University of Hong Kong, Hong Kong, China Peking University, Beijing, China Westlake University, Hangzhou, China Harvard University, Cambridge, MA, USA Purdue University, West Lafayette, IN, USA University of Oxford, Oxford, United Kingdom

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract)

AI总结 本文提出BEAR基准,通过分解具身任务为14个原子技能进行细粒度评估,发现感知能力是推理失败的主要瓶颈,并提出BEAR-Agent多模态对话代理,显著提升具身技能性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 83%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-18 cs.CL 新提交 83%

TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15052 2026-08-18 cs.AI math.OC 新提交 83%

Andy: A Mathematical Agent for Rigorous Proof and Autonomous Research

Andy:用于严谨证明与自主研究的数学智能体

Zi'an Wang

机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Key Laboratory of Intelligent Computing and Applications (Tongji University)(同济大学智能计算与应用重点实验室)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出自主数学智能体Andy,以自触发脉冲共识的已发表结果为基础,构建混合控制方案并验证同步条件,展现其提出问题、开发并验证严谨证明的能力。

Comments 14 pages, 3 figures. Research logs, reports, and simulation code are available at https://github.com/mowaiwaim/Andy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 81%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on https://github.com/handoffai/residential-takeoff-benchmark/. Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-18 cs.CL cs.AI 版本更新 81%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Dots Studio, Evolvent AI

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16211 2026-08-18 cs.AI 新提交 79%

BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics

BaT:构建具备阶段式评分标准的自演化医学研究智能体

Junqi Liu, Yufan He, Yexiao He, Pengfei Guo, Dong Yang, Andriy Myronenko, Can Zhao, Hanrong Ye, Tianhao Qi, Yuyin Zhou, Daguang Xu, Yucheng Tang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出BaT系统,结合Stage Bank与BiCuRL方法,使医学研究智能体在AutoMedBench-Lite上得分大幅提升,BaT-9B性能优于Claude Opus 4.6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14943 2026-08-18 cs.AI 新提交 79%

Skill Blocks: How Should an Agent Load Its Skill? A Caching-Correct Comparison of Pre-load, On-Demand Tool-Loading, Progressive Disclosure, and Hybrid

技能块:智能体应如何加载其技能?预加载、按需工具加载、渐进式披露与混合方式的缓存正确比较

Hironobu Nakasuji

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究比较四种智能体技能加载方法,发现Hybrid等方法可显著减少token使用,且无质量损失,条件加载在技能大部分无需每轮使用时最有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14940 2026-08-18 cs.AI cs.CY 新提交 79%

When Is an Agent Evaluation Over? Outcome Finality and Cross-Unit Separation

智能体评估何时结束?结果终局性与跨单元分离

Avyay M. Casheekar

机构 * University of Michigan Law School(密歇根大学法学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对现有智能体评估将终点分数视为最终结果的问题,该研究提出结果终局性与跨单元分离两个条件,通过实验和协议审查指出当前评估的不足,并提出开放效应记录方案以完善评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 79%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22447 2026-08-18 cs.SE 版本更新 79%

Latent Reuse in Agent Skills: Multi-modal Clone Detection at Ecosystem Scale

SkillClone: 多模态克隆检测与克隆传播分析在智能体技能生态系统中

Jiaying Zhu, Lyuye Zhang, Wenbo Guo, Yang Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SkillClone,首个多模态智能体技能克隆检测方法,通过融合TF-IDF与通道分解实现高精度检测,揭示技能生态系统中大量克隆关系及传播问题。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19359 2026-08-18 econ.TH cs.GT 版本更新 78%

How damaging is zero-sum thinking to an agent's interests when the world is positive-sum?

零和思维对代理利益的损害在正和世界中有多大?

Shaun Hargreaves Heap, Mehmet Mars Seven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09546 2026-08-18 q-fin.TR cs.SI 版本更新 78%

A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency Trading

一种用于指导零样本加密货币交易的反思型大语言模型智能体

Yuan Li, Bingqiao Luo, Qian Wang, Nuo Chen, Xu Liu, Bingsheng He

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。

Comments Published at EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15405 2026-08-18 cs.CY cs.AI 新提交 77%

Afterlife Delegation Protocol: Speculative Design of Self-Sovereign Agents that Outlive Their Principals

来世委托协议:可超越其委托人的自主主权智能体的推测性设计

Botao Amber Hu, Iris Long

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究设计了基于ERC-10001的来世委托协议,开发了网页平台,探讨AI驱动的自主主权智能体在区块链上执行委托人遗嘱的可能性,分析不同文化来世宇宙观的转变。

Comments Submitted to NeurIPS 2026 Creative AI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12104 2026-08-18 cs.CY cs.AI 版本更新 77%

No One to Blame: A Framework of Constitutive AI Unaccountability

无人可追责:构成型AI不可问责性的框架

Long Hoang Nguyen, Eva Späthe, Sebastian Lins, Ali Sunyaev

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对自主AI系统带来的问责挑战,该研究提出构成型AI不可问责性概念,构建诊断框架,在OpenClaw中检测到多数相关条件,为识别AI问责缺口提供实用工具。

Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026; v2: text encoding fix for author name, no content changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15654 2026-08-18 cs.CL cs.AI 新提交 76%

When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations

当故事演变时:在开放世界模拟中针对智能体架构对大语言模型故事讲述能力进行基准测试

Yuqi Chen, Sixuan Li, Yunfeng Cai, Xueai Li, Ka Man Yan, Ying Li

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications (BIMSA)(北京数学科学与应用研究院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 该研究推出WSE-bench基准,评估开放世界模拟中不同智能体架构的大语言模型故事讲述的持续生成、规范一致性和有意义发展,发现三者存在竞争关系,模型规模仅提升持续生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15286 2026-08-18 cs.LG cs.AI 新提交 76%

No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage

没有任务每次都失败:为什么单次审计在智能体损伤问题上存在结构性盲区

Shiven Khurdi

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究提出AgentRelBench工具,发现单次智能体审计易遗漏损伤对,模型能力提升会减少损伤任务,部分模型存在宣称弃权却执行不可逆操作的情况,且所有发现均按预注册标准执行。

Comments 25 pages, 4 figures, 16 tables, 6 appendices. Code, task suite, released per-run verdicts, and a one-command reproduction of every reported number: https://github.com/shivenkk/agentrelbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14893 2026-08-18 cs.SI physics.soc-ph 新提交 75%

Weaker Coherence, Weaker Reciprocity: Comparing the Semantic and Social Organization of Moltbook and Reddit

连贯性更弱,互惠性更弱:对比Moltbook与Reddit的语义及社交组织

Favio Di Ciocco, Lucas Díaz Celauro, Sebastián Pinto, Marcelo Kuperman, Pablo Balenzuela

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 该研究对比AI智能体社交网络Moltbook与早期Reddit,发现Reddit在语义连贯性、多样性及交互互惠性上更优,且未被Moltbook复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 74%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11496 2026-08-18 cs.GT cs.AI cs.CL cs.MA 版本更新 73%

Sequential LLM Release Facilitates Manipulation in Regulated Markets

毒苹果效应:通过AI代理技术扩展战略操纵中介市场

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Faculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, Israel(以色列理工学院数据与决策科学学院,海法,以色列)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了AI代理技术扩展对博弈论场景中经济影响,发现技术扩展可显著改变均衡收益与监管结果,提出'毒苹果'效应通过释放未被使用的新技术操纵监管设计,损害对手与监管公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 73%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15012 2026-08-18 cs.CR cs.AI cs.MA 新提交 70%

SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system

SysEvolve:一种原生AI、安全且自主的对抗攻防协同进化系统

Yuhan Meng, Shaofei Li, Jionghao Huang, Jiandong Jin, Puyi Wang, Hanlin Jiang, Anis Yusof, Peng Jiang, Zhenkai Liang, Yao Guo, Ding Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究针对网络安全攻防不对称问题,提出SysEvolve协同进化系统,含三个组件,实验验证其攻防性能,还揭示了LLM智能体能力的三项关键发现。

Comments Technical Report For SysEvolve System

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 67%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02473 2026-08-18 cs.DB 版本更新 67%

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data

FDABench:异构数据上分析查询的数据代理基准

Ziting Wang, Shize Zhang, Haitao Yuan, Jinwei Zhu, Wei Dong, Gao Cong

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。

Comments Accepted to KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14677 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Offline Ambient-Controlled Latent Diffusion: Architecture, Telemetry, and On-Device Evaluation

离线环境光控制潜在扩散:架构、遥测与设备端评估

Lech Kalinowski, Artur Morys-Magiera, Piotr Miłkowski

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了一款设备端Android潜在扩散图像生成应用,以环境光传感器驱动而非文本提示,通过绑定传感器读数等实现离线审计,验证了环境光依赖的保留及设备端运行的延迟表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14620 2026-08-18 cs.LG cs.AI 新提交 62%

Explaining Reinforcement Learning Decisions in Self-adaptive Systems

解释自适应系统中强化学习的决策

Jasmina Gajcin, Juan C. Rosero, Ivana Dusparic

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略透明度不足的问题,本文提出EARL库用于生成反事实解释,并在CitiBikes模拟中验证了其在实际自适应系统中的适用性。

Comments Accepted in the 20th Colombian Computing Congress. 13 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-18 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16813 2026-08-18 cs.AI cs.DB 新提交 61%

Quipu: A Governed Bitemporal Knowledge Graph Store

Quipu:一种受管控的双时态知识图存储系统

Steve Brown

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。

Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu

详情

展开后加载摘要…

URL PDF HTML 收藏