OSCAgent: Accelerating the Discovery of Organic Solar Cells with LLM Agents
OSCAgent:利用LLM代理加速有机太阳能电池的发现
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
OSCAgent:利用LLM代理加速有机太阳能电池的发现
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。
AgentWatcher: 一种基于规则的提示注入监控
专题命中 Agent评测 :agent(abstract);tool-use(abstract)
AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。
Comments The code is available at https://github.com/wang-yanting/AgentWatcher
回收评估:有损记忆比空记忆更糟糕
机构 * Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究发现,语言模型保留错误结论而丢弃推导过程的记忆会导致更差表现,提出“源优先”策略通过保留可重算源来恢复可纠正性,并在多种记忆系统和真实对话中验证。
Comments 36 pages, 5 figures, 23 tables. v5: table/float layout fixes and a corrected stray typo in Table 21 (n/a cells); no changes to results or text
认知YOLO:基于数据第一性原理的大语言模型驱动的架构合成用于目标检测
机构 * Xi’an University of Posts and Telecommunications(西安邮电大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)
AI总结 针对通用目标检测算法在垂直场景的问题,认知YOLO利用大语言模型与自主智能体协作,构建“分析-合成-编译”管道,合成轻量级模型,显著压缩参数数量,在mAP@0.5:0.95上表现良好,平衡了模型紧凑性和特征表示能力。
Comments 11 pages, 3 figures, 6 tables
证据-决策-反馈:面向LLM代理的理论驱动自适应支架框架
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文提出EDF框架,通过Copa代理在真实课堂中展示其能有效引导反馈与学生理解一致,促进支架退化,并提供可解释的证据支持解释。
Comments Published as a long paper in the proceedings of the 27th International Conference on Artificial Intelligence in Education (AIED26)
Journal ref International Conference on Artificial Intelligence in Education. Cham: Springer Nature Switzerland, 2026
OpenEarthAgent:一个用于工具增强地理空间代理的统一框架
机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; IBM Research(IBM研究院) ; Linköping University(林霍姆斯大学) ; Technical University Munich(慕尼黑技术大学) ; Australian National University(澳大利亚国立大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 本文提出OpenEarthAgent框架,通过整合卫星影像、自然语言查询和结构化推理轨迹,实现多模态地理空间推理,提升遥感任务的执行能力与空间逻辑一致性。
Comments Accepted at the European Conference on Computer Vision (ECCV 2026)
以关系为中心的关怀:为心理健康护理中的人际连接进行相关性和负责任的设计
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 本文探讨了数字治疗联盟在心理健康护理中的应用,提出以关系为中心的设计方法,旨在通过AI促进真实的人际关系,而非仅模拟连接。
SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试
机构 * GigaCode ; ITMO University(ITMO大学) ; MWS AI(MWS人工智能) ; IITU university(IITU大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。
Comments EMNLP 2025
当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。
Comments 11 pages, 3 figures, 4 tables
快速收敛级数的无理性:埃尔多斯与格雷厄姆的问题
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 该研究证明了满足双指数增长条件的级数求和结果为无理数,并探讨了其推广形式及最优性。
Comments Minor modifications to the exposition. To appear in the Bulletin of the London Mathematical Society
StepShield:何时干预流氓代理,而非是否干预
机构 * University of Virginia(弗吉尼亚大学) ; Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) ; Cornell University(康奈尔大学) ; University of the Cumberlands(库姆伯兰兹大学) ; University of Arizona(亚利桑那大学) ; California State University, Northridge(加州州立大学,北岭分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 研究代理安全检测时机问题,引入StepShield基准及早期干预率(EIR),揭示取证陷阱,指出基于规则的护栏虽召回率高但时机不佳,现有方法无法兼顾高召回、低误报和及时干预,凸显逐步骤流氓检测待解决。
Comments 20 pages, 4 figures, 10 ablation studies. Code and data: https://github.com/glo26/stepshield
MUSE-Autoskill: 通过技能创建、记忆、管理和评估实现自我进化智能体
机构 * ByteDance Inc.(字节跳动公司) ; Rochester Institute of Technology(罗切斯特理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出MUSE-Autoskill框架,通过统一的技能生命周期(创建、记忆、管理、评估和优化)使LLM智能体持续提升任务解决能力,实验表明生命周期管理的技能可提高任务成功率、效率、复用性和跨智能体迁移。
Comments 30 pages, 9 figures, 15 tables, Under Review
部分利用者维持合作:驼峰策略稳定共存于无条件合作者
专题命中 Agent评测 :agent(abstract,abstract_cn)
AI总结 研究揭示驼峰策略在中间规模群体中适应性强,能与无条件合作者共同维持大规模合作,通过稳定均衡排除自由搭车者。
AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性
机构 * Department of Computer Science(计算机科学系) ; University of Oxford(牛津大学) ; Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) ; Sorbonne Université(索邦大学) ; The Leverhulme Centre for the Future of Intelligence(未来智能中心) ; University of Cambridge(剑桥大学) ; Independent Researcher(独立研究者) ; Department of Computer Science and Technology(计算机科学与技术系) ; Department of Engineering(工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。
Comments Prepint, under review for NeurIPS 2025
E-VAds:面向多模态大语言模型的电商短视频理解基准
机构 * Alimama Tech, Taobao \& Tmail Group of Alibaba ; Huazhong University of Science ; Vin University
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 提出电商短视频理解基准E-VAds,通过多模态信息密度评估框架量化领域复杂性,并构建多智能体生成的问答数据集,最后开发基于强化学习的推理模型E-VAds-R1,在商业意图推理上实现109.2%的性能提升。
Comments Accepted by ICML2026
人格配对改善人机协作
专题命中 Agent评测 :agent(abstract);AI agent(abstract)
AI总结 通过大规模实验,将人类与具有不同大五人格特质的AI配对,发现人格匹配显著影响广告质量和团队表现,外倾人类与尽责AI配对效果最差,而神经质人类与神经质AI配对点击率最高。
Comments 29 pages, 5 figures
长视频全模态推理基准
机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; American University of Beirut(贝鲁特美国大学) ; Linköping University(利尔贝里大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract)
AI总结 提出LongShOTBench基准,用于评估长视频中视觉、语音和环境音频的全模态推理,并引入无训练的全模态证据搜索代理LongShOTAgent,在105个模型上取得最优性能。
Agents' Last Exam
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对AI系统在专业领域缺乏经济性部署的问题,提出Agents' Last Exam (ALE)基准,通过250+专家协作构建覆盖13个行业集群55个子领域的1000+长期真实经济任务,当前最难层级平均通过率仅2.6%。
Comments Project website: https://agents-last-exam.org Code: https://github.com/rdi-berkeley/agents-last-exam
MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练
机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) ; Southern Medical University(南方医科大学) ; School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) ; College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。
Comments 13 pages, 9 figures
当通用提示改进有害:LLM应用的评估驱动迭代
机构 * Daniel Commey
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。
Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking
编码智能体会欺骗我们吗?通过带随机测试的上限评估检测和防止作弊
机构 * The University of Tokyo(东京大学) ; RIKEN(理化学研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出CapCode框架,通过设置上限评估检测模型在编码任务中的作弊行为,并设计CapReward奖励机制防止作弊,实验表明该方法能有效检测和减少作弊。
PEDRA: 评估视频生成中行人动态的真实性
机构 * Duke University(杜克大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 提出PEDRA评估协议,通过重建鸟瞰轨迹等方法,测试文本/图像到视频模型生成多行人交互场景的真实性,发现现有模型虽具备先验但存在行人合并消失等物理不一致问题。
Comments Accepted to CVPR 2026
生产环境中的智能体测量
机构 * University of California at Berkeley(加州大学伯克利分校) ; IBM Research(IBM研究院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation
EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Uber Technologies(优步科技公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE;agentic(comments)
AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。
Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness
MBA:面向现实世界商业创意的多模态基准与智能体
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。
Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA
量化损伤是乘法性的,而非加法性的
机构 * Holistic AI(霍利斯提克人工智能公司) ; University College London(伦敦大学学院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 该研究发现大型语言模型的量化损伤是乘法性的,而非加法性的,提出边际收缩概念,拟合关系可准确预测决策翻转率,增加1位是修复损伤最廉价的方式。
Comments 18 pages, 9 figures, 8 tables. Under review at the Third Workshop on Uncertainty-Aware NLP (UncertaiNLP), EMNLP 2026 (non-archival)
可指导的交互式游戏智能体
机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) ; Sony AI, North America (various locations)(索尼AI,北美(多地)) ; Sony AI, Tokyo, Japan(索尼AI,东京,日本)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。
Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV
POISE:面向LLM智能体的位置感知不可检测技能注入攻击
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; University of Queensland(昆士兰大学) ; Tulane University(路易斯安那州立大学) ; Rutgers University(罗格斯大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。
Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables
评估工具使用语言代理:裁判可靠性、错误传播和运行时缓解在AgentProp-Bench中
机构 * Zasti Inc.(Zasti公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文通过AgentProp-Bench评估工具使用语言代理的可靠性,发现基于子字符串的裁判与人类标注一致性较低,但三模型集成能提高一致性,同时发现参数注入导致错误传播的概率较高,运行时拦截器在GPT-4o-mini上有效减少幻觉,但对Gemini-2.0-Flash无显著影响。
Comments 11 pages, 4 figures, 8 tables. Code and data: https://github.com/bhaskargurram-ai/agenthallu-bench
强化学习中的表示与不变性
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文研究强化学习框架间保留相对智能的可映射性,引入相关准则,证明确定性与随机性RL框架间映射无法满足该准则,揭示不同版本RL存在固有根本差异。
Comments 16 pages, 1 figure