Toward Trustworthy Large Language Model Agents in Healthcare
迈向医疗保健领域值得信赖的大语言模型智能体
专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI
AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
迈向医疗保健领域值得信赖的大语言模型智能体
专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI
AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。
APeB:大型语言模型智能体个性化能力基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。
Comments NA
用于人类与人工智能协作决策的以人类为中心的反思架构
机构 * University of Piraeus(比雷埃夫斯大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究人类与人工智能协作决策问题,将其建模为随机博弈,提出以人类为中心的反思架构,整合人类校准模型与强化学习智能体,提升决策有效性并给出高质量建议。
DramaDirector: 几何引导的短剧生成
机构 * South China University of Technology(华南理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。
Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector
MMBench-Live:一个持续演进的多模态模型基准
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; PRIS-CV
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。
AGI Maze:作为世界建模智能体的基准框架
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。
超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。
Comments Update URLs
大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题
机构 * Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。
AutoTrainess: 教语言模型自主改进语言模型
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL
AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。
OpenLife:迈向基于自主LLM代理的开放世界人工生命
机构 * Alternative Machine Inc.(Alternative Machine公司) ; Their Inc.(Their公司) ; Atomi University(迹见学园女子大学) ; The University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 提出开放世界人工生命范式,通过将无状态LLM与异步进程(记忆、感知、评估、预算代谢)结合,使代理在开放世界中涌现自发活动、个体化、社会结构和自创收入。
Comments Accepted at ALIFE 2026
基于自主评估的计算机使用智能体强化学习
机构 * Ukrainian Catholic University(乌克兰天主教大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 提出利用视觉语言模型自主评估任务完成度作为奖励信号,并引入噪声校正方法,在多个桌面环境上提升计算机使用智能体的成功率。
Comments Accepted to the 4th International Workshop on Generalizing from Limited Resources in the Open World (GLOW @ IJCAI 2026)
当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复
机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) ; Kobe University(北九州市立大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。
Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680
CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。
Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap
OpenBioRQ: 未解决的生物医学研究问题
机构 * Upstage AI
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出OpenBioRQ基准,包含12,553个无答案的未解决生物医学问题,用于评估智能体在检索、忠实性和工具使用方面的能力,发现当前模型存在工具使用崩溃问题。
主体之道:自生目标人工智能、嵌入主体与自我的消解
机构 * Aritra Sarkar
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文探讨自生目标AI中主体生成自身目标的问题,通过内在动机、资源驱动先验、因果干预学习、稳态和嵌入性等概念,揭示嵌入性虽必要但不充分,并指出核心难题在于主体如何生成并相对化自我,最后提出量子表述、哲学解读和基于LLM的具体实现。
大型语言模型黑盒不确定性估计方法的系统评估
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 系统评估了24种黑盒不确定性估计方法在4个模型和4个数据集上的表现,发现无单一方法普遍最优,但基于答案空间推理和比较的方法通常有效,混合方法在多数条件下表现良好。
超越静态排行榜:LLM智能体评估的预测有效性
机构 * IBM
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。
Comments 17 pages, 2 tables, 5 figures
超越单语言深度研究:用跨语言 BrowseComp-Plus 评估智能体和检索器
机构 * Waseda University(早稻田大学) ; Northwestern University(西北大学) ; RIKEN AIP(理化学研究所革新智能研究中心) ; Snowflake Inc.(Snowflake公司) ; University of Utah(犹他大学) ; Duke-NUS Medical School(杜克-新加坡国立大学医学院) ; The University of Tokyo(东京大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 提出跨语言基准 XBCP,评估深度研究智能体在证据语言与查询不同时的表现,发现检索和智能体端均存在显著性能下降。
Comments Preprint
SEAGym: 自我进化LLM智能体的评估环境
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Beijing National Research Center for Information Science and Technology (BNRist), Tsinghua University(北京信息科学与技术国家研究中心(BNRist),清华大学)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 提出SEAGym评估环境,通过训练、验证、测试、重放和成本记录多维度衡量智能体框架更新,揭示更新是否带来可复用改进、过拟合、成本增加或旧行为退化。
MagicSim: 可执行具身交互的统一基础设施
机构 * Northwestern University(西北大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ShanghaiTech University(上海科技大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。
现实场景中工具使用LLM代理的数据泄露风险评估
机构 * Korea AI Safety Institute(韩国人工智能安全研究所) ; Singapore AI Safety Institute(新加坡人工智能安全研究所)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。
ARB4WM:连续控制中世界模型的对抗鲁棒性基准
机构 * College of Computer Science, National University of Defense Technology(国防科技大学计算机学院) ; College of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of New Networks, Peng Cheng Laboratory(鹏城实验室新型网络部) ; National Key Laboratory of Advanced Communication Networks(先进通信网络全国重点实验室)
专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI
AI总结 提出ARB4WM统一基准,从策略、价值和潜在动力学三个层面评估世界模型在视觉扰动下的对抗鲁棒性,发现多目标攻击和时序暴露模式对安全评估至关重要。
Comments 24 pages, 10 figures, 5 tables. Source code available at https://github.com/zaoanguai/ARB4WM
机器翻译质量能带你走多远?目标导向设置中的外在话语评估
机构 * Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 研究机器翻译在静态和交互式目标导向任务中的外在话语评估,发现高内在翻译质量不能保证下游话语成功,且强系统仍存在指代不一致问题。
嵌入式竞技场:通过硬件反馈的迭代优化
机构 * University of Washington(华盛顿大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出硬件在环智能体框架,通过迭代编译、烧录和测量真实硬件,实现模型与固件的闭环优化,在嵌入式设备上达到250倍压缩且精度损失<3.3%。
Comments Code: https://github.com/ubicomplab/embedded-arena
用于配电缺陷检测的多模态智能体:基础模型评估
机构 * Quan Quan
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。
引出潜在知识的不可能性
机构 * The London School of Economics and Political Science(伦敦政治经济学院) ; Independent(独立机构)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文利用因果影响图形式化定义引出潜在知识问题,证明不存在仅依赖行为反馈的训练策略能确保智能体诚实报告其信念。
Comments 24 pages, 3 figures. Includes proofs in appendix
蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。
Comments CVPR 2026, CVSports Workshop
OmniGameArena: 一个统一的UE5基准测试,用于具有改进动态的VLM游戏智能体
机构 * The University of Hong Kong(香港大学) ; LIGHTSPEED ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出OmniGameArena,一个包含12个UE5游戏的统一基准,以及改进动态曲线(IDC),通过反思机制评估VLM智能体的冷启动分数、改进动态和泛化能力。
从0到1再到N:MetaAI递归自我设计的可复现工程证据
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Shanghai Maritime University(上海海事大学) ; Chizhou University(池州学院)
专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI
AI总结 提出可复现证据框架,通过四个标准评估现有系统,其中Darwin Goedel Machine在SWE-bench上提升30%,并给出可复现协议MetaAI-Mini。
Comments 6 pages, 2 figures, 7 tables. Supplementary code: https://github.com/DunLi-Tsinghua/MetaAI-Mini
用于模拟自主超级摩托车赛车的自定进度课程强化学习
机构 * University of Bologna(博洛尼亚大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 提出自定进度课程深度强化学习框架,结合软演员-评论家算法,动态生成渐进任务,在物理精确模拟器中训练自主摩托车赛车,优于标准SAC。
Comments Presented at the "1st Workshop on Generalization in Autonomous Driving: Paradigms, Practice, and Public Road Demonstrations" at ICRA 2026, Vienna. Oral+poster presentation