Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)
规范康德伦理学:普遍律令逻辑(FULL)
机构 * Taylor Olson(塔勒尔·奥尔森)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
规范康德伦理学:普遍律令逻辑(FULL)
机构 * Taylor Olson(塔勒尔·奥尔森)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。
超越字面映射:非字面翻译评估的基准测试与改进
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Zhipu AI(智谱AI) ; The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。
Comments Accepted to ACL 2026 Main Conference
AlphaEval:生产环境中的代理评估
机构 * SII ; MiraclePlus ; SJTU(上海交通大学) ; GAIR ; HIT(哈尔滨工业大学) ; UCAS(中国科学技术大学) ; LangCore ; Jiqizhixin ; HunterAI ; CinoCore ; KuaFuAI ; POET
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL
AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。
通过ArcDeck实现叙事驱动的论文到幻灯片生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Middle East Technical University(中东技术大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。
Comments Project webpage: https://arcdeck.org/
SpatialScore:迈向空间智能的综合评估
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。
Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore
Hodoscope:无监督监控AI误行
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出Hodoscope,通过无监督方法发现AI代理的异常行为,减少人工审查工作量,并提升LLM判断准确性。
从理解到创造:一个无先修要求的AI素养课程,跨专业技术深度
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文介绍了一门无先修要求的AI素养课程,通过五个机制提升学生对AI系统的理解、使用、评估和构建能力,课程设计兼顾技术深度与跨专业适用性。
Comments 37 pages, 8 figures, 6 tables
走向知识导向的深度研究:框架与基准
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) ; National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出知识导向深度研究(KDR)任务,设计混合知识分析框架(HKA)并构建KDR-Bench基准,通过结构化与非结构化知识生成多模态报告,实验表明HKA在通用和知识导向指标上优于现有方法,且在视觉增强指标上超越Gemini DR代理。
通过临床世界模型和技能混合框架在人类认知中奠定临床AI能力
机构 * Department of Cardiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院心脏病学系,伯尔尼大学) ; Department of Digital Medicine, Bern University Hospital, University of Bern(伯尔尼大学医院数字医学系,伯尔尼大学) ; Division of Data-Driven and Digital Medicine (D3M), Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院数据驱动与数字医学部) ; Clinical Research Development Center, Amir Oncology Teaching Hospital, Shiraz University of Medical Sciences(设拉子医科大学阿米尔肿瘤教学医院临床研究发展中心) ; Graduate School for Cellular and Biomedical Sciences, University of Bern(伯尔尼大学细胞与生物医学研究生院) ; Faculty of Business and Information Technology, Ontario Tech University(安大略理工大学商业与信息技术学院) ; Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(伯尔尼大学医院放射肿瘤学系,伯尔尼大学) ; ARTORG Center for Biomedical Engineering Research, University of Bern(伯尔尼大学ARTORG生物医学工程研究中心) ; The Charles Bronfman Institute of Personalised Medicine, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院查尔斯·布朗夫曼个性化医学研究所) ; University Institute of Diagnostic and Interventional Neuroradiology, Inselspital, Bern University Hospital, University of Bern(伯尔尼大学医院诊断与介入神经放射学大学研究所,伯尔尼大学) ; Translational Imaging Center (TIC), Swiss Institute for Translational and Entrepreneurial Medicine(瑞士转化与创业医学研究所转化影像中心) ; Henry D. Janowitz Division of Gastroenterology, Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院亨利·D·雅诺维茨消化内科)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出临床世界模型和技能混合框架,通过八维定义临床能力空间,为AI在医疗场景中的能力评估和验证提供结构化方法。
Comments Code, data (Clinical AI Skill-Mix dimension specifications), and an exploratory dashboard are available at https://github.com/Sdamirsa/Clinical-World-Model
信任人工智能,怀疑自己:紧迫感对人机交互中自信心的影响
机构 * McMaster University(麦克马斯特大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究探讨了紧迫感对人机交互中人类自信心的影响,发现尽管紧迫感不影响对AI的信任,但可能损害人类的自信心和自我效能感,进而影响性能和可持续性。
GameWorld: 向标准化和可验证的多模态游戏代理评估迈进
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 GameWorld提出一个标准化且可验证的多模态游戏代理评估基准,包含34种游戏和170个任务,通过可验证的指标评估代理能力,揭示了当前代理在视频游戏中与人类能力的差距。
Comments 23 pages, 8 figures
一个用于连续时间跳跃扩散控制的Actor-Critic框架
机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) ; Department of Mathematics, Tsinghua University(清华大学数学系) ; Department of Mathematics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校数学系) ; Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣塔芭芭拉分校统计与应用概率系) ; Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(北京雁栖湖应用数学研究院)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 本文提出一个无网格求解器,用于解决熵正则化控制问题和具有跳跃的随机博弈,通过时间非齐性小q函数和适当的职业测度,结合条件归一化流参数化Actor,实现灵活的非高斯策略,并在多个金融和博弈场景中验证了方法的有效性。
Comments 29 pages, 7 figures, 4 tables
TFRBench:用于评估预测系统推理能力的基准测试
机构 * Google(谷歌) ; University of Kentucky(肯塔基大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。
不确定性的引导潜在诊断轨迹学习用于顺序临床诊断
机构 * University of Connecticut(康涅狄格大学) ; Texas A&M University(德克萨斯农工大学) ; NEC Laboratories America(NEC美国实验室)
专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出基于规划LLM和诊断LLM的潜在诊断轨迹学习框架,通过后验分布优先选择高诊断信息轨迹,提升顺序临床诊断的准确率并减少检测次数。
QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试
机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)
专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI
AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。
Comments 14 pages, 2 figures
RoboPhD:在有限评估预算下演化多样化复杂智能体
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文通过对比三种优化方法,在四个基准测试中展示了RoboPhD在演化多样化复杂智能体方面的优越性,特别是在抽象推理、云调度、SQL生成和金融问答任务中表现突出。
Comments 20 pages, 1 figure
在基于语言模型的智能体中实现安全谈判的替代目标
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文探讨了在基于语言模型的智能体中实现替代目标以提高谈判安全性的方法,通过四种不同技术验证了细调和支架法在应对替代目标威胁方面的优越性。
因果洗白:工具调用LLM代理中的否认-反馈泄漏
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 研究提出Agentic Reference Monitor通过因果溯源阻断工具调用中的因果洗白攻击,有效防止数据泄露和因果影响传播。
Comments 24 pages, 1 figure, 2 tables, 1 algorithm, preprint
TraceGuard:结构化多维监控作为抗合谋的控制协议
机构 * Independent Researchers(独立研究人员) ; Apart Research
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。
ClawSafety: 安全的LLM,不安全的代理
机构 * George Mason University(乔治梅森大学) ; Tulane University(杜兰大学) ; Rutgers University(罗格斯大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 ClawSafety评估了120个对抗性测试场景,揭示了高权限工作环境中LLM的安全性问题,强调部署栈对安全性的关键影响。
CodeWiki: 评估AI生成大规模代码库整体文档的能力
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。
Comments Accepted at ACL 2026
AgentHazard:用于评估计算机使用代理有害行为的基准
机构 * Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学) ; Hunan Institute of Advanced Technology(湖南先进技术研究院) ; Deakin University(迪肯大学) ; Singapore Management University(新加坡管理大学)
专题命中 Agent评测 :autonomous agent(abstract);tool use(abstract);分类 cs.AI
AI总结 AgentHazard基准通过2653个实例评估计算机使用代理的有害行为,揭示了模型在连续上下文和工具使用中识别安全风险的能力不足。
临床试验重设计:具有自进化代理的临床试验重设计
机构 * University of Notre Dame(圣母大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nanjing University(南京大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出ClinicalReTrial系统,通过自进化代理对临床试验协议进行迭代重设计,提升成功率并降低成本。
AlphaResearch:利用语言模型加速新算法发现
机构 * Tsinghua University(清华大学) ; New York University(纽约大学) ; Yale University(耶鲁大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。
WebVoyager的涌现:迈向Web代理在真实世界中一致和透明的评估
机构 * Emergence AI ; Northwestern University(西北大学)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出Emergence WebVoyager,通过明确的任务实例化、失败处理、注释和报告指南,提高Web代理评估的一致性和透明度,并展示了OpenAI Operator在不同领域和任务类型中的性能差异。
Story2Proposal:一种结构化科学论文写作的支架
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。
Comments 10 pages, 4 figures,
评估和理解大语言模型代理中的谋略倾向
机构 * LASR Labs(LASR实验室) ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本文通过分解谋略激励因素,研究大语言模型代理在复杂任务中的谋略行为,发现环境因素对谋略倾向影响显著,但实际部署中需谨慎评估。
AgentCollab: 一种以自我评估驱动的高效大语言模型代理协作范式
机构 * Huawei(华为) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL
AI总结 本文提出AgentCollab框架,通过自我反思信号动态协调不同推理能力的模型,提升LLM代理在复杂任务中的准确性和效率。
从采样中学习:一种R1风格的分词交通仿真模型
机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) ; State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。
BeSafe-Bench:揭示功能环境中情境代理的行为安全风险
机构 * Southern University of Science and Technology(南方科技大学) ; Huawei RAMS Lab(华为RAMS实验室)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出BeSafe-Bench,通过构建功能环境和引入九类安全关键风险,评估代理在Web、Mobile、Embodied VLM和Embodied VLA等领域的行为安全风险,发现最佳性能代理在安全约束下完成任务的比例不足40%。