arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-09 至 2026-07-09 共收录 156 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2507.17939 2026-07-09 math.OC 版本更新 50%

Dynamic access pricing control for fair and stable resource sharing

公平稳定资源共享的动态访问定价控制

Christopher King, Fabian R. Wirth, Homayoun Hamedmoghadam, Christos G. Cassandras, Robert N. Shorten

专题命中 软件智能体 :autonomous agent(abstract)

AI总结 研究不同价格敏感度用户在动态定价下的共存问题,提出基于非单调价格函数的新动态定价方案,该方案能让各类用户更公平共存,通过研究非线性常微分方程刻画平衡点及吸引域,数值模拟验证了方案有效性。

Comments 41 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24071 2026-07-09 cond-mat.mtrl-sci 版本更新 50%

C-BerryTrans: A C++ code for first-principles calculation of Berry-curvature-driven anomalous Hall and Nernst conductivities

C-BerryTrans:用于贝里曲率驱动反常霍尔和能斯特电导率第一性原理计算的C++代码

Vivek Pandey, Sudhir K. Pandey

专题命中 软件智能体 :workflow(abstract)

AI总结 研究利用C++代码C-BerryTrans进行贝里曲率驱动的反常霍尔和能斯特电导率第一性原理计算,通过提取数据、评估曲率并并行化处理,在多种铁磁材料上测试,结果与报告数据相符,为相关研究提供有力工具。

Comments arXiv admin note: substantial text overlap with arXiv:2504.00123, arXiv:2505.19280

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 4 篇

2602.17588 2026-07-09 cs.CL cs.HC 版本更新 70%

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新 57%

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08430 2026-07-09 cs.MA math.DS q-bio.PE 版本更新 50%

A Hybrid ABM-PDE Framework for Real-World Infectious Disease Simulations

一种用于现实世界传染病模拟的混合 ABM-PDE 框架

Kristina Kehrer, Tim O. F. Conrad

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究提出将 ABM 与 PDE 模型结合的混合建模方法用于传染病模拟,以降计算复杂度。通过耦合机制保证一致性,用真实数据评估,该模型能捕捉核心动态且高效模拟,为传染病建模提供了强大且计算高效的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 6 篇

2607.07108 2026-07-09 cs.IR 新提交 82%

Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation

视觉与反思:用于推荐的多模态记忆增强智能体协作

Hao Cong, Huizu Lin, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract)

AI总结 针对基于LLM的推荐系统局限,提出MMEACR框架,采用双轨记忆架构,通过属性引导机制更新记忆,构建多模态嵌入记忆,经加权倒数排名融合两轨道,实验证明其在多领域表现出色,尤其视觉推荐场景有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06595 2026-07-09 cs.CR cs.AI 新提交 81%

When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents

当智能体记忆过多时:对大语言模型智能体的内存中毒攻击

George Torres, Sharad Shrestha, Satyajayant Misra

机构 * George Torres3(乔治·托雷斯(第三作者)) Sharad Shrestha1(沙拉德·什雷斯塔(第一作者)) Satyajayant Misra4(萨蒂亚扬特·米什拉(第四作者))

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 研究大语言模型驱动的个人智能体因缺乏内存安全治理存在安全漏洞,提出攻击向量GhostWriter,实现近98%注入率和约60%激活率,还提出AM-Sentry缓解技术,显著降低GhostWriter成功率并保持智能体效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06614 2026-07-09 cs.LG cs.AI 新提交 81%

STAGformer: A Spatio-temporal Agent Graph Transformer for Micro Mobility Demand Forecasting

STAGformer:用于微移动需求预测的时空代理图变换器

Ye Zihao

机构 * City University of Hong Kong(香港城市大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 针对共享单车系统站点级需求预测难题,提出STAGformer模型,通过两步代理注意力机制及四个核心模块,以线性复杂度实现高效全局建模,实验表明其在多预测范围优于基线,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01935 2026-07-09 cs.AI 新提交 74%

A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory

A-TMA: 解耦长期智能体记忆中的状态感知记忆故障

Zitong Shi, Yixuan Tang, Anthony Kum Hoe Tung

机构 * National University of Singapore(新加坡国立大学)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 针对长期记忆中状态不一致导致的幽灵记忆问题,提出A-TMA方法,通过状态感知覆盖层在存储、检索和回答三个层面解耦故障,在冲突密集基准上显著提升时间F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07392 2026-07-09 cs.LG cs.IR cs.RO 版本更新 57%

Event-Centric World Modeling with Memory-Augmented Retrieval for Embodied Decision-Making

基于记忆增强检索的事件中心世界建模用于具身决策

Zhaowen Fan, Rongchao Zhang, Yunxiang Han

机构 * Zhaowen Fan(Fan 研究院) Rongchao Zhang(Zhang 实验室)

专题命中 记忆与上下文管理 :autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一种事件中心世界建模框架,通过记忆增强检索实现具身决策,结合语义事件和先前经验进行决策,提升动态环境的结构抽象与可解释性。

Comments 12 pages, 9 figures, 4 tables, currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07043 2026-07-09 eess.SY cs.SY 新提交 50%

Probe-Conditioned Memory for Actuator-Deadband-Aware Koopman MPC in Industrial Sealing

工业密封中用于执行器死区感知库普曼模型预测控制的探测条件记忆

Yue Wu

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 研究工业密封中执行器死区感知问题,提出基于探测条件记忆的库普曼模型预测控制方法,通过十六步探测选择历史案例拟合关系并更新校正,在基准测试中AK-MPC跟踪误差低,体现该方法优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 24 篇

2607.04758 2026-07-09 cs.AI 新提交 89%

AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization

AgenticPD:用于物理设计QoR优化的阶段感知智能体框架

Shuo Ren, Zijin Cheng, Yaohui Han, Libo Shen, Leilei Jin, Wanting Tian, Rongliang Fu, Chao Wang, Bei Yu, Tsung-Yi Ho

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.AI

AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26028 2026-07-09 cs.CR cs.AI cs.MA 新提交 88%

Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem

无信任代理能否被信任?ERC-8004 去中心化 AI 代理生态系统的实证研究

Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

机构 * Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) University of Bristol(布里斯托大学) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本研究首次实证分析 ERC-8004 协议在三条链上的身份、声誉和验证注册表,发现大多数注册为占位符,声誉不可比且易被操纵,大量评论者存在 Sybil 行为,表明该协议目前无法提供可信决策基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 84%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 83%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11935 2026-07-09 cs.AI cond-mat.mtrl-sci 版本更新 83%

AGAPI-Agents: An Open-Access Agentic AI Platform for Accelerated Materials Design on AtomGPT.org

AGAPI-Agents:用于在AtomGPT.org上加速材料设计的开放访问智能代理人工智能平台

Jaehyung Lee, Justin Ely, Kent Zhang, Akshaya Ajith, Charles Rhys Campbell, Kamal Choudhary

机构 * Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究智能代理人工智能系统中工具访问对预测准确性的影响,核心方法是构建AGAPI平台整合多种模型与工具,主要贡献是明确其在材料设计中能提高精度、展示多步骤工作流程且证实工具在特定情况下不可或缺。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 79%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05750 2026-07-09 cs.AI cs.GR 新提交 79%

ArtisanCAD: An Industrial-Level CAD Agent with Expert-Grounded Knowledge Distillation

ArtisanCAD:一个具有专家基础知识蒸馏的工业级CAD智能体

Yunhan Xu, Qifeng Wu, Xunjin Li, Yuanwei Bin, Qingsong Yao, Jianghang Gu, Guan Wang, Weihao Lv, Huiyu Yang, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

机构 * Peking University(北京大学) Eastern Institute of Technology(东方理工学院) Renmin University of China(中国人民大学) TenFong Technology Co., Ltd.(十方科技有限公司) IM Motors Technology Co., Ltd.(智己汽车科技有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对工业部件CAD中现有方法的不足,提出ArtisanCAD智能体,利用专家基础知识蒸馏,以CAD中间表示为核心,能弥合文本意图与CAD构建差距,在基准测试和汽车部件设计中表现良好,可生成可编辑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07584 2026-07-09 cs.NI 新提交 78%

PHaul: A PPO-based forwarding agent for Sub6 enhanced Integrated Access and Backhaul networks

PHaul:一种用于Sub6增强型综合接入与回传网络的基于近端策略优化(PPO)的转发代理

Jorge Pueyo, Daniel Camps-Mur and, Miguel Catalan-Cid

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究Sub6增强型IAB网络的转发问题,提出PHaul,结合离线启发式算法与基于PPO的在线DRL代理,利用网络数字孪生采样更新映射,相比替代算法,能提升吞吐量效率和公平性,且对拓扑差异有鲁棒性。

Journal ref IEEE Transactions on Network and Service Management, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 75%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07435 2026-07-09 cs.LG cs.AI 新提交 73%

RLVP: Penalize the Path, Reward the Outcome

RLVP:惩罚路径,奖励结果

Bojie Li, Noah Shi

机构 * Pine AI(松果人工智能公司) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究在现实世界中智能体在线学习面临的挑战,提出“惩罚路径,奖励结果”方法,能在几乎零违规情况下实现高任务成功率,并给出有效惩罚的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21442 2026-07-09 math.NT math.CA 版本更新 67%

Irrationality of rapidly converging series: a problem of Erdős and Graham

快速收敛级数的无理性:埃尔多斯与格雷厄姆的问题

Kevin Barreto, Jiwon Kang, Sang-hyun Kim, Vjekoslav Kovač, Shengtong Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 该研究证明了满足双指数增长条件的级数求和结果为无理数,并探讨了其推广形式及最优性。

Comments Minor modifications to the exposition. To appear in the Bulletin of the London Mathematical Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06713 2026-07-09 cs.SE cs.AI 新提交 62%

Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

软件工程中智能体的可靠且与开发者一致的评估

Razvan Mihai Popescu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型驱动智能体评估技术的局限,提出基于实际软件开发实践的综合评估方法,通过污染感知、实际行为评估及轨迹感知基准指标,来弥合差距,实现可靠且与开发者一致的评估。

Comments International Conference on the Foundations of Software Engineering '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07040 2026-07-09 cs.AI 新提交 57%

Measuring Intelligence Beyond Human Scale

超越人类水平的智能测量

Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan

机构 * Princeton(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究如何测量超越人类能力的智能,提出基于相对测量的新范式,模型生成公开挑战,汇总结果得对抗性心理测量评级系统,还描述实用协议,在不同领域实例化框架,实现对超越人类前沿系统的测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06121 2026-07-09 q-fin.TR cs.AI 新提交 57%

Can Reinforcement Learning Efficiently Discover Price Manipulation?

强化学习能否有效地发现价格操纵行为?

Ioanna-Yvonni Tsaknaki, Andrea Macrì, Fabrizio Lillo

机构 * Scuola Normale Superiore(斯克沃尔纳正常大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究无模型强化学习智能体能否比传统基于模型方法更有效识别价格操纵机会,通过在单资产市场比较两种有限样本学习方法,发现中等波动率下强化学习表现良好,高波动率时都无法识别,低波动率时基于模型方法更优,凸显强化学习有效性及相关风险。

Comments 30 pages, 11 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21556 2026-07-09 cs.AI cs.GT 版本更新 57%

Power and Limitations of Aggregation in Compound AI Systems

复合人工智能系统中聚合的力量与局限性

Nivasini Ananthakrishnan, Meena Jagadeesan

机构 * UC Berkeley(伯克利大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究复合人工智能系统中聚合的力量与局限性,在委托 - 代理框架内揭示可行性扩展等三种机制,证明其对引出能力扩展的作用,通过玩具任务实证说明结果,朝表征系统克服相关局限迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 57%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14271 2026-07-09 cs.AI 版本更新 57%

Neutral Substrates: A Design Constraint for Shared Records Under Persistent Interpretive Disagreement

中性基底:持续解释分歧下共享记录的设计约束

Denise M. Case

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在因果等解释有分歧时共享记录的中立性问题,提出中性基底概念,其基础层受限以保证中立性,借助具体化等机制,给出共享记录基础层可检查条件及相关假设与边界条件,确保问责又不偏向一方解释。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏