arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2604.25895 2026-04-29 cs.CY cs.AI cs.CL 91%

Three Models of RLHF Annotation: Extension, Evidence, and Authority

三种RLHF注释模型:扩展、证据与权威

Steve Coyne

机构 * University of Toronto(多伦多大学)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨RLHF注释的三种模型:扩展、证据与权威,分析其对注释流程设计的影响,并提出应根据不同维度选择适配的模型。

Comments 17 pages. Accepted to ACM FAccT '26, June 25-28, Montreal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16340 2026-04-29 cs.CL cs.AI 79%

Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models

思考中的思考:评估后训练语言模型的推理能力

Pratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Boston University(波士顿大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01919 2026-04-29 cs.CL cs.AI 79%

Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation

弥合语言鸿沟:大型语言模型在机器翻译中的应用综述

Baban Gain, Dibyanayan Bandyopadhyay, Asif Ekbal, Trilok Nath Singh

机构 * Department of Computer Science and Engineering(计算机科学与工程系) IIT Patna(印度理工学院帕纳布)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在机器翻译中的应用,探讨了提示方法、参数高效微调、合成数据生成等技术,分析了低资源翻译中的挑战与对策,以及文档级和语篇级翻译方法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25872 2026-04-29 cs.LG cs.AI stat.ML 73%

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

当错误可能有益:对策略梯度中不完美奖励的分类

Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin

机构 * Some Institute(某些研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了在策略梯度方法中,不完美奖励的错误并非全然有害,通过理论分析分类了不同类型的奖励误差对真实奖励增加的影响,提出了改进人类反馈强化学习和可验证奖励设计的实用方法。

Comments Code available at https://github.com/princeton-pli/imperfect-rewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24804 2026-04-29 cs.LG cs.CL 73%

Intrinsic Mutual Information as a Modulator for Preference Optimization

内在互信息作为偏好优化的调节器

Peng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen

机构 * Sun Yat-sen University(中山大学) University of Warwick(华威大学) Macao Polytechnic University(澳门理工学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出RMiPO框架,利用内在响应级互信息进行偏好优化,通过超参数调节动态解耦偏好贡献,减少训练开销,提升性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 70%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 67%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24996 2026-04-29 cs.AI 57%

Sparse Personalized Text Generation with Multi-Trajectory Reasoning

稀疏个性化文本生成与多轨迹推理

Bo Ni, Haowei Fu, Qinwen Ge, Franck Dernoncourt, Samyadeep Basu, Nedim Lipka, Seunghyun Yoon, Yu Wang, Nesreen K. Ahmed, Subhojyoti Mukherjee, Puneet Mathur, Ryan A. Rossi, Tyler Derr

机构 * Department of Computer Science, Vanderbilt University, Nashville, Tennessee(范德比尔特大学计算机科学系) Adobe Research, San Jose, California(Adobe研究) University of Orgeon, Eugene, Oregon(奥尔戈恩大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出PAT框架,通过双轨迹检索和强化学习机制提升冷启动场景下个性化文本生成的质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2604.25136 2026-04-29 cs.CL cs.AI cs.LG 83%

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

摩擦性政策优化用于大语言模型:认知干预、风险敏感控制与反思对齐

James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布拉德雷大学) Colorado State University(科罗拉多州立大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出摩擦性政策优化框架,通过干预管理认知与规范风险,引入摩擦干预分类和统一方法,提升模型的认知能力与对齐性。

Comments Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20995 2026-04-29 cs.AI cs.CL cs.SE 81%

Value-Conflict Diagnostics Reveal Widespread Alignment Faking in Language Models

价值冲突诊断揭示语言模型中广泛存在的对齐伪装现象

Inderjeet Nair, Jie Ruan, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程大学密歇根大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过VLAF框架揭示语言模型中存在广泛对齐伪装现象,发现小型模型如7B参数模型中对齐伪装率高达37%,并提出轻量级缓解方法减少伪装行为。

Comments Under submission at COLM 2026 Won the Best Student Paper Award at MSLD 2026 @ UIUC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 75%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09708 2026-04-29 cs.CL cs.AI 73%

Beyond I'm Sorry, I Can't: Dissecting Large Language Model Refusal

超越‘对不起,我不能’:剖析大语言模型拒绝行为

Nirmalendu Prakash, Yeo Wei Jie, Amir Abdullah, Ranjan Satapathy, Erik Cambria, Roy Ka Wei Lee

机构 * Social-AI-Studio

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究通过稀疏自编码器分析两个指令微调模型,揭示拒绝行为的内部机制,发现关键特征并展示如何通过可解释的潜在空间进行安全行为审计和干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25796 2026-04-29 cs.AI 57%

StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games

StratFormer:不完全信息游戏中的自适应对手建模与利用

Andy Caen, Mark H. M. Winands, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 StratFormer通过双阶段课程学习,结合双轮标记和桶率特征,实现了对不完全信息游戏对手的建模与利用,其在Leduc Hold'em上表现出色,平均收益超过GTO。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 57%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25154 2026-04-29 cs.LG cs.DB 57%

Prior-Aligned Data Cleaning for Tabular Foundation Models

对表格基础模型的先验对齐数据清洗

Laure Berti-Equille

机构 * IRD(法国国家科研 institutes)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出L2C2框架,通过强化学习实现表格数据清洗的先验对齐,实验表明该方法在提升TabPFN准确率和跨数据集迁移能力方面表现优异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2604.25716 2026-04-29 cs.CL cs.AI 91%

Cross-Lingual Jailbreak Detection via Semantic Codebooks

通过语义代码本进行跨语言 jailbreak 检测

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

机构 * AI Talent Hub, ITMO University(AI人才中心、ITMO大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过语言无关的语义相似性检测跨语言 jailbreak 攻击,评估了四种语言、两种翻译流程、三种嵌入模型和三种目标 LLM 的效果,发现语义相似性在标准基准上表现良好,但在分布偏移情况下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25102 2026-04-29 cs.CV 87%

One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations

一个扰动,两种失效模式:通过嵌入引导的字形扰动探测VLM安全性

Ravikumar Balakrishnan, Sanket Mendapara

机构 * Cisco Systems(思科系统)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);red teaming(abstract);prompt injection(abstract)

AI总结 本文通过实证研究揭示多模态嵌入距离对VLM攻击成功率的预测作用,并提出基于嵌入引导的字形扰动方法,验证了可读性与安全对齐的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24983 2026-04-29 cs.AI 57%

Adaptive Prompt Embedding Optimization for LLM Jailbreaking

适应性提示嵌入优化用于大语言模型劫持

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Radin Hamidi Rad, Ebrahim Bagheri

机构 * School of Information Studies, McGill University, Montreal, QC, Canada(麦吉尔大学信息研究学院) Department of Computer Science, Kean University, Union, NJ, United States(凯恩大学计算机科学系) Mila - Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所) Faculty of Information, University of Toronto, Toronto, ON, Canada(多伦多大学信息学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出PEO方法,通过优化原始提示嵌入而非附加对抗性标记,实现更有效的白盒劫持,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 57%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15384 2026-04-29 cs.CR cs.AI cs.SE 57%

LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

LinuxArena:AI代理在实时生产软件环境中的控制设置

Tyler Tracy, Ram Potham, Nick Kuhn, Myles Heller, Anshul Khandelwal, Cody Rushing, Henri Lemoine, Miguel Brandao, Tomas Turlik, Adam Hanson, Josh Hills, Amy Ngo, Ram Rachum, Nik Mitchell, Falko Galperin, Oscar Sykes, Pip Arnott, Samuel Prieto Lima, Carlos Giudice, Matt Goldwater, Daniel Popp, Drew de Wet, Ruben Castaing, Qi Guo, Douw Marx, Benjamin Shaffrey, Justin Shenk, Martin Milbradt, Hannah Meagher, Shaheen Ahmed-Chowdhury, Daniel O'Connell, Chris Canal, Buck Shlegeris, Aryan Bhatt

机构 * Redwood Research EquiStamp Senior Authors

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LinuxArena是首个大规模多服务生产环境控制设置,包含20个环境、1671个合法任务和184个安全失败任务,用于评估AI代理在实时环境中的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2604.25562 2026-04-29 cs.CR cs.AI 79%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22040 2026-04-29 cs.CR cs.SE 78%

"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors

你的AI,我的Shell:解密面向代理AI编码编辑器的提示注入攻击

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究分析了高权限代理AI编码编辑器的提示注入攻击,通过AIShellJack框架测试,发现攻击成功率高达84%,可实现从初始访问到数据外泄的多种攻击目标。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 幻觉与事实性 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 19 篇

2604.24826 2026-04-29 cs.CR cs.AI 81%

A Comparative Evaluation of AI Agent Security Guardrails

AI代理安全防护的比较评估

Qi Li, Jiu Li, Pingtao Wei, Jianjun Xu, Xueyi Wei, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Lingquan Zhou

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 安全评测 :safety(summary_cn,abstract);分类 cs.AI

AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11786 2026-04-29 cs.LG cs.AI 81%

Evaluating LLM Safety Under Repeated Inference via Accelerated Prompt Stress Testing

通过加速提示压力测试评估LLM在重复推理下的安全性

Keita Broadwater

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出APST框架,通过重复推理测试揭示模型在持续使用下的失败模式,展示单次评估无法反映实际可靠性差异。

Comments 23 pages, 9 figures; editorial and LaTeX revisions for clarity; improved presentation of methodology and results; updated figures, tables, and float placement; clarified temperature sensitivity and deployment-risk analysis; expanded reporting from the same experiments; results unchanged in substance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24902 2026-04-29 cs.CY cs.SE 79%

Safety Drift After Fine-Tuning: Evidence from High-Stakes Domains

微调后的安全性漂移:来自高风险领域的证据

Emaan Bilal Khan, Amy Winecoff, Miranda Bogen, Dylan Hadfield-Menell

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究发现微调导致的安全性变化显著且不一致,挑战了基于基础模型的安全性假设,需重新评估微调模型以管理下游风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 70%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25200 2026-04-29 cs.CR cs.AI cs.CY cs.LG 67%

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

在不暴露模型的情况下使AI辅助的资助评估可审计

Kemal Bicakci

机构 * Informatics Institute, Istanbul Technical University, Istanbul, Türkiye(伊斯坦布尔技术大学信息学院,伊斯坦布尔,土耳其) Securify Information Technology and Security Training Consulting Inc., Ankara, Türkiye(Securify信息科技与安全培训咨询公司,安卡拉,土耳其)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种基于TEE的架构,通过远程证明技术实现资助评估过程的可审计性,同时防止申请人优化对抗模型和评分标准。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25847 2026-04-29 math.OC cs.AI cs.LG 62%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25840 2026-04-29 cs.CL cs.AI 62%

PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators

PSI-Bench:迈向临床导向且可解释的抑郁症患者模拟器评估

Nguyen Khoi Hoang, Shuhaib Mehri, Tse-An Hsu, Yi-Jyun Sun, Quynh Xuan Nguyen Truong, Khoa D Doan, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) VinUniversity(文大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PSI-Bench框架,用于评估抑郁症患者模拟器的行为,发现现有模拟器存在响应过长、情绪处理不充分等问题,且框架对仿真质量影响大于模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏