arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-29 至 2026-07-29 共收录 85 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2508.05775 2026-07-29 cs.CL cs.CY 版本更新 89%

Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM

守护者与违规者:大语言模型有害内容生成与安全缓解研究综述

Chi Zhang, Changjia Zhu, Junjie Xiong, Xiaoran Xu, Lingyao Li, Yao Liu, Zhuo Lu

机构 * University of South Florida(佛罗里达州立大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);alignment(abstract);jailbreak(abstract)

AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14990 2026-07-29 cs.AI 版本更新 79%

The Possibility of Artificial Intelligence Becoming a Subject and the Alignment Problem

人工智能成为主体的可能性及对齐问题

Till Mossakowski, Helena Esther Grass

机构 * Institute of computer science, Osnabrück University(奥斯纳布吕克大学计算机科学学院) Institute of philosophy, Oldenburg University(奥尔登堡大学哲学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文探讨AGI可能成为独立主体的可能性,提出通过支持自主性的养育方式替代传统控制策略,强调人类与AGI的协作共存与共进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02061 2026-07-29 cs.IR 版本更新 78%

Reason4Rec: Deliberative User Preference Alignment of Large Language Models for Recommendation

Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐

Yi Fang, Wenjie Wang, Yang Zhang, Fengbin Zhu, Qifan Wang, Fuli Feng, Xiangnan He

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。

Comments Accepted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 75%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25136 2026-07-29 cs.AI 新提交 74%

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(title);分类 cs.AI

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24900 2026-07-29 cs.LG 新提交 70%

Inverse RL Helps Align AI by Imitating Humans

逆强化学习通过模仿人类帮助对齐人工智能

Michał Wiliński, Liu Leqi, Chirag Nagpal

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究语言模型对齐问题,受逆强化学习启发提出PARED方法,通过恢复示范的隐式奖励来改进基础策略,无需特定任务偏好注释,经实验验证其有效性及可用于上下文对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21498 2026-07-29 cs.CL cs.AI 版本更新 62%

Artificial Epanorthosis: Why large language models overuse a classical rhetorical figure, and how to mitigate it

人工矫正:为什么大语言模型过度使用一种古典修辞格,以及如何缓解这一问题

Federico Boggia

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型过度使用矫正格修辞格的问题,基于模型与人类修辞风格差异及相关分类,提出用矫正格指数评分,通过测量发现校准错误,给出以LoRA适配器为中心的缓解技术、指令及适配器效果,强调校准到人类比率而非消除的重要性。

Comments 18 pages, 7 tables. v2: corrections to the classical sources (Quintilian, Cicero) and to several cited figures, and Appendix B corpus statistics aligned to the delivered dataset; measurements, results and conclusions unchanged. Data, code, and the trained LoRA adapter: https://federicoboggia.binatomy.com/pubblicazioni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新 62%

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25366 2026-07-29 cs.IR cs.LG 新提交 57%

Sharpness-aware Model Merging with Salience Recovery for LLM-based Cross-Domain Sequential Recommendation

基于大语言模型的跨域序列推荐的锐度感知模型融合与显著性恢复

Huwei Ji, Jiajie Su, Yuyuan Li, Xiaohua Feng, Chaochao Chen

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 研究基于大语言模型的跨域序列推荐中的问题,提出SharpRec框架,包含锐度感知几何对齐和偏好显著性激活模块,有效解决跨域知识冲突和性能饱和问题,实验证明其性能优于现有基准。

Comments Published in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26). 12 pages, 6 figures, 4 tables. Code available at https://github.com/muyiahhh/SharpRec

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 9-13, 2026, Jeju Island, Republic of Korea, ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13434 2026-07-29 cs.CL 版本更新 57%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2607.25019 2026-07-29 econ.TH cs.GT cs.MA 新提交 78%

Interactive Alignment

交互式对齐

Sylvain Chassang

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。

Comments 53 pages, 18 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24859 2026-07-29 cs.CR 新提交 67%

The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation

大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究

Davis Yadav, Amulya Yadav

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26034 2026-07-29 cs.AI cs.CY cs.GT econ.GN q-fin.EC 新提交 62%

Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment

在理想化人工智能竞赛实验中落后导致不安全发展

Elias Fernández Domingos, The Anh Han

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Teesside University(提赛德大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能竞赛中速度与安全的关系,通过实验发现不安全发展受竞赛战略状态影响,引入进化模型解释,表明政策应注重降低竞争压力、促进合作,而非仅关注个体风险。

Comments 45 pages (main + SI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24893 2026-07-29 cs.CR cs.AI 新提交 57%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 57%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25883 2026-07-29 cs.MA 新提交 50%

Towards a Systems Foundation for Agentic Cloud Management

迈向智能云管理的系统基础

Minghao Li, Ziqian Liu, Ziyu Mao, Daqian Ding, Yu Kang, Qingwei Lin, Tianyin Xu, Yiming Qiu

专题命中 安全训练 :safety(abstract)

AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25754 2026-07-29 cs.RO 新提交 50%

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

通过系统多智能体深度强化学习实现复杂环境下的多无人机协同导航

Yu Su, Nabil Aouf

专题命中 安全训练 :safety(abstract)

AI总结 针对复杂环境下多无人机协同导航面临的问题,提出多智能体深度强化学习框架,通过协同探索等方法解决,含感知、示范缓冲区和课程调度机制,能抽象特征实现跨场景转移,经仿真验证有良好性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2607.24897 2026-07-29 cs.CR 新提交 75%

TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models

TYPO:针对商业闭源图像生成模型的指令密集型视觉越狱

Meng Xie, Li Zeng, Hangtao Zhang, Xianlong Wang, Ziqi Zhou, Pengpeng Qiao, Zhetao Li

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究针对商业闭源图像生成模型安全漏洞,提出TYPO框架,通过自动生成对抗性排版提示,利用文本和视觉双通道策略空间及自适应组合搜索,有效实现指令密集型视觉越狱,性能优于其他攻击且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25479 2026-07-29 cs.CR cs.AI cs.LG 新提交 62%

Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

通过表示引导在视觉语言模型供应链中植入架构后门

Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25936 2026-07-29 cs.CR 新提交 50%

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击

Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

专题命中 越狱攻击 :alignment(abstract)

AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。

Comments 17pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2503.13558 2026-07-29 eess.SP cs.AI cs.LG 62%

Survival Analysis with Machine Learning for Predicting Li-ion Battery Remaining Useful Life

利用机器学习进行生存分析以预测锂离子电池剩余寿命

Jingyuan Xue, Xiaozhen Zhao, Dongjing Jiang, Qingchong Jiao, Redouane EL Bouchtaoui, Jianfei Zhang

机构 * Ontario Knowledge Intelligence Centre (OKIC), Canada(加拿大安大略知识智能中心) Canadian Institute of Interscience (CIoI), Canada(加拿大跨学科科学研究所) DeepCox Intelligence, Canada(加拿大DeepCox智能公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合生存分析框架,通过路径签名将电池电压时间序列转换为时间到故障数据,结合生存模型学习和概率估计,有效预测电池剩余寿命,实验表明方法在时间依赖AUC和C-指数上表现优异。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2502.18535 2026-07-29 cs.CR cs.AI cs.LG 62%

A Survey of Zero-Knowledge Proof Based Verifiable Machine Learning

基于零知识证明的可验证机器学习综述

Zhizhi Peng, Chonghe Zhao, Taotao Wang, Guofu Liao, Zibin Lin, Yifeng Liu, Bin Cao, Long Shi, Qing Yang, Shengli Zhang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室) School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子工程与光电技术学院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了从2017年6月至2025年8月间发表的零知识机器学习研究,涵盖可验证训练、测试和推理三大核心任务,分析了实现瓶颈与改进技术,为可信隐私保护机器学习提供参考。

Comments This manuscript has been accepted for publication in Artificial Intelligence Review

Journal ref Artificial Intelligence Review, 59, 157 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 39 篇

2607.24817 2026-07-29 cs.IR cs.AI cs.CL 新提交 81%

Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture

大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献

Anand Gupta, Akshat Surolia, Shubham Mishra, Shakil Imtiaz, Chaitali Sinha

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25700 2026-07-29 cs.HC 新提交 78%

BioDisclose: An Actionability-Aware Benchmark for Biomedical Safety under Adversarial Elicitation

BioDisclose:对抗性诱导下生物医学安全的可操作性感知基准

Yinuo Zhu, He Liu, Boyuan Gu

专题命中 安全评测 :safety(title,abstract)

AI总结 研究针对大语言模型在对抗性诱导下生物医学知识披露行为不足问题,引入BioDisclose基准,含多领域多类别提示,对模型响应四级评分,通过实验揭示不同模型、策略及风险类别差异,为评估生物医学安全提供新测试平台。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 78%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24866 2026-07-29 cs.CR 新提交 75%

The Missing Layer: Specification Infrastructure for AI Oversight

缺失的层次:人工智能监督的规范基础设施

Satyam Kumar, Saurabh Jha

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)

AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新 74%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 73%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏