arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 453 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 453 篇

2411.17552 2026-06-15 eess.SY cs.SY 版本更新 82%

TRUST-UP: Trustworthy Reinforcement learning Using Safe Techniques for UAV Pursuit

TRUST-UP:使用安全技术的可信强化学习用于无人机追踪

Yaosheng Deng, Mengtao Lyu, Junjie Gao, Jiaping Xiao, Mir Feroskhan

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

AI总结 提出TRUST-UP算法,通过控制障碍函数安全滤波和切换策略,实现无人机在拥挤城市环境中的安全自主追踪,满足航空认证的可信需求。

Comments Accepted manuscript. Accepted for publication in Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13379 2026-06-12 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 82%

Unsafer in Many Turns: Benchmarking and Defending Multi-Turn Safety Risks in Tool-Using Agents

多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御

Xu Li, Simon Yu, Minzhou Pan, Yiyou Sun, Bo Li, Dawn Song, Xue Lin, Weiyan Shi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18905 2026-06-08 cs.LG cs.AI cs.CL 版本更新 82%

TRUE: A Trustworthy Unified Explanation Framework for Large Language Model Reasoning

TRUE:一种用于大语言模型推理的可信统一解释框架

Yujiao Yang

机构 * Dalian University of Technology(大连理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRUE框架,通过可执行推理验证、可行域DAG建模和因果故障模式分析,为LLM推理提供实例级、局部结构级和类别级的多层次可验证解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26529 2026-08-04 cs.CL cs.AI cs.CV 版本更新 81%

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号

Kwan Soo Shin

机构 * PolymathMinds Lab(PolymathMinds 实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。

Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24155 2026-07-30 cs.CY cs.AI cs.HC 版本更新 81%

The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers

对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧

Benjamin Minhao Chen, Xinyu Xie

机构 * The University of Hong Kong(香港大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。

Comments ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07314 2026-07-30 cs.CL cs.AI 版本更新 81%

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan

机构 * M42

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01241 2026-07-15 cs.CY cs.AI 版本更新 81%

First, do NOHARM: a medical safety benchmark and randomized study of physician and AI teaming on clinical consultations

首先,不伤害:迈向临床安全的大语言模型

David Wu, Fateme Nateghi Haredasht, Saloni Kumar Maharaj, Priyank Jain, Jessica Tran, Matthew Gwiazdon, Arjun Rustagi, Jenelle Jindal, Jacob M. Koshy, Vinay Kadiyala, Anup Agarwal, Bassman Tappuni, Brianna French, Sirus Jesudasen, Christopher V. Cosgriff, Rebanta Chakraborty, Jillian Caldwell, Susan Ziolkowski, David J. Iberri, Robert Diep, Rahul S. Dalal, Kira L. Newman, Kristin Galetta, J. Carl Pallais, Nancy Wei, Kathleen M. Buchheit, David I. Hong, Vartan Pahalyants, Ernest Y. Lee, Allen Shih, Tamara B. Kaplan, Vishnu Ravi, Sarita Khemani, Thomas A. Buckley, April S. Liang, Daniel Shirvani, Advait Patil, Nicholas Marshall, Kanav Chopra, Joel Koh, Adi Badhwar, Anastasia Perez, Austin J. Schoeffler, Mahbuba Tusty, Chase M. Walton, Liam G. McCoy, David J. H. Wu, Yingjie Weng, Sumant Ranji, Kevin Schulman, Nigam H. Shah, Jason Hom, Arnold Milstein, Arjun K. Manrai, Adam Rodman, Jonathan H. Chen, Ethan Goh

机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) Harvard Medical School(哈佛医学院) Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) Stanford University(斯坦福大学) Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29657 2026-07-14 cs.AI cs.LG 版本更新 81%

Safety from Honesty in a Disinterested AI Predictor

无兴趣AI预测器中的诚实安全性

Yoshua Bengio, Oliver Richardson, Tomáš Gavenčiak, Michael Cohen, Rory Svarc, Damiano Fornasiere, Gael Gendron, David Hyland, Aton Kamanda, Adam Oberman, Francis Rhys Ward, Anna Gavenčiak, Jacob Livingston Slosser, Vincent Mai, Iulian Serban, Joumana Ghosn

机构 * LawZero Université de Montréal(蒙特利尔大学) Mila University of California Berkeley(加州大学伯克利分校) McGill University(麦吉尔大学) Arb Research Center for Theoretical Study Charles University in Prague(布拉格查理大学理论研究中心) University of Oxford(牛津大学) Sapien Institute(Sapien研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种形式化安全论证,通过数据表示和训练过程确保预测器诚实预测而不成为追求目标的智能体,并证明危险预测器出现的概率可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13087 2026-06-24 cs.LG cs.AI 版本更新 81%

Graph Alignment for Benchmarking Graph Neural Networks and Learning Positional Encodings

图对齐:用于基准测试图神经网络和学习位置编码

Adrien Lagesse, Marc Lelarge

机构 * INRIA, École Normale Supérieure - PSL, Paris, France(INRIA,法国国家信息与自动化研究所,巴黎高等师范学院-巴黎理工学院,巴黎,法国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于图对齐问题的GNN基准测试方法,通过自监督学习生成难度递增的数据集,发现各向异性模型表现更优,且预训练嵌入可作为位置编码用于图回归或高精度结构重建。

Comments International Conference on Machine Learning, Seoul, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28503 2026-08-11 cs.AI 版本更新 79%

InfoOps Bench: A live information operations safety benchmark

InfoOps Bench:实时信息行动安全基准

Dorian Quelle, Lisa-Maria Neudert, Jonathan Bright, John Gallacher

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出实时信息行动安全基准InfoOps Bench,测试17个前沿语言模型抵御国家支持信息行动的能力,发现多数模型可被利用,中国开发模型对涉华事实主张合规性显著下降,凸显模型可用性与安全性的平衡挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 79%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 79%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 79%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 79%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28067 2026-08-04 cs.LG 版本更新 79%

From Vessel Trajectories to Safety-Critical Encounter Scenarios: A Generative AI Framework for Autonomous Ship Digital Testing

从船舶轨迹到安全关键性遭遇场景:一种生成式AI框架用于自主船舶数字测试

Sijin Sun, Liangbin Zhao, Xiuju Fu

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种数据驱动框架,将大规模AIS轨迹转化为结构化安全关键性遭遇场景,结合生成轨迹建模与自动化遭遇配对,提升场景生成的可扩展性与真实性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00500 2026-08-04 cs.AI cs.SE 版本更新 79%

ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction

ProbGuard:基于概率的运行时监控用于LLM代理安全

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Xi'an Jiaotong University(西安交通大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19738 2026-07-27 cs.AI cs.LO cs.PL 版本更新 79%

Integrating Reasoning Systems for Trustworthy AI, Proceedings of the 4th Workshop on Logic and Practice of Programming (LPOP)

用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录

Anil Nerode, Yanhong A. Liu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 79%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 79%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 79%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22823 2026-07-14 cs.CV cs.AI 版本更新 79%

PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

PivotMerge: 通过后对齐模型融合弥合异构多模态预训练

Zibo Shao, Baochen Xiong, Xiaoshan Yang, Yaguang Song, Qimeng Zhang, Haifeng Chen, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Data Science and Artificial Intelligence Research Institute, China United Network Communications Group Co., Ltd.(中国联合网络通信集团有限公司数据科学与人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出PivotMerge框架,通过后对齐模型融合技术,解决多模态预训练中跨模态对齐能力整合问题,提升模型统一语义空间的构建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 79%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 79%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 79%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 79%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16357 2026-06-19 cs.CY cs.SE 版本更新 79%

Beyond Grading Accuracy: Exploring Alignment of TAs and LLMs

超越评分准确性:探索助教与LLMs的一致性

Matthijs Jansen op de Haar, Nacir Bouali, Faizan Ahmed

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本文提出一个评估管道,通过定量研究92个UML类图,比较助教与六个开源LLMs在单个评分标准上的表现,发现开源LLMs在评分准确性上接近助教,为混合主动评分系统提供了可能。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06173 2026-06-16 cs.IR cs.AI 版本更新 79%

Beyond Case Law: Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA

超越判例法:评估法规中心型法律问答中的结构感知检索与安全性

Kyubyung Chae, Jewon Yeom, Jeongjae Park, Seunghyun Bae, Ijun Jang, Hyunbin Jin, Jinkwan Jang, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 针对法规中心型法律问答中层级检索困难与模型幻觉问题,提出结构-安全感知基准SearchFireSafety,通过图引导检索提升性能,但揭示领域适应模型在证据缺失时更易幻觉。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05463 2026-06-10 cs.AI 版本更新 79%

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

机构 * Emory University(埃默里大学) Scale AI Mayo Clinic(梅奥诊所) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 79%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 78%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏