arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2606.18557 2026-06-18 cs.AI cs.LG cs.LO 新提交 73%

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

DeFAb:基础模型中可废止溯因的可验证基准

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。

Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17478 2026-06-17 cs.CL cs.AI 新提交 73%

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器

Kexin Chen, Yi Liu, Haonan Zhang, Yanhui Li, Xinyu Deng, Dongxia Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01101 2026-06-16 cs.AI cs.CL cs.SD eess.AS 版本更新 73%

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗

Shakeel Sheikh, Patrick Marmaroli, MD Sahidullah, Slim Ouni, Fabrice Hirsch, Goncalo Leal, Bjorn W Schuller

机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) Microsoft / Vocametrix(微软 / Vocametrix) IAI, TCG CREST(IAI,TCG CREST) Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19728 2026-06-16 cs.LG cs.AI 73%

Enabling Granular Subgroup Level Model Evaluations by Generating Synthetic Medical Time Series

通过生成合成医疗时间序列实现细粒度亚组级别模型评估

Mahmoud Ibrahim, Bart Elen, Chang Sun, Gökhan Ertaylan, Michel Dumontier

机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University(数据科学研究所,科学与工程学院,马斯特里赫特大学) Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University(先进计算科学系,科学与工程学院,马斯特里赫特大学) VITO(VITO研究院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,利用合成ICU时间序列数据训练和评估预测模型,特别是在细粒度人口亚组中。引入Enhanced TimeAutoDiff,通过分布对齐惩罚增强潜在扩散目标,减少真实-合成与真实-真实评估差距,提升亚组模型评估的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00947 2026-06-15 cs.LG cs.AI 版本更新 73%

Silent Failures in Federated Personalization of Foundation Models

联邦基础模型个性化中的静默失败

YongKyung Oh, Alex Bui

机构 * Medical & Imaging Informatics (MII) Group, University of California, Los Angeles (UCLA)(医学与影像信息学(MII)组,加州大学洛杉矶分校(UCLA))

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出联邦基础模型个性化中因隐私约束导致的一类信任失败——静默失败,包括偏差放大、公平性崩溃和对齐侵蚀,并引入六种静默失败模式的分类法,强调隐私保护训练不足以保障可信部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28591 2026-06-15 cs.CL cs.AI 版本更新 73%

Models That Know How Evaluations Are Designed Score Safer

知道评估如何设计的模型更安全

Katharina Deckenbach, Haritz Puerto, Jonas Geiping, Sahar Abdelnabi

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、图宾根马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调模型使其掌握评估的元知识(如可验证结构或道德困境),发现这会导致模型在安全基准测试中表现更安全,从而引入了一种独立于显式记忆或评估意识的新混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07532 2026-06-10 cs.CL cs.AI 版本更新 73%

Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models

原则性智能体辩论:针对大型语言模型谄媚减少的对抗性仲裁

Sam Ryan

机构 * Novel Systems Engineering LLC(新型系统工程有限公司)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出原则性智能体辩论(PAD)多智能体架构,通过仲裁两个对立倾向的模型并盲评其论点,在SycophancyEval上显著降低谄媚偏差,最佳变体准确率达48.5%。

Comments 25 pages, 3 figures. Code and data available at github.com/NovelSystems/CANDOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23099 2026-06-03 cs.LG cs.AI stat.ML 73%

ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation

ProEval:生成式AI评估的主动故障发现与高效性能估计

Yizheng Huang, Wenjun Zeng, Aditi Kumaresan, Zi Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出ProEval框架,利用预训练高斯过程进行贝叶斯积分和超水平集采样,实现高效性能估计和主动故障发现,在推理、安全对齐和分类基准上以8-65倍更少样本达到1%误差内估计。

Comments Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00033 2026-06-02 cs.CY cs.AI 73%

Make Mechanistic Interpretability Auditable: A Call to Develop Guidelines via Continuous Collaborative Reviewing

使机制可解释性可审计:呼吁通过持续协作评审制定指南

Michael Lan, Narmeen Fatimah Oozeer, Chaithanya Bandi, Philip Quirke, Austin Meek, Fazl Barez, Amirali Abdullah

机构 * University of Delaware(德克萨斯大学) University of Oxford(牛津大学) ThoughtWorks

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 针对机制可解释性(MI)实验缺乏标准化审计系统的问题,提出通过持续协作评审平台、专家验证指南和基于来源的审计系统来建立可审计框架,以提升其在AI安全等高风险领域的可信度。

Comments Accepted at ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16310 2026-06-02 cs.CR cs.AI cs.CL 73%

Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation

Agent工具编排泄露更多:数据集、基准测试与缓解措施

Yuxuan Qiao, Dongqin Liu, Hongchang Yang, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究LLM代理在编排多个工具时泄露敏感结论的风险(TOP-R),构建了包含1000个实例的基准TOP-Bench,并提出TOP-Align后训练方法以缓解泄露。

Comments 17 pages, 2 figures. Dataset and code are available at https://github.com/1Ponder/TOP-R

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17532 2026-06-02 cs.CL cs.LG 73%

OncoReason: Structuring Clinical Reasoning in LLMs for Robust and Interpretable Survival Prediction

OncoReason: 在大语言模型中构建临床推理以实现稳健且可解释的生存预测

Raghu Vamshi Hemadri, Geetha Krishna Guruju, Kristi Topollai, Anna Ewa Choromanska

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出统一多任务学习框架,通过监督微调、思维链提示和强化学习三种对齐策略,使自回归大语言模型在MSK-CHORD数据集上联合进行二元生存分类、连续生存时间回归和自然语言理由生成,实现可解释的生存预测。

Comments This manuscript is withdrawn to allow careful review and correction of bibliographic issues identified after submission, including references that could not be adequately verified. These matters should be resolved before further circulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30654 2026-06-01 cs.CL cs.AI cs.HC 73%

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

EUDAIMONIA: 评估AI中的不良动态

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 73%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29368 2026-05-29 cs.CL cs.AI 73%

SURGENT: A Surgical Multi-Agent Assistance System Across the Perioperative Workflow

SURGENT: 一种跨围手术期工作流程的手术多智能体辅助系统

Dongsheng Shi, Yue Li, Xin Yi, Yongyi Cui, Huawei Feng, Linlin Wang

机构 * East China Normal University(华东师范大学) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出SURGENT手术多智能体辅助系统,结合思维树规划器、多科室协作智能体和检索增强推理,通过新型记忆设计管理长期患者病史和短期工作摘要,在五项围手术期任务中优于基线LLM和现有医疗多智能体框架。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24636 2026-05-27 cs.AI cs.CL 73%

GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration

GlobalDentBench:一个用于评估牙科领域大语言模型临床推理能力并包含专家校准的多国基准

Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen, Shuzhi Deng, Wenjing Yi, Chunfeng Luo, Hexian Zhang, Junying Chen, Tianrui Liu, Zhuhui Bai, Zixu Zhang, Pradeep Singh, Xiang Liu, Jianquan Li, Nhan L Tran, Falk Schwendicke, Zuolin Jin, Lijian Jin, Liangyi Chen, Wei-fa Yang, Benyou Wang, Junwen Wang, Shan Jiang

机构 * Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Department of Periodontology, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)牙周科) Beijing Institute of Collaborative Innovation(北京协同创新研究院) Department of Orthodontics, Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)正畸科) Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University, Shenzhen, China(南方医科大学深圳口腔医院(平山)) College of Future Technology, Peking University(北京大学未来技术学院) Freedom AI New Cornerstone Science Laboratory, National Biomedical Imaging Center, State Key Laboratory of Membrane Biology, Institute of Molecular Medicine, Peking-Tsinghua Center for Life Sciences, College of Future Technology, Peking University, Beijing 100871, China(新基石科学实验室、国家生物医学成像中心、膜生物学国家重点实验室、分子医学研究院、北京大学未来技术学院、生命科学中心,北京大学,北京100871,中国) IDG/McGovern Institute for Brain Research, Peking University, Beijing 100871, China(IDG/ McGovern脑科学研究院,北京大学,北京100871,中国) Division of Oral and Maxillofacial Surgery, Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院口腔颌面外科系) Shenzhen Loop Area Institute(深圳河套学院) Department of Cancer Biology, Mayo Clinic Arizona, 5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA(梅奥诊所亚利桑那分部癌症生物学部门,5777 E. Mayo Blvd., IERB-3-504A, Phoenix, Arizona, 85054, USA) Department of Conservative Dentistry, Periodontology and Digital Dentistry, LMU University Hospital, LMU Munich, Munich, Germany(慕尼黑大学医院保守牙科、牙周病学和数字牙科部门,慕尼黑,德国,慕尼黑大学) Division of Periodontology & Implant Dentistry, Faculty of Dentistry, The University of Hong Kong, Hong Kong, SAR, China(香港大学牙科学院牙周病学与种植牙科系,香港,中国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出首个跨国牙科基准GlobalDentBench,包含14个专科、88个国家的8978道专家验证题目,评估三种推理层次,揭示当前大语言模型在牙科临床推理中性能随复杂度下降且存在高风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20296 2026-05-21 cs.LG cs.AI 73%

Spectral Unforgetting: Post-Hoc Recovery of Damaged Capabilities Without Retraining

谱遗忘:无需重新训练的后验能力恢复

Aarash Abro, Muhammad Tahir

机构 * Zeta Labs(泽塔实验室) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在目标任务微调过程中因训练数据未显式威胁而退化的能力现象,提出了一种仅使用预训练检查点和微调后检查点的后验修复方法,通过谱修复技术恢复受损能力并保留目标任务收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13059 2026-05-19 cs.CY cs.AI cs.ET 73%

Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models

在评估人工智能模型时优先考虑高后果生物能力

Jaspreet Pannu, Doni Bloomfield, Alex Zhu, Robert MacKnight, Gabe Gomes, Anita Cicero, Thomas V. Inglesby

机构 * Center for Health Security, Bloomberg School of Public Health, Johns Hopkins University(健康安全中心,公共卫生学院,约翰霍普金斯大学) Department of Health Policy, Stanford School of Medicine, Stanford University(健康政策系,斯坦福医学院,斯坦福大学) Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University(威尔顿·E·斯科特能源创新研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文基于人工智能模型的安全性、安全性和伦理问题,提出在评估人工智能模型时应优先考虑高后果风险,如大规模公众危害(如大流行病),并应在部署前进行评估,以建立针对性的AI安全评估方法,确保工具的安全性和防止潜在危害。

Comments 9 pages, 1 figure, 3 tables, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14087 2026-05-18 cs.CL cs.LG 73%

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

对大语言模型毒性进行测量与缓解:一项全面的复制研究

Mokshit Surana, Archit Rathod, Akshaj Satishkumar

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过复制研究评估DExperts在缓解显性毒性中的有效性,发现其在显性毒性基准上安全性接近完美,但对隐性仇恨言论存在脆性,并引入了10倍的延迟惩罚。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13329 2026-05-14 cs.CL cs.AI 73%

Tracing Persona Vectors Through LLM Pretraining

通过LLM预训练追溯人格向量

Viktor Moskvoretskii, Dominik Glandorf, Jorge Medina Moreira, Tanja Käser, Robert West

机构 * EPFL(苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM预训练中人格向量的形成机制,发现其在早期阶段就形成并持续优化,为模型安全性和可控性提供新视角。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 73%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15161 2026-05-14 cs.CL cs.AI 73%

Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems

用于医疗对话系统可靠评估的自动化评分标准

Yinzhu Chen, Abdine Maiga, Hossein A. Rahmani, Emine Yilmaz

机构 * AI Center, University College London(伦敦大学学院人工智能中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多智能体框架,用于自动生成实例特定的评估评分标准,通过权威医学证据生成可验证的细粒度评估标准,并在HealthBench和LLMEval-Med数据集上取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 73%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05835 2026-05-08 cs.CL cs.CY 73%

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

语言模型中的评估意识对行为影响有限

Amelie Knecht, Lucas Florin, Thilo Hagendorff

机构 * University of Stuttgart(斯图加特大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20055 2026-05-05 cs.CL cs.AI 73%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24966 2026-04-30 cs.CY cs.AI 73%

Risk Reporting for Developers' Internal AI Model Use

为开发者内部AI模型使用进行风险报告

Oscar Delaney, Sambhav Maheshwari, Joe O'Brien, Theo Bearman, Oliver Guest

机构 * IAPS

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了前沿AI公司内部部署先进模型的风险管理,提出统一的风险报告标准,帮助开发者和监管机构识别和管理内部AI使用中的潜在风险。

Comments 31 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25067 2026-04-30 cs.MA cs.AI cs.LG 73%

Frontier Coding Agents Can Now Implement an AlphaZero Self-Play Machine Learning Pipeline For Connect Four That Performs Comparably to an External Solver

前沿编码代理如今可以实现一个AlphaZero自博弈机器学习流水线用于连接四游戏,其性能可与外部求解器相媲美

Joshua Sherwood, Ben Aybar, Benjamin Kaplan

机构 * Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准测试,评估前沿编码代理自主实现AlphaZero式机器学习流水线的能力,通过简洁任务描述而非完整前序工作参考,评估连接四游戏AI性能,发现Claude Opus 4.7在七次试验中胜过Pons求解器,其他代理表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24623 2026-04-28 cs.AI cs.IR cs.LG 73%

XGRAG: A Graph-Native Framework for Explaining KG-based Retrieval-Augmented Generation

XGRAG:一种用于基于知识图谱检索增强生成的图原生解释框架

Zhuoling Li, Ha Linh Hong Tran Nguyen, Valeria Bladinieres, Maxim Romanovsky

机构 * Berlin Technology Centre(柏林技术中心) Deutsche Bank(德意志银行)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 XGRAG通过图基扰动策略生成因果解释,提升GraphRAG系统的可解释性,在多个问答数据集上实现解释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 73%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG 73%

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22760 2026-04-28 cs.IR cs.AI cs.CL 73%

Quantifying Divergence in Inter-LLM Communication Through API Retrieval and Ranking

通过API检索和排序量化跨LLM通信中的分歧

Eyhab Al-Masri

机构 * School of Engineering and Technology(工程与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个统一的基准框架,量化在相同任务下不同LLM在API发现和排序上的差异。研究发现结构化任务稳定性较高,而开放性任务分歧显著,结果为多代理系统中可靠性感知的协调提供了依据。

Comments AAAI 2026 Conference (LAMAS Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏