arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 68 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 68 篇

2606.31644 2026-07-07 cs.CL cs.CY 新提交 81%

Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

大语言模型中的道德安全:揭示对困惑线索的表演性遵从

Mohammadamin Shafiei, Shuyue Stella Li, Yulia Tsvetkov

机构 * University of Milan(米兰大学) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究提出“表演性遵从”概念,揭示大语言模型在道德困境中当身份标签被隐藏时公平性显著下降,并引入线索变化方法和“线索可见性差距”指标来区分真实与表演性道德安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 79%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交 79%

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 79%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 79%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 79%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09126 2026-07-07 cs.SE cs.LG 79%

Towards Trustworthy AI Software Development Assistance

迈向可信AI软件开发辅助

Daniel Maninger, Krishna Narasimhan, Mira Mezini

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出可信AI软件开发助手的架构,通过基础LLM训练、图表示和模块化框架提升代码质量和安全性。

Comments 6 pages, 1 figure; to be published in New Ideas and Emerging Results (ICSE-NIER'24), April 14-20, 2024, Lisbon, Portugal; updated version to reflect the information provided by ACM

Journal ref NIER@ICSE (2024) 112-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04451 2026-07-07 cs.CV 新提交 78%

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

CCFM:用于安全关键场景生成的碰撞约束流匹配

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(纽约州立大学石溪分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究自动驾驶车辆规划器在安全关键闭环仿真中的评估,提出CCFM框架,通过硬物理约束保证精确碰撞控制,含碰撞选择器、硬约束和碰撞约束流匹配采样器,性能超基线。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03447 2026-07-07 cs.IR cs.AI cs.CL 新提交 76%

TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation

TRIAGE:可信检索工具与图评估

Axel TahmasebiMoradi, Lucas Schott, Martin Royer

机构 * IRT-SystemX(SystemX研究院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 75%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 74%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04613 2026-07-07 cs.AI cs.CR 新提交 70%

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。

Comments Technical companion report. 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 70%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22267 2026-07-07 cs.LG eess.SP 版本更新 70%

Towards a more realistic evaluation of machine learning models for bearing fault diagnosis

迈向更现实的机器学习模型在轴承故障诊断中的评估

João Paulo Vieira, Victor Afonso Bauler, Rodrigo Kobashikawa Rosa, Danilo Silva

机构 * Department of Electrical and Electronic Engineering, Federal University of Santa Catarina(电气与电子工程系,圣卡塔琳娜联邦大学) Department of Mechanical Engineering, Federal University of Santa Catarina(机械工程系,圣卡塔琳娜联邦大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了振动基轴承故障诊断中数据泄漏问题,提出无泄漏评估方法,改进分类任务为多标签问题,并通过四个数据集验证了方法对提升工业故障诊断系统可靠性的重要性。

Comments To appear in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114640

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04689 2026-07-07 cs.RO cs.CV 新提交 67%

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving

一种用于自动驾驶的可靠上下文感知和时间规划框架

Argho Dey, Yunfei Yin, Swachha Ray, Md Minhazul Islam, Zheng Yuan, Sijing Xiong, Hongyu Liu, Zhiqiu Huang

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 研究自动驾驶中车载传感退化时的可靠感知与规划问题,提出RCT-AD框架,通过显式建模特征质量和时间一致性,经可靠上下文感知模块和时间轨迹规划器等提升感知、预测及规划能力。

Comments Submitted to IEEE Transactions on Intelligent Transportation Systems. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03991 2026-07-07 cs.LG cs.CL 新提交 62%

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

知道何时停止:预测文本到SQL执行一致性收敛

Yaron Anavi, Mor Aisenberg, Nadav Nesher, Elena Khabibullina, Isabella Cattinelli

机构 * GIGASPACES

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 62%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 62%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02755 2026-07-07 cs.LG cs.AI 新提交 62%

Out-of-Distribution Generalization of Risk Aversion in Language Models

语言模型中风险规避的分布外泛化

Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie, Andrew Lin, Abhitej Bokka, Elliott Thornley

专题命中 安全评测 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 研究训练人工智能在资源方面规避风险能否泛化至高风险场景。通过引入RiskAverseOOD基准测试,用多种方法使模型在低风险时规避风险,发现其能部分泛化至高风险,不同规模和模型家族也有类似效果,但一致性不足。

Comments ICML 2026 Agents in the Wild workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18580 2026-07-07 cs.AI cs.LG 版本更新 62%

When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State

当结果看似正确但纪律却失败:基于轨迹的评估在隐藏对手状态下的应用

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于轨迹的评估方法,用于评估在隐藏对手状态下的行为纪律稳定性,通过轨迹诊断、机制分离和转移测试来改进强化学习策略,特别是在酒店定价和隐藏预算竞标任务中。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14163 2026-07-07 cs.CL cs.AI 版本更新 62%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 62%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06607 2026-07-07 cs.MA cs.AI cs.LG 版本更新 62%

Multi-Agent Reinforcement Learning for V2X Resource Allocation: Disentangling MARL Challenges Through Benchmarking

用于车联网资源分配的多智能体强化学习:通过基准测试解开多智能体强化学习挑战

Siyuan Wang, Lei Lei, Pranav Maheshwari, Sam Bellefeuille, Kan Zheng

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) College of Electrical Engineering and Computer Sciences, Ningbo University(宁波大学电气与电子工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将车联网资源分配建模为多智能体干扰博弈层次结构,构建基准学习任务与数据集,评估多种多智能体强化学习算法,揭示不同范式优缺点,为评估算法提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22240 2026-07-07 cs.LG cs.AI 版本更新 62%

EvoXplain: When Machine Learning Models Agree on Predictions but Disagree on Why -- Measuring Mechanistic Multiplicity Across Training Runs

EvoXplain:当机器学习模型在预测上达成一致但在原因上存在分歧时——衡量跨训练运行的机制多样性

Chama Bensmail

机构 * University of Hertfordshire(赫特福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究机器学习模型预测一致但解释不同的问题,引入EvoXplain框架,通过分析训练和模型选择过程中解释样本,判断解释是否唯一确定,揭示平均共识与单一训练模型的关系,将可解释性视为训练管道属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 62%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19636 2026-07-07 cs.LG cs.AI 版本更新 62%

Exploring the Rashomon Set for Concept-Based Models

探索基于概念模型的罗生门集

Shihan Feng, Cheng Zhang, Michael Xi, Ethan Hsu, Lesia Semenova, Chudi Zhong

机构 * UNC Chapel Hill(UNC夏洛特山分校) Rutgers University(罗格斯大学) Duke University(杜克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究在如概念瓶颈模型的复杂假设空间中探索罗生门集的问题,提出结合并行适配器构建、检查点方案和概念多样性目标的方法,能从单训练过程生成多个准确模型,有更好多样性且省内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04655 2026-07-07 cs.CL 新提交 57%

FormalRx: Rectify and eXamine Semantic Failures in Autoformalization

FormalRx:纠正和检查自动形式化中的语义错误

Haocheng Wang, Baiyu Huang, Yingjia Wan, Xiao Zhu, Xiaoyang Liu, Yinya Huang, Zhijiang Guo

机构 * LARK Lab, HKUST(GZ)(香港科技大学(广州)LARK实验室) ETH Zurich(苏黎世联邦理工学院) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) HKUST(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究自动形式化中语义对齐问题,提出FormalRx框架,核心是SCI错误分类法,能实现对齐判定、错误分类、定位及纠正,通过实例验证性能优于基线,助力自动形式化系统诊断与改进。

Comments 44 pages, 5 figures. Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04640 2026-07-07 cs.CL 新提交 57%

Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models

先错后对:对齐语言模型中的后期挽救与接口故障

Jiaqi Deng

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究对齐语言模型中正确性的构建,用分层差分轨迹识别错误倾向,发现中间层会短暂倾向错误答案,后期层校正挽救。通过实验验证该现象,并得出对齐放大、预测压缩失败、可训练及在自然语言I/O中存在等结论。

Comments 16 pages, 10 figures. Code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04600 2026-07-07 cs.LG 新提交 57%

Measuring What Matters: A Unified Evaluation Framework for GNN Explainability

衡量重要因素:GNN可解释性的统一评估框架

Francesco Paolo Nerini, Mirko Zaffaroni, Paolo Baracco, Gabriele Ciravegna, Alan Perotti

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Intesa Sanpaolo AI Research(Intesa Sanpaolo人工智能研究) Anti Financial Crime Digital Hub(反金融犯罪数字中心) Intesa Sanpaolo Innovation Center(Intesa Sanpaolo创新中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 研究为G-XAI引入统一量化基准框架,无需真实假设,形式化表格可解释性指标,通过大规模基准研究确定跨指标和任务的帕累托前沿解释器并给出可用性指南。

详情

展开后加载摘要…

URL PDF HTML 收藏