arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 114 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2606.03136 2026-06-03 cs.CR cs.CL 57%

PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

PsychoPass: 多轮对抗性LLM对话的几何轮廓分析

Muberra Ozmen, Subhabrata Majumdar

机构 * Coveo Montreal, QC, Canada(加拿大蒙特利尔 Coveo) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出PsychoPass框架,通过提取对话轨迹在嵌入空间中的几何特征,在有害内容生成前预测多轮越狱攻击,并发现早期几何信号具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 1 篇

2606.03777 2026-06-03 cs.AI cs.CR q-fin.RM 57%

From Control Boundary to Insurance Claim: Reconstructing AI-Mediated Losses Through the CER Framework

从控制边界到保险索赔:通过CER框架重构AI中介损失

Alex Leung, Rex Zhang, Kentaroh Toyoda, SiewMei Loh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出CER框架(控制边界、证据重构、保险响应),用于诊断和重构由生成式或代理式AI系统导致的损失,以支持保险索赔。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 14 篇

2606.03022 2026-06-03 cs.CL cs.AI 81%

Hallucinations as Orthogonal Noise: Inference-Time Manifold Alignment via Dynamic Contextual Orthogonalization

幻觉作为正交噪声:通过动态上下文正交化实现推理时流形对齐

Mingkuan Zhao, Wentao Hu, Tianchen Huang, Yuheng Min, Suquan Chen, Yide Gao, Yanbo Zhai, Shuangyong Song, Xuelong Li

机构 * Xi’an Jiaotong University(西安交通大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom AI Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于线性表示假设的几何框架,将大语言模型幻觉解释为残差流语义流形的正交噪声,并引入推理时干预方法动态上下文正交化(DCO),通过层间Z分数抑制机制选择性地衰减异常正交分量,在保持知识记忆的同时提升上下文忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03460 2026-06-03 cs.CV 78%

From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring

从3D感知到安全推理:基于图的实时地下矿井监控框架

Pasindu Ranasinghe, Simit Raval, Dibyayan Patra, Bikram Banerjee, Ismet Canbulat

专题命中 幻觉与事实性 :safety(title,abstract)

AI总结 提出一个结合3D语义感知、不确定性异常检测、规则检查、设备端LLM推理和GraphRAG记忆分析的连续监控框架,通过场景图和时序图实现结构化安全推理,在115个危险场景中达到93%的覆盖率和92.7%的感知精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 78%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 幻觉与事实性 :alignment(title,abstract)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03130 2026-06-03 cs.LG 70%

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 幻觉与事实性 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07768 2026-06-03 cs.CV cs.AI cs.LG cs.MM 62%

PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification

PAND:面向提示的邻域蒸馏用于轻量级细粒度视觉分类

Qiuming Luo, Yuebing Li, Feng Li, Chang Kong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出PAND框架,通过提示感知语义校准和邻域感知结构蒸馏,将大型视觉语言模型知识迁移至轻量网络,在细粒度分类任务上超越现有方法。

Comments Accepted by ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16275 2026-06-03 cs.CL cs.AI 62%

SeSE: Black-Box Uncertainty Quantification for Large Language Models Based on Structural Information Theory

SeSE: 基于结构信息理论的大语言模型黑盒不确定性量化

Xingtao Zhao, Hao Peng, Dingli Su, Xianghua Zeng, Chunyang Liu, Jinzhi Liao, Philip S. Yu

机构 * School of Cyber Science and Technology Beihang University(北航信息科学与技术学院) School of Computer Science and Engineering Beihang University(北航计算机科学与工程学院) Didi Chuxing(滴滴出行) Laboratory for Big Data and Decision National University of Defense Technology(国防科技大学大数据与决策实验室) Department of Computer Science University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SeSE框架,通过构建语义空间的最优层次抽象并计算结构熵,实现大语言模型的黑盒不确定性量化,理论推广了语义熵并在长文本生成中优于现有方法。

Comments Accepted by UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03299 2026-06-03 cs.CL 57%

LLM-XTM: Enhancing Cross-Lingual Topic Models with Large Language Models

LLM-XTM:利用大语言模型增强跨语言主题模型

Minh Chu Xuan, Tien-Phat Nguyen, Linh Ngo Van, Dinh Viet Sang, Nguyen Thi Ngoc Diep, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) VNU University of Engineering and Technology(VNU工程技术大学) Monash University(墨尔本大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出LLM-XTM框架,通过LLM引导的主题精炼与自一致性不确定性量化,以黑盒方式稳定提升跨语言主题模型的连贯性和对齐性,减少对双语资源的依赖。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03814 2026-06-03 cs.AI 57%

Leveraging BART to Assess CS1 C++ Programming Assignments using Rubric-based Criteria

利用BART基于评分标准评估CS1 C++编程作业

Kelsey Rainey, Jesse Roberts

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 提出基于评分标准的多任务微调BART模型,用于自动评分C++编程作业,通过联合预测数值分数和等级区间并匹配分布,使评分更接近教师行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03755 2026-06-03 cs.AI 57%

LAP: An Agent-to-Instrument Protocol for Autonomous Science

LAP:面向自主科学的智能体-仪器协议

Linwu Zhu, Liqiang Gao, Yan Chen, Dan Zhu, Jian Huang

机构 * Shiyanjia Lab(实验之家实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 针对自主科学中智能体与物理仪器连接碎片化的问题,提出LAP协议,通过InstrumentCard、预留机制、安全围栏握手和测量结果模式,实现有状态、安全关键的操作,并与现有生态系统兼容。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03728 2026-06-03 cs.CL cs.IR 57%

Re-Ranking Through an Attribution Lens for Citation Quality in Legal QA

通过归因视角对法律问答中的引用质量进行重排序

Mohamed Hesham Elganayni, Selim Saleh

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 针对法律问答中检索增强生成系统的引用质量问题,提出基于扰动归因分数训练轻量级交叉编码器对候选段落重排序,显著提升引用忠实度并与专家答案对齐。

Comments 11 pages, 4 tables, 1 figure. Published at ASAIL 2026 (8th Workshop on Automated Semantic Analysis of Information in Legal Text), co-located with ICAIL 2026, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03179 2026-06-03 cs.CL 57%

HyperPatch: Sequential Knowledge Editing Under n-ary Structural Drift

HyperPatch: n元结构漂移下的顺序知识编辑

Yu-Kai Chan, Wen-Sheng Lien, Dong-Ting Yao, Bo-Kai Ruan, Kwan-Yeung Lin, Hong-Han Shuai, Meng-Fen Chiang

机构 * National Yang Ming Chiao Tung University

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 针对非平稳环境中n元事件顺序更新引发的结构漂移问题,提出HyperPatch框架,通过超图流形上的稳定性建模,实现参数保留的知识编辑,在MQuAKE-CF和MQuAKE-T基准上分别取得96.24%和21.06%的跳步准确率相对提升。

Comments Accepted to Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07366 2026-06-03 cs.LG 57%

Flow Learners for PDEs: Toward a Physics-to-Physics Paradigm for Scientific Computing

PDE的流学习器:迈向科学计算的物理到物理范式

Yilong Dai, Shengyu Chen, Xiaowei Jia, Runlong Yu

机构 * The University of Alabama(阿拉巴马大学) University of Pittsburgh(匹兹堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出流学习器(flow learners)范式,通过参数化传输向量场并积分生成轨迹,将PDE求解从状态预测转向物理上允许的未来传输建模,实现连续时间预测、不确定性量化及物理感知求解器设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15780 2026-06-03 stat.AP cs.LG 57%

Enhanced Renewable Energy Forecasting using Context-Aware Conformal Prediction

基于上下文感知保形预测的增强型可再生能源预测

Alireza Moradi, Mathieu Tanneau, Reza Zandehshahvar, Pascal Van Hentenryck

机构 * EPFL, Switzerland(瑞士联邦理工学院) Ghent University, Belgium(比利时根特大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 提出上下文感知保形预测(CACP)框架,通过加权历史观测校准预测区间,无需重新训练模型,提升可再生能源预测的可靠性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03593 2026-06-03 cs.SE cs.RO 50%

Making Embodied AI Reliable: A Community Agenda from Testing to Formal Verification

使具身AI可靠:从测试到形式验证的社区议程

Xi Zheng, Dulanga Weerakoon, Yintong Huo, Teresa Yeo, Guy Van Den Broeck, Vijay Ganesh, Daniel Neider, Biplav Srivastava, Ivan Ruchkin, Archan Misra, Corina Pasareanu

机构 * University of Waterloo(滑铁卢大学) Universityinceton University(普林斯顿大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文基于AAAI'26 Bridge Program讨论,提出通过集成测试、形式验证和运行时保证的神经符号方法,解决具身AI在开放世界中的生命周期可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 2 篇

2606.03399 2026-06-03 cs.CL cs.CR 57%

Selective Token-Level Cryptographic Redaction for Privacy-Preserving Clinical Deployment of Large Language Models

选择性令牌级密码学编辑用于大型语言模型的隐私保护临床部署

Farhan Sheth, Ziyuan Yang, Yongying Lan, Si Yong Yeo

机构 * MedVisAI Lab, Singapore(新加坡MedVisAI实验室) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, China(中国上海交通大学医学院瑞金医院) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(新加坡南洋理工大学Lee Kong Chian医学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 提出HERALD框架,通过令牌级密码学编辑仅加密敏感令牌,在保护隐私的同时保持下游模型效用,在分类和医疗问答任务上接近明文性能。

Comments 33 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03190 2026-06-03 cs.HC 50%

Focused on the User, Overlooking the Risks: Security and Privacy Understandings, Practices and Challenges of Independent Chinese AI Agent Developers

聚焦用户,忽视风险:中国独立AI代理开发者的安全与隐私理解、实践与挑战

Shuning Zhang, Mingyao Xu, Zhixin Huang, Yutong Jiang, Rongjun Ma, Yuting Yang, Xin Yi, Kanye Ye Wang, Hewu Li

专题命中 隐私与版权 :safety(abstract)

AI总结 通过访谈28名中国独立AI代理开发者,发现他们以用户为中心,关注面向用户的安全风险(如有害内容),但对安全漏洞意识薄弱,依赖临时手动防护和非正式沟通,缺乏正式工具和流程,主要受限于缺乏安全培训、工具和平台指导。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 33 篇

2606.03648 2026-06-03 cs.CL cs.AI 81%

Safety Measurements for Fine-tuned LLMs Should be Grounded in Capability

微调大语言模型的安全性测量应基于能力

Krishnapriya Vishnubhotla, Hillary Dawkins, Isar Nejadgholi, Svetlana Kiritchenko

机构 * National Research Council, Canada(加拿大国家研究理事会)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 通过将微调锚定于特定能力目标,多维度评估微调对模型能力和安全性的影响,发现微调模型对安全提示可能产生不连贯输出、自动安全判断不可靠,且结论因安全基准和评估者而异。

Comments 8 pages plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03180 2026-06-03 cs.CV cs.CL cs.LG 81%

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

GLINT:面向细粒度放射学表征的稀疏门控视觉-语言对齐

Jonggwon Park, Seongeun Lee, Junhyun Park, Hannah Yun, Hyunwoong Kim, Sohyun Jeong, Hyewon Kang, Byungmu Yoon, Kyoyun Choi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 针对放射学图像-报告全局对齐与局部病灶尺度不匹配的问题,提出GLINT框架,通过稀疏门控对齐和密集特征正则化实现零样本分类、定位和分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29930 2026-06-03 cs.AI cs.CY cs.HC 81%

Toward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and Alignment

迈向理解自我与他人的AI系统:人类认知多样性与世界模型对齐的多阶段推理框架

Toru Takahashi

机构 * Human Informatics and Systems Lab, Doshisha University(立命馆大学人机系统实验室) Linked Open Data Initiative, NPO Keio Research Institute at SFC(庆应义塾大学SFC研究所开放数据计划) Stroly Inc(Stroly公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 提出多阶段推理框架(MIM),通过阶段形成空间、前景化场、主体特定轮廓状态和状态表示对齐图,形式化异质世界模型的产生,并将世界模型对齐重新定义为使异质表示相互可处理的问题,而非强制一致。

Comments 87 pages. Revised version with a refined abstract emphasizing disagreement as a late-stage phenomenon, target admissibility, processability, and the methodological abstraction used to compare humans, AI systems, and institutional decision procedures under shared information-theoretic constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03644 2026-06-03 cs.LG 79%

Spatial Transcriptomics-Guided Alignment Enhances Molecular Profiling in Pathology Foundation Model

空间转录组学引导的对齐增强病理基础模型中的分子分析

Fengtao Zhou, Yingxue Xu, Zhengyu Zhang, Yihui Wang, Zhengrui Guo, Ling Liang, Jiabo Ma, Cheng Jin, Ziyi Liu, Huajun Zhou, Hongyi Wang, Du Cai, Chenglong Zhao, Xi Wang, Can Yang, Yu Wang, Wenbin Li, Feng Gao, Zhe Wang, Zhenhui Li, Xiuming Zhang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科学与技术大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Jinfeng Laboratory, Chongqing, China(金风实验室,重庆,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出STAMP框架,利用空间转录组数据通过通路感知对齐策略增强病理基础模型的分子感知能力,并在多层级评估中验证其临床效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31381 2026-06-03 cs.CL 79%

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

LLM 法官在安全标准和危害类别上不一致地存在分歧

Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij, Isar Nejadgholi

机构 * National Research Council, Canada(加拿大国家研究理事会) IMDA, Singapore(新加坡信息通信技术发展局)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。

Comments 8 pages plus appendices, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23099 2026-06-03 cs.LG cs.AI stat.ML 73%

ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation

ProEval:生成式AI评估的主动故障发现与高效性能估计

Yizheng Huang, Wenjun Zeng, Aditi Kumaresan, Zi Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出ProEval框架,利用预训练高斯过程进行贝叶斯积分和超水平集采样,实现高效性能估计和主动故障发现,在推理、安全对齐和分类基准上以8-65倍更少样本达到1%误差内估计。

Comments Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02852 2026-06-03 cs.SE 71%

Dependency-Guided Repository-Level C-to-Rust Translation with Reinforcement Alignment

依赖引导的仓库级C到Rust翻译与强化对齐

Jia Feng, Wenjie Gan, Cuiyun Gao, Chaozheng Wang, Feng Luo, Xin Xia, Ge Li, Kui Liu

专题命中 安全评测 :alignment(title)

AI总结 提出DepTrans框架,通过强化对齐语法训练和依赖引导迭代精炼,实现仓库级C到Rust的高效翻译,编译成功率和计算准确性分别提升22.8和17.3个百分点。

Comments Accepted by FSE 2026 Industry

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03128 2026-06-03 cs.CR cs.AI cs.CL cs.LG 67%

Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation

解耦式智能合约审计:通过蒸馏与聚合的轻量级LLM框架

Bagus Rakadyanto Oktavianto Putra, Muhamad Risqi Utama Saputra, Widyawan, Guntur Dharma Putra

机构 * University of Indonesia(印度尼西亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于轻量级开源LLM(0.6B-4B参数)的解耦式智能合约审计框架,通过rsLoRA、知识蒸馏和链式验证聚合策略,在漏洞检测中达到98.25%准确率,优于7B-34B参数模型。

Comments 12 pages, 4 figures, 5 tables. Accepted to IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23055 2026-06-03 cs.LG cs.AI cs.CL 67%

Decomposing and Measuring Evaluation Awareness

分解与度量评估意识

Changling Li, Terry Jingchen Zhang, Jie Zhang, Zhijing Jin, Sahar Abdelnabi, Maksym Andriushchenko

机构 * ETH Zürich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究院) Tübingen AI Center(图宾根人工智能中心) University of Toronto & Vector Institute(多伦多大学及向量研究所) EuroSafeAI(欧洲安全人工智能)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究借鉴社会心理学,将评估意识分解为环境与模型两部分,通过EvalAwareBench基准测试发现识别率取决于模型与基准的配对,且识别很少导致行为改变,安全评估比能力评估更易受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16666 2026-06-03 cs.AI cs.CY cs.LG 67%

Towards a Science of AI Agent Reliability

迈向AI代理可靠性的科学

Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出十二个具体指标,从一致性、鲁棒性、可预测性和安全性四个维度分解AI代理的可靠性,并通过实验揭示能力提升仅带来可靠性小幅改进。

Comments Accepted at ICML 2026. Interactive dashboard available at: https://hal.cs.princeton.edu/reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19684 2026-06-03 cs.LG cs.AI cs.CL cs.CV 67%

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

CoMPAS3D: 一个用于交互动作的数据集和基准

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica Lim

机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。

Comments https://rosielab.github.io/compas3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20508 2026-06-03 cs.MA cs.AI cs.CL 66%

Measuring Weak-to-Strong Legibility of Reasoning Models

衡量推理模型的弱到强可读性

Dani Roytburg, Shreya Sridhar, Daphne Ippolito

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。

Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏