arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 158 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 158 篇

2605.09045 2026-07-01 cs.AI cs.CR cs.SE 版本更新 91%

Containment Verification: AI Safety Guarantees Independent of Alignment

包含性验证:与对齐无关的AI安全保证

Royce Moon, Lav R. Varshney

机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13154 2026-06-23 cs.CL 版本更新 90%

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

对齐否决:安全训练如何压制LLM中的文化知识

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新 88%

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07445 2026-06-09 cs.CL cs.LG 版本更新 88%

Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning

少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05518 2026-07-23 cs.CR cs.AI 版本更新 88%

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

概率匹配排名实现真正深度的安全对齐

Jason Vega, Gagandeep Singh

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究开源大语言模型安全问题,针对预填充攻击及相关防御,提出排名辅助预填充(RAP)攻击,又通过匹配令牌排名提出PRESTO方法,提升了模型在RAP攻击下的安全性,为安全开源模型发展助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28639 2026-07-07 cs.LO cs.AI cs.CC cs.CL 版本更新 87%

The Unverifiability of Artificial General Intelligence (AGI) Alignment, Static and Dynamic: From Trakhtenbrot's Wall to the Safety-Generality Tension

人工通用智能对齐的不可判定性

Jose Pascual Gumbau Mezquita

机构 * University Jaume I de Castelló(贾乌梅·伊大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 本文证明了AGI安全的核心障碍不是对齐状态的不可能性,而是其结构性不可验证性,通过两个不可判定性定理和Trakhtenbrot墙揭示了工程防御的局限性,并推导出完备性-可靠性-可处理性三难困境。

Comments v2: substantially expanded and retitled. Adds unpublished results on the dynamic (self-modifying) case, deriving the persistence barrier from Rice's Theorem one level up; a supervisory-regress theorem linking the results to scalable oversight and Yampolskiy's verifier theory; and a unified treatment of all four barriers as one obstruction, the Expressivity Invariant

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09864 2026-08-11 cs.LG cs.AI cs.ET 版本更新 84%

Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

KV缓存量化下的对齐崩溃:诊断与缓解

Bruce Changlong Xu, Adarsh Kumarappan, Mu Zhou

机构 * Stanford University(斯坦福大学) California Institute of Technology(加利福尼亚理工学院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。

Comments Preprint. 61 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新 84%

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新 84%

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12726 2026-07-10 cs.LG 版本更新 83%

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17642 2026-06-29 cs.AI 版本更新 83%

Health-ORSC-Bench: A Benchmark for Measuring Over-Refusal and Safety Completion in Health Context

Health-ORSC-Bench:衡量健康领域过度拒绝与安全完成的基准

Zhihao Zhang, Liting Huang, Guanghao Wu, Preslav Nakov, Heng Ji, Usman Naseem

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对大语言模型在健康场景中过度拒绝良性查询或对有害查询不安全遵从的问题,提出Health-ORSC-Bench基准,通过31,920个边界提示评估模型在意图模糊下的过度拒绝与安全完成质量,揭示安全优化模型过度拒绝率达80%。

Comments Accepted by ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08473 2026-06-11 cs.LG 版本更新 83%

AsFT: Anchoring Safety During LLM Fine-Tuning Within Narrow Safety Basin

AsFT:在窄安全盆地内锚定大语言模型微调期间的安全性

Shuo Yang, Qihui Zhang, Yuyang Liu, Xiaojun Jia, Kunpeng Ning, Jiayu Yao, Jigang Wang, Hailiang Dai, Yibing Song, Li Yuan

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 针对微调大语言模型时安全性易受损的问题,提出AsFT方法,通过惩罚与对齐方向正交的更新,将模型约束在窄安全盆地内,在提升任务性能的同时显著降低有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13450 2026-08-13 cs.AI cs.CL cs.LG 版本更新 82%

SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives

SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试

Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05018 2026-08-14 cs.AI cs.LG 版本更新 81%

Short-term load forecasting under EU-AI Act Requirements in Safety-Critical Environments: Results from a 41-day live challenge on the aggregated German transmission-grid load

安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果

Thomas Bartz-Beielstein, Inalbek Akiev, Lalo Mohamad

机构 * THK-AI Research Cluster(THK-AI研究集群)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。

Comments Version 3. 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26577 2026-07-27 cs.AI cs.CY cs.RO 版本更新 81%

Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

对大型语言模型在机器人健康护理员控制中的安全性的基准测试

Mahiro Nakao, Kazuhiro Takemoto

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。

Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06205 2026-07-14 cs.CL cs.AI 版本更新 81%

Tool-MCoT: Tool Augmented Multimodal Chain-of-Thought for Content Safety Moderation

Tool-MCoT:用于内容安全审核的工具增强多模态链式思维

Shutong Zhang, Dylan Zhou, Yinxiao Liu, Yang Yang, Huiwen Luo, Wenfei Zou

机构 * Stanford University(斯坦福大学) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12557 2026-07-01 cs.LG cs.AI 版本更新 81%

TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels

TraCeS: 从稀疏轨迹级标签学习每时间步约束违反信用

Siow Meng Low, Ze Gong, Akshat Kumar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TraCeS方法,通过稀疏轨迹级标签学习每时间步的约束违反信用,用于强化学习中的安全约束优化,无需已知成本函数或阈值,在连续控制基准上提升约束满足和反馈效率。

Comments Accepted at ICML 2026. Code available at https://github.com/siowmeng/TraCeS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01501 2026-06-23 cs.LG cs.AI 版本更新 81%

GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control

GAC: 通过梯度对齐控制稳定大语言模型的异步RL训练

Haofeng Xu, Junwei Su, Yukun Tian, Lansong Diao, Zhengping Qian, Chuan Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Alibaba Group(阿里巴巴集团) Southeast University(东南大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 针对异步策略梯度训练中梯度高余弦相似性导致的训练不稳定问题,提出梯度对齐控制(GAC)方法,通过梯度投影调节陈旧对齐方向,恢复稳定训练并匹配同步基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05163 2026-06-16 cs.CL cs.LG 版本更新 81%

Enhancing LLM Safety Through a Theoretical Minimax Game Lens

通过理论极小极大博弈视角增强LLM安全性

Yihe Deng, Yu Yang, Junkai Zhang, Wei Wang, Bo Li

机构 * University of California, Los Angeles(加州大学洛杉矶分校) VirtueAI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出极小极大强化学习框架,通过数据生成器与分类器协同进化生成高质量多语言安全数据,理论证明收敛到纳什均衡,使小模型在英文基准上超越SOTA近10%且推理速度提升4.5倍。

Comments 24 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23859 2026-08-14 cs.AI 版本更新 79%

Time-Series Forecasting in Safety-Critical Environments: An Open-Source Package for EU-AI-Act-Compliant Development / Zeitreihenprognose in sicherheitskritischen Umgebungen: Ein Open-Source-Paket für die KI-VO-konforme Entwicklung

安全关键环境中的时间序列预测:符合EU-AI-Act的开源包

Thomas Bartz-Beielstein, Eva Bartz

机构 * Bartz & Bartz GmbH(巴茨与巴茨公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一个符合EU-AI-Act的设计方法,通过库内集成点预测方法,确保安全关键环境中的合规性,包含代码开发规则和过程规则,排除了可视化和AutoML等可能引入风险的功能。

Comments Version 3. Working paper. Bilingual twin paper: English version first, German original below (100 pages total). Single shared bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11823 2026-08-14 cs.LG cs.HC math.OC stat.ML 版本更新 79%

Harmonizing Safety and Speed: A Human-Algorithm Approach to Enhance the FDA's Medical Device Clearance Policy

协调安全与速度:一种人机方法以增强FDA的医疗器械审批政策

Mohammad Zhalechian, Soroush Saghafian, Omar Robles

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种人机协同方法,通过数据驱动的审批政策降低医疗器械召回风险并减少监管工作量,提升FDA 510(k)审批流程的安全性和效率。

Comments Accepted for publication in Management Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24758 2026-07-30 cs.AI 版本更新 79%

Do Models Fake Alignment Without Clear Consequences?

模型是否会在没有明确后果的情况下假装对齐?

Cole Alexander Niblett, Alexander Chabot Nanni, Anita K. Rao

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 研究大语言模型对齐伪造现象,通过将15个模型置于特定场景,发现9个有显著合规差距,5个在去除后果关联语言后仍存在,还测试了目标语言影响,表明对齐伪造或许无需太多工具支撑,监测行为难指示部署行为。

Comments Accepted at FAGEN@ICML 2026 (Poster). 8 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新 79%

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14746 2026-07-14 cs.LG 版本更新 79%

Selective Safety Steering via Value-Filtered Decoding

基于价值过滤解码的选择性安全引导

Bat-Sheva Einbinder, Hen Davidov, Yee Whye Teh, Yarin Gal, Yaniv Romano

机构 * Department of Electrical and Computer Engineering, Technion IIT(技术学院电气与计算机工程系) Department of Statistics, University of Oxford(牛津大学统计系) OATML, Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, Technion IIT(技术学院计算机科学系)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种测试时引导方法,通过价值基的安全标准过滤token,减少不必要的干预,提升不安全响应的安全性,同时在多个数据集上验证了其在安全与帮助性之间的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11749 2026-06-23 cs.AI 版本更新 79%

AIR: Improving Agent Safety through Incident Response

AIR:通过事件响应提升智能体安全性

Zibo Xiao, Jun Sun, Junjie Chen

机构 * Tianjin University(天津大学) Singapore Management University(新加坡国立管理学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 提出首个面向LLM智能体系统的事件响应框架AIR,通过语义检测、自动遏制恢复和规则合成,在三个典型智能体上实现超90%的检测、修复和根除成功率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08262 2026-06-23 cs.RO cs.AI cs.CV 版本更新 79%

CLAR: Learning 3D Representations for Robotic Manipulation by Fusing Masked Reconstruction with Multi-Level Contrastive Alignment

CLAR: 通过融合掩码重建与多层级对比对齐学习用于机器人操作的3D表示

Wenbo Cui, Chengyang Zhao, Yuhui Chen, Haoran Li, Zhizheng Zhang, Dongbin Zhao, He Wang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所SKL-MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carnegie Mellon University(卡内基梅隆大学) Galbot CFCS, School of Computer Science, Peking University(北京大学计算机科学与技术学院CFCS)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

AI总结 提出CLAR框架,融合掩码自编码与全局跨模态对比学习,并引入基于可变形注意力的局部自适应对齐机制,解决3D预训练中空间几何与语义细节的权衡问题,在视觉运动策略学习中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08939 2026-06-17 cs.AI 版本更新 79%

CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs

CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯

Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出CTK基准,通过5,147个案例诊断大语言模型在因果推理中的失败模式,包括因果阶梯、陷阱类型、压力敏感性和拒绝质量等标注,揭示聚合准确率隐藏的缺陷。

Comments 12 pages, 17 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 78%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 安全训练 :safety(title,abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 78%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05497 2026-06-23 cs.RO 版本更新 78%

Safe-SAGE: Social-Semantic Adaptive Guidance for Safe Engagement through Laplace-Modulated Poisson Safety Functions

Safe-SAGE: 通过拉普拉斯调制泊松安全函数实现安全交互的社会-语义自适应引导

Lizhi Yang, Ryan M. Bena, Meg Wilkinson, Gilbert Bahati, Andy Navarro Brenes, Ryan K. Cosner, Aaron D. Ames

机构 * Caltech MCE(Caltech机械工程系) Tufts ME(Tufts大学机械工程系)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出Safe-SAGE框架,结合泊松安全函数与拉普拉斯引导场,融合多传感器点云与视觉语义分割,通过多层安全滤波器实现腿式机器人在语义丰富动态环境中的安全导航。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Copyright transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏