arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3266 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3266 篇

2603.26679 2026-03-31 cs.CY cs.AI cs.HC 62%

AI Meets Mathematics Education: A Case Study on Supporting an Instructor in a Large Mathematics Class with Context-Aware AI

人工智能与数学教育的交汇:一个支持大班数学课程教师的案例研究

Jérémy Barghorn, Anna Sotnikova, Sacha Friedli, Antoine Bosselut

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了通过上下文感知AI支持大规模数学课程的教学挑战,通过细调轻量语言模型提高回答准确性,并强调了人机协作在课程支持中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 62%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20994 2026-03-24 cs.AI cs.GT cs.LG 62%

The Intelligent Disobedience Game: Formulating Disobedience in Stackelberg Games and Markov Decision Processes

智能不服从游戏:在Stackelberg游戏和马尔可夫决策过程中建模不服从

Benedikt Hornig, Reuth Mirsky

机构 * Independent Researcher(独立研究者) Tufts University(塔夫茨大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能不服从游戏(IDG),通过Stackelberg游戏框架建模人类与辅助体的不对称信息交互,分析多步场景中的最优策略,揭示如'安全陷阱'等战略现象,为开发安全非合规学习算法和研究人类对不服从AI的信任提供数学基础。

Comments Accepted for presentation at the Rebellion and Disobedience in AI (RaD-AI) at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14391 2026-03-23 cs.LG cs.AI 62%

HALO: Hierarchical Reinforcement Learning for Large-Scale Adaptive Traffic Signal Control

HALO:用于大规模自适应交通信号控制的分层强化学习

Yaqiao Zhu, Hongkai Wen, Geyong Min, Man Luo

机构 * University of Exeter Department of Computer Science Exeter UK(埃克塞特大学计算机科学系埃克塞特英国) University of Warwick Department of Computer Science Coventry UK(沃里克大学计算机科学系科文特里英国) University of Exeter(埃克塞特大学) University of Warwick(沃里克大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HALO通过分层强化学习框架解决大规模自适应交通信号控制中的可扩展性与协调性矛盾,采用高低层策略协同优化,实现高效交通管理。

Comments Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19152 2026-03-20 cs.CL cs.AI 62%

VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models

VEPO:用于低资源语言基础模型的变量熵策略优化

Chonghan Liu, Yimin Du, Qi An, Xin He, Cunqi Zhai, Fei Tan, Weijia Lin, Xiaochun Gong, Yongchao Deng, Shousheng Jia, Xiangzheng Zhang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEPO,通过强化学习可验证奖励整合确定性结构约束,提升低资源语言的分词效率和翻译质量。

Comments 23 pages. Includes figures and tables. Conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00009 2026-03-17 cs.CL cs.AI cs.IR 62%

Unlocking Electronic Health Records: A Hybrid Graph RAG Approach to Safe Clinical AI for Patient QA

解锁电子健康记录:一种混合图RAG方法用于安全临床AI的患者问答

Samuel Thio, Matthew Lewis, Spiros Denaxas, Richard JB Dobson

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MediGRAF,一种结合图检索与向量嵌入的混合RAG系统,通过整合结构化数据与非结构化文本,提升临床AI在患者问答中的安全性和准确性。

Comments 26 pages, 5 figures, 2 tables

Journal ref Frontiers in Digital Health, vol. 8, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13318 2026-03-17 cs.LG cs.AI 62%

Residual Stream Analysis of Overfitting And Structural Disruptions

残差流分析过拟合与结构破坏

Quan Liu, Han Zhou, Wenquan Wu, Hua Wu, Sen Su

机构 * BUPT(北京邮电大学) Baidu(百度)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析残差流几何揭示安全数据导致的虚假拒绝问题,提出VCL正则化方法降低虚假拒绝率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13236 2026-03-17 cs.AI cs.CY 62%

Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment

人类对AI在代理、滥用和偏差中的因果归因

Maria Victoria Carro, David Lagnado

机构 * Università degli Studi di Genova(热那亚大学) FAIR IALAB University of Buenos Aires(布宜诺斯艾利斯大学) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了人类在AI导致有害结果时对因果责任的归因,发现AI代理程度越高,责任归于AI;开发者虽远离事件但被归责高,用户责任降低;分解AI为大语言模型和代理组件时,代理部分更易被归责。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10012 2026-03-12 cs.CL cs.AI 62%

Measuring and Eliminating Refusals in Military Large Language Models

测量和消除军事大语言模型中的拒绝行为

Jack FitzGerald, Dylan Bates, Aristotelis Lazaridis, Aman Sharma, Vincent Lu, Brian King, Yousif Azami, Sean Bailey, Jeremy Cao, Peter Damianov, Kevin de Haan, Joseph Madigan, Jeremy McLaurin, Luke Kerbs, Jonathan Tainer, Dave Anderson, Jonathan Beck, Jamie Cuticello, Colton Malkerson, Tyler Saltsman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 62%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08506 2026-03-10 cs.LG cs.AI 62%

Oracle-Guided Soft Shielding for Safe Move Prediction in Chess

由Oracle引导的软屏蔽用于国际象棋中的安全移动预测

Prajit T Rajendran, Fabio Arnez, Huascar Espinoza, Agnes Delaborde, Chokri Mraidha

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 OGSS通过学习概率安全模型,在国际象棋中实现安全探索,减少战术失误并提升探索效率。

Comments Accepted for publication at the 24th International Conference on Machine Learning and Applications (ICMLA), 2025. Preprint version in Arxiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01440 2026-03-10 cs.LG cs.AI cs.RO 62%

Interactive Double Deep Q-network: Integrating Human Interventions and Evaluative Predictions in Reinforcement Learning of Autonomous Driving

交互式双深Q网络:在自动驾驶强化学习中整合人类干预与评估预测

Alkis Sygkounas, Ioannis Athanasiadis, Andreas Persson, Michael Felsberg, Amy Loutfi

机构 * Center for Applied Autonomous Sensor Systems (AASS)(应用自主传感器系统中心) Örebro University(奥雷布罗大学) Computer Vision Laboratory(计算机视觉实验室) Linköping University(利德斯霍尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 交互式双深Q网络通过整合人类干预与评估预测,提升自动驾驶强化学习的性能和适应性。

Comments Accepted at IEEE Intelligent Vehicles Symposium (IV) 2025, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01315 2026-03-10 cs.CL cs.AI 62%

Helping Large Language Models Protect Themselves: An Enhanced Filtering and Summarization System

帮助大语言模型自我保护:一种增强的过滤与摘要系统

Sheikh Samit Muhaimin, Spyridon Mastorakis

机构 * University of Notre Dame(诺特大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种无需重新训练的LLM自我防护系统,通过过滤模块检测恶意输入并摘要模块提供上下文知识,有效提升对抗性攻击的防御能力。

Journal ref Proceedings of the 2025 IEEE 7th International Conference on Trust, Privacy and Security in Intelligent Systems and Applications (TPS-ISA), Pittsburgh, PA, USA, November 12-14, 2025. IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06600 2026-03-10 cs.LG cs.AI 62%

FuzzingRL: Reinforcement Fuzz-Testing for Revealing VLM Failures

FuzzingRL: 用于揭示视觉语言模型故障的强化模糊测试

Jiajun Xu, Jiageng Mao, Ang Qi, Weiduo Yuan, Alexander Romanus, Helen Xia, Vitor Campagnolo Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究机构)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 FuzzingRL通过强化模糊测试生成挑战性问题,揭示视觉语言模型的故障点并降低其准确性。

Comments 18 pages, 4 figures. † These authors jointly supervised this work: Jiageng Mao and Yue Wang

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05517 2026-03-09 cs.LG cs.AI cs.CR cs.SE 62%

Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents

路径作为策略:基于日志提炼的门控行为树作为可验证的外部化策略,用于安全、鲁棒且高效的智能体

Peiran Li, Jiashuo Sun, Fangzhou Lin, Shuo Xing, Tianfu Fu, Suofei Feng, Chaoqun Ni, Zhengzhong Tu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过日志提炼生成门控行为树作为外部化策略,提升智能体在安全、鲁棒性和效率方面的表现。

Comments 30 pages, 1 figurres, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04707 2026-03-06 cs.CL cs.AI 62%

Detection of Illicit Content on Online Marketplaces using Large Language Models

利用大语言模型检测在线市场上的非法内容

Quoc Khoa Tran, Thanh Thi Nguyen, Campbell Wilson

机构 * AiLECS Lab Monash University(AiLECS实验室 莫纳什大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用大语言模型检测在线市场非法内容的有效性,发现LLM在复杂分类任务中表现优于传统方法。

Comments Accepted for publication in the Proceedings of the 8th International Conference on Natural Language Processing (ICNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07757 2026-03-05 cs.AI cs.LG 62%

Emotion-Gradient Metacognitive RSI (Part I): Theoretical Foundations and Single-Agent Architecture

情绪梯度元认知递归自我改进(第一部分):理论基础与单体代理架构

Rintaro Ando

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EG-MRSI框架整合反思元认知、情绪内在动机和递归自我修改,通过可微奖励函数和安全机制实现单体代理的理论基础,为安全AGI提供严谨基础。

Comments Withdrawn due to a critical error discovered in the stability and convergence proofs (specifically Lemma 2, Theorem 12, and Proposition 10) in Section 3. The identified flaw invalidates the core theoretical guarantees regarding capability growth and system stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01440 2026-03-05 cs.RO cs.AI cs.LG 62%

A Review of Reward Functions for Reinforcement Learning in the context of Autonomous Driving

强化学习在自动驾驶领域的奖励函数综述

Ahmed Abouelazm, Jonas Michel, J. Marius Zoellner

机构 * FZI Research Center for Information Technology(弗劳恩霍夫研究所信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了强化学习在自动驾驶中奖励函数的设计,分析了不同方法的优缺点,并提出了未来研究方向,如奖励验证框架和情境感知奖励。

Comments Accepted at the 35th IEEE Intelligent Vehicles Symposium (IV 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03541 2026-03-05 cs.CL cs.AI 62%

RAG-X: Systematic Diagnosis of Retrieval-Augmented Generation for Medical Question Answering

RAG-X: 用于医疗问答的检索增强生成系统系统性诊断

Aswini Sivakumar, Vijayan Sugumaran, Yao Qiang

机构 * Oakland University(奥克兰大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 RAG-X通过系统性诊断框架,评估检索和生成过程,揭示问答系统中的隐藏失败模式,提升医疗问答的准确性和可靠性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03367 2026-03-05 cs.CY cs.AI 62%

Bridging the Reproducibility Divide: Open Source Software's Role in Standardizing Healthcare AI

弥合可重复性鸿沟:开源软件在标准化医疗AI中的作用

John Wu, Zhenbang Wu, Jimeng Sun

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了开源软件在提升医疗AI可重复性中的作用,指出通过公开数据集和代码共享可显著提高论文影响力,并提出标准化数据预处理和开放科学实践的必要性。

Comments Old Preprint. Will update in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01792 2026-03-03 cs.CL cs.AI 62%

ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs

ALTER: 用于LLM中基于令牌熵引导的不对称LoRA去学习

Xunlei Chen, Jinyu Guo, Yuang Li, Zhaokun Wang, Yi Gong, Jie Zou, Jiwei Wei, Wenhong Tian

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ALTER通过不对称LoRA架构实现基于令牌熵引导的LLM高效去学习,取得SOTA性能并保留高模型效用。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01563 2026-03-03 cs.LG cs.AI 62%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01185 2026-03-03 cs.CL cs.AI cs.CR 62%

Token-level Data Selection for Safe LLM Fine-tuning

令牌级数据选择用于安全大语言模型微调

Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang

机构 * The Hong Kong University of Science(香港科学与技术大学) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOSS框架,通过令牌级数据选择提升LLM微调的安全性,同时在下游任务性能上优于现有样本级防御方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00602 2026-03-03 cs.LG cs.AI 62%

Learning to Explore: Policy-Guided Outlier Synthesis for Graph Out-of-Distribution Detection

学习探索:基于策略的异常合成用于图分布外检测

Li Sun, Lanxu Yang, Jiayu Tian, Bowen Fang, Xiaoyan Yu, Junda Ye, Peng Tang, Hao Peng, Philip S. Yu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 PGOS通过强化学习策略生成高质量伪OOD图,提升图分布外检测的鲁棒性与性能

Comments Accepted by AAAI'26, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02623 2026-03-03 cs.CL cs.AI 62%

Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models

奖励怀疑:一种强化学习方法用于大语言模型的校准置信表达

David Bani-Harouni, Chantal Pellegrini, Paul Stangel, Ege Özsoy, Kamilia Zaripova, Nassir Navab, Matthias Keicher

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种强化学习方法,通过直接微调大语言模型以实现校准的置信度表达,提升了模型的置信度校准能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17729 2026-02-26 cs.CY cs.AI cs.ET cs.HC 62%

Stop Saying "AI"

别再说『人工智能』了

Nathan G. Wood, Scott Robbins, Eduardo Zegarra Berodt, Anton Graf von Westerholt, Michelle Behrndt, Hauke Budig, Daniel Kloock-Schreiber

机构 * Institute of Air Transportation Systems, Hamburg University of Technology(空气交通系统研究所,汉堡技术大学) Ethics + Emerging Sciences Group, California Polytechnic State University San Luis Obispo(伦理与新兴科学小组,加州州立大学圣路易斯奥比斯波分校) Center for Environmental and Technology Ethics – Prague(环境与技术伦理中心–布拉格) Academy for Responsible Research, Teaching, and Innovation, Karlsruhe Institute of Technology(负责任研究、教学与创新学院,卡尔斯鲁厄理工学院) Department of Philosophy, University of Hamburg(哲学系,汉堡大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了『人工智能』术语在军事领域的应用,指出其泛化带来的问题,并主张在讨论中明确具体系统以提高讨论的精确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21269 2026-02-26 cs.LG cs.AI stat.ML 62%

Group Orthogonalized Policy Optimization:Group Policy Optimization as Orthogonal Projection in Hilbert Space

群体正交化策略优化:将群体策略优化视为希尔伯特空间中的正交投影

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过正交投影在希尔伯特空间中优化群体策略,实现精确稀疏性和稳定梯度动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12415 2026-02-26 cs.LG cs.AI 62%

Orthogonalized Policy Optimization:Policy Optimization as Orthogonal Projection in Hilbert Space

正交化策略优化:作为希尔伯特空间中的正交投影的策略优化

Wang Zixian

机构 * China Mobile Communications Group Shandong Co., Ltd. Tai’an Branch(中国移动通信集团山东公司泰安分支)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 OPO通过正交投影在希尔伯特空间中实现策略优化,利用守恒定律而非方差减少启发式方法,提升模型在长时程训练和分布外泛化中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 62%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18060 2026-02-26 cs.LG cs.AI cs.RO 62%

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR:基于集中参考模型的自我对战锚定

Wei-Jer Chang, Akshay Rangesh, Kevin Joseph, Matthew Strong, Masayoshi Tomizuka, Yihan Hu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SPACeR通过集中参考模型指导自我对战,实现高效、可扩展的自动驾驶策略生成。

Comments Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏