arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-03 至 2026-03-03 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 15 篇

2603.01029 2026-03-03 cs.CV 82%

Vision-Language Feature Alignment for Road Anomaly Segmentation

视觉-语言特征对齐用于道路异常分割

Zhuolin He, Jiacheng Tang, Jian Pu, Xiangyang Xue

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01792 2026-03-03 cs.CL cs.AI 62%

ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs

ALTER: 用于LLM中基于令牌熵引导的不对称LoRA去学习

Xunlei Chen, Jinyu Guo, Yuang Li, Zhaokun Wang, Yi Gong, Jie Zou, Jiwei Wei, Wenhong Tian

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ALTER通过不对称LoRA架构实现基于令牌熵引导的LLM高效去学习,取得SOTA性能并保留高模型效用。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01563 2026-03-03 cs.LG cs.AI 62%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01185 2026-03-03 cs.CL cs.AI cs.CR 62%

Token-level Data Selection for Safe LLM Fine-tuning

令牌级数据选择用于安全大语言模型微调

Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang

机构 * The Hong Kong University of Science(香港科学与技术大学) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TOSS框架,通过令牌级数据选择提升LLM微调的安全性,同时在下游任务性能上优于现有样本级防御方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00602 2026-03-03 cs.LG cs.AI 62%

Learning to Explore: Policy-Guided Outlier Synthesis for Graph Out-of-Distribution Detection

学习探索:基于策略的异常合成用于图分布外检测

Li Sun, Lanxu Yang, Jiayu Tian, Bowen Fang, Xiaoyan Yu, Junda Ye, Peng Tang, Hao Peng, Philip S. Yu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 PGOS通过强化学习策略生成高质量伪OOD图,提升图分布外检测的鲁棒性与性能

Comments Accepted by AAAI'26, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02623 2026-03-03 cs.CL cs.AI 62%

Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models

奖励怀疑:一种强化学习方法用于大语言模型的校准置信表达

David Bani-Harouni, Chantal Pellegrini, Paul Stangel, Ege Özsoy, Kamilia Zaripova, Nassir Navab, Matthias Keicher

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种强化学习方法,通过直接微调大语言模型以实现校准的置信度表达,提升了模型的置信度校准能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21533 2026-03-03 cs.RO cs.AI 57%

Model Predictive Adversarial Imitation Learning for Planning from Observation

基于模型预测的对抗模仿学习用于从观察中规划

Tyler Han, Yanda Bao, Bhaumik Mehta, Gabriel Guo, Anubhav Vishwakarma, Emily Kang, Sanghun Jung, Rosario Scalise, Jason Zhou, Bryan Xu, Byron Boots

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于模型预测的对抗模仿学习方法,通过端到端学习从观察中规划,提升样本效率和鲁棒性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12664 2026-03-03 cs.AI cs.SY eess.SY 57%

Behavioral Generative Agents for Energy Operations

行为生成代理在能源运营中的应用

Cong Chen, Omer Karaduman, Xu Kuang

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) Graduate School of Business, Stanford University(斯坦福大学商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10477 2026-03-03 cs.RO cs.NE 50%

Symphony: A Heuristic Normalized Calibrated Advantage Actor and Critic Algorithm in application for Humanoid Robots

Symphony:一种用于双足机器人的启发式规范化校准优势Actor-Critic算法

Timur Ishuov, Michele Folgheraiter, Madi Nurmanov, Goncalo Gordo, Richárd Farkas, József Dombi

机构 * Department of Computer Algorithms and Artificial Intelligence, University of Szeged(塞格德大学计算机算法与人工智能系) Department of Robotics and Mechatronics, Nazarbayev University(纳扎尔巴耶夫大学机器人与机电系) Tinker AI Limited(Tinker AI有限公司)

专题命中 安全训练 :safety(abstract)

AI总结 Symphony算法通过规范化校准和安全动作策略,提升双足机器人从零开始的学习效率和安全性。

Comments https://github.com/SuspensionRailway/symphony

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01840 2026-03-03 cs.CV eess.IV 50%

FireRed-OCR Technical Report

FireRed-OCR 技术报告

Hao Wu, Haoran Lou, Xinyue Li, Zuodong Zhong, Zhaojun Sun, Phellon Chen, Xuanhe Zhou, Kai Zuo, Yibo Chen, Xu Tang, Yao Hu, Boxiang Zhou, Jian Wu, Yongji Wu, Wenxin Yu, Yingmiao Liu, Yuhao Huang, Manjie Xu, Gang Liu, Yidong Ma, Zhichao Sun, Changhao Qiao

机构 * Super Intelligence Team(超级智能团队) Xiaohongshu Inc(小红书公司)

专题命中 安全训练 :alignment(abstract)

AI总结 FireRed-OCR 通过三阶段渐进训练策略,将通用 VLM 转化为高精度结构文档解析专家,实现 OCR 领域的突破性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01565 2026-03-03 eess.AS cs.SD 50%

Investigating Group Relative Policy Optimization for Diffusion Transformer based Text-to-Audio Generation

探究基于扩散变压器的文本到音频生成中的群体相对策略优化

Yi Gu, Yanqing Liu, Chen Yang, Sheng Zhao

机构 * Tsinghua University(清华大学) Microsoft(微软)

专题命中 安全训练 :alignment(abstract)

AI总结 本文基于扩散变压器架构,利用群体相对策略优化提升文本到音频生成的保真度和提示遵循性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07530 2026-03-03 cs.RO cs.CV 50%

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA:用于机器人操作的1位视觉-语言-动作模型

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 安全训练 :alignment(abstract)

AI总结 BitVLA是一种用于机器人操作的1位视觉-语言-动作模型,通过模型设计和优化提升部署效率,实现内存和延迟的显著降低。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01035 2026-03-03 cs.HC 50%

From Human Negotiation to Agent Negotiation: Personal Mobility Agents in Automated Traffic

从人类协商到智能体协商:个人移动智能体在自动化交通中的应用

Pascal Jansen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出个人移动智能体,通过代理用户偏好与安全规则协商交通行为,解决自动化交通中用户与系统冲突的问题。

Comments Position Paper at the CHI 2026 Workshop AutomationXP26: Agentic Automation Experiences - Rethinking the Interaction of Humans and AI Agents. April 14, 2026. Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 安全训练 :safety(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO 50%

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

专题命中 安全训练 :alignment(abstract)

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏