arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 347 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 347 篇

2606.07000 2026-06-08 cs.AI 新提交 57%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 50%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 安全训练 :safety(abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09872 2026-08-11 math.OC stat.ME 新提交 50%

Safe Start: Configuring Optimization Algorithms for Decision-Making under Extreme Risks

安全起始:极端风险下决策的优化算法配置

Henry Lam, Wasin Meesena

专题命中 安全训练 :safety(abstract)

AI总结 针对极端风险下的随机优化问题,提出基于安全起始的解决方案,结合方差缩减保障运行时间,在投资组合优化和神经网络鲁棒分类中验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 50%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 安全训练 :alignment(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00133 2026-08-04 eess.SY cs.SY 新提交 50%

Deep Reinforcement Learning: From First Principles to Reasoning Models

深度强化学习:从第一性原理到推理模型

Ghoshana Bista

专题命中 安全训练 :safety(abstract)

AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28835 2026-08-03 cs.SE cs.OS cs.PL 新提交 50%

From C to Idiomatic Rust: A Ship-of-Theseus Agentic Translation

从C到地道Rust:Theseus之船智能体翻译

Vasily A. Sartakov

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种智能体AI驱动的结构化C到Rust迁移工作流,先生成语义保留的非地道Rust基线,再逐步重写为地道Rust,经12.5千行代码的iodine验证可实现可靠迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 50%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 安全训练 :trustworthy(abstract)

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25883 2026-07-29 cs.MA 新提交 50%

Towards a Systems Foundation for Agentic Cloud Management

迈向智能云管理的系统基础

Minghao Li, Ziqian Liu, Ziyu Mao, Daqian Ding, Yu Kang, Qingwei Lin, Tianyin Xu, Yiming Qiu

专题命中 安全训练 :safety(abstract)

AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25754 2026-07-29 cs.RO 新提交 50%

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

通过系统多智能体深度强化学习实现复杂环境下的多无人机协同导航

Yu Su, Nabil Aouf

专题命中 安全训练 :safety(abstract)

AI总结 针对复杂环境下多无人机协同导航面临的问题,提出多智能体深度强化学习框架,通过协同探索等方法解决,含感知、示范缓冲区和课程调度机制,能抽象特征实现跨场景转移,经仿真验证有良好性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 50%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 安全训练 :trustworthy(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 50%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 50%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16630 2026-07-21 cs.RO 新提交 50%

AI-Augmented Model Predictive Control for Safe and Adaptive Rendezvous and Proximity Operations

用于安全和自适应交会及接近操作的人工智能增强模型预测控制

Luca Sportelli, Tyler Barr, Cagri Kilic, Di Wu

机构 * Embry–Riddle Aeronautical University(安柏瑞德航空航天大学)

专题命中 安全训练 :safety(abstract)

AI总结 研究多智能体对抗场景下航天器自主交会及接近操作问题,提出结合约束滚动时域MPC与数据驱动监督调整层的框架,经蒙特卡罗模拟评估,该框架相比固定参数MPC有更好性能,为自适应航天器RPO提供模块化、可解释基础。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15910 2026-07-20 physics.ins-det 新提交 50%

Precision positioning in free-space optical communication systems via PID control tuned by RL

基于强化学习调谐PID控制的自由空间光通信系统精确位置控制

K. Prikhodko, S. Kuznetsov, S. Vorobey, A. Katanskiy, V. Balakirev, A. Reutov

专题命中 安全训练 :alignment(abstract)

AI总结 研究自由空间光通信系统中光学组件精确位置控制问题,采用深度确定性策略梯度(DDPG)智能体调谐PID控制器,经实验表明其在动态定位任务中有潜力,不同目标轨迹下效果有差异,需多模式优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14798 2026-07-17 cs.DC 新提交 50%

Ground-Side Mission Plan Compilation with Policy-as-Code Guardrails for Cloud-Native Satellite Platforms

用于云原生卫星平台的基于代码即政策护栏的地面任务计划编译

Hsiu-Chi Tsai, Chia-Tung Chung

专题命中 安全训练 :safety(abstract)

AI总结 研究针对卫星云原生运行时缺少地面开源工具链的问题,提出卫星任务编译器这一四阶段管道,能依据规则检查并编译任务计划为相关工件,经多种方式验证,还向AI代理暴露管道,有相关工具及发布协议。

Comments 13 pages. Extended version of the paper accepted at IEEE SMC-IT/SCC 2026 (Space Mission Challenges for Information Technology / Space Computing Conference); adds a unified GPU+CPU DRA quota and a scheduler-level accelerator fallback re-validated on Kueue v0.18.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 50%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10221 2026-07-14 cs.SE cs.CR 新提交 50%

Which Neurons Detect Malicious Code? A Probing Study of LLM Security Knowledge

哪些神经元能检测恶意代码?对大语言模型安全知识的探索性研究

Lam D. Dao, Vang T. Nguyen, Anh M. T. Bui, Phuong T. Nguyen

专题命中 安全训练 :alignment(abstract)

AI总结 研究探索大语言模型中检测恶意代码的神经元,应用机械可解释性方法定位相关神经元,通过对恶意和良性PyPI包实验发现放大促进神经元、抑制抑制神经元可提升准确率,有助于了解模型编码恶意概念方式,为可靠防御机制提供思路。

Comments The paper has been peer reviewed and accepted for publication in the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 50%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 安全训练 :safety(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 50%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 安全训练 :alignment(abstract)

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03963 2026-07-07 cs.SE 新提交 50%

Neuro-Symbolic Reasoning for Vulnerability Detection

用于漏洞检测的神经符号推理

Yanjie Zhao, Hongjie Chen, Li Lu, Zhou Yang, Xiao Cheng, Haoyu Wang

专题命中 安全训练 :safety(abstract)

AI总结 研究基于大语言模型的漏洞检测不可靠性,提出神经符号框架LeanGuard,通过将代码解释与安全义务判定分离,神经侧过滤事实,符号侧形式验证,证据感知裁决器权衡结果,在五个CWE类上实例化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02579 2026-07-07 cs.SE 新提交 50%

When Not to Write Memory: Governing False Promotion from Correlated Agent Traces

何时不写入内存:管理来自相关代理痕迹的错误推广

Yijiashun Qi, Xiang Xu, Yuxuan Li

专题命中 安全训练 :safety(abstract)

AI总结 研究语言代理从执行痕迹写入可复用内存时何时应拒绝写入的问题,引入GovMem策略,通过估计依赖感知支持等进行决策,在测试中能减少错误推广。

Comments accepted by mlise 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 50%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 安全训练 :safety(abstract)

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02192 2026-07-03 eess.SY cs.SY 新提交 50%

Reference-Governed Distributed Safe Gradient Flow for Safe Optimal Output Agreement of Multi-Agent Systems

参考调控的分布式安全梯度流用于多智能体系统的安全最优输出一致性

Zhanglin Shangguan, Wei Xiao, Bo Yang, Xinping Guan

专题命中 安全训练 :safety(abstract)

AI总结 提出参考调控双层架构,上层通过一阶控制屏障函数约束梯度流,下层基于内模输出调节器构建动态安全裕度,实现非线性多智能体系统的安全最优输出一致性,避免高阶控制屏障函数的调参敏感和稳态偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 50%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 安全训练 :safety(abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 50%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 安全训练 :alignment(abstract)

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00622 2026-07-02 cs.CV 新提交 50%

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

学习观察:通过交错策略优化的主动视频异常理解

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

机构 * School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)

专题命中 安全训练 :alignment(abstract)

AI总结 提出Anom-π闭环框架,将视频异常理解建模为主动序列决策过程,通过交错策略统一内部推理与证据获取,并设计iDPO实现轨迹级策略对齐,仅2B参数即超越大规模模型。

Comments Accepted at ICML 2026; 25 pages, 8 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-07-02 cs.RO 新提交 50%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 安全训练 :safety(abstract)

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25189 2026-07-02 cs.OS 新提交 50%

ActPlane: Programmable OS-Level Policy Enforcement for Agent Harnesses

ActPlane:面向代理框架的可编程操作系统级策略执行

Yusheng Zheng, Tianyuan Wu, Quanzhi Fu, Tong Yu, Wenan Mao, Tao Ma, Dan Williams, Wei Wang, Andi Quinn

专题命中 安全训练 :safety(abstract)

AI总结 提出ActPlane,一种在操作系统内核中执行代理策略的引擎,通过eBPF实现信息流控制,弥补语义鸿沟,覆盖工具层无法观察的间接执行路径,开销1.9%-8.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 50%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31572 2026-07-01 cs.SE 新提交 50%

FormIDEAble: Safe and Socially-aware Autonomous Systems

FormIDEAble:安全且具有社会感知能力的自主系统

Livia Lestingi, Amel Bennaceur, Marcello M. Bersani, Carlos Gavidia-Calderon, Anastasia Kordoni, Mark Levine, Bashar Nuseibeh, Matteo Rossi

专题命中 安全训练 :safety(abstract)

AI总结 提出FormIDEAble方法,通过带代价的马尔可夫决策过程建模人机协作,将决策形式化为代价有界可达性问题,在保证安全的同时实现社会感知策略合成。

详情

展开后加载摘要…

URL PDF HTML 收藏