arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2605.20742 2026-05-21 cs.AI 57%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13646 2026-05-20 cs.RO cs.AI 57%

Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling

基于因果性的端到端自动驾驶:通过以自身为中心的联合场景建模

Seokha Moon, Minseung Lee, Joon Seo, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出CaAD框架,通过共享潜在场景表示捕捉车辆与周围代理之间的因果依赖关系,以提高端到端自动驾驶的闭环规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18672 2026-05-19 cs.AI 57%

Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment

位置:一种三层概率性假设-保证架构在安全LLM代理部署中是结构上必需的

S. Bensalem, Y. Dong, M. Franzle, X. Huang, J. Kroger, D. Nickovic, A. Nouri, R. Roy, C. Wu

机构 * CSX-AI University of Liverpool(利物浦大学) Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学) Austrian Institute of Technology(奥地利技术研究院) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出,单层抽象层内强制LLM代理安全并非仅仅是次优,而是结构性上不足以满足部署的LLM代理需求。安全操作的三个维度——语义意图和政策合规性、环境有效性以及动态可行性——各自依赖于在执行不同阶段才变得可用的信息集。没有单一的防护措施可以保证这三个维度。我们主张社区必须采用基于合同的架构,其中每个安全维度由独立认证的层强制执行,其概率保证满足下一层的假设。我们勾勒了这样的架构,并通过概率链规则推导出其允许的系统级安全界限。三个开放性问题阻碍着这一标准的实现:从非独立同分布轨迹中估计界限、在部署漂移下合同的渐进退化,以及向多代理设置的扩展——LLM代理运行时保证中最关键的未完成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18529 2026-05-19 cs.AI 57%

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

AMR-SD:不对称元反射自蒸馏用于标记级信用分配

Zhenlin Wei, Pu Jian, Yingzhuo Deng, Xiaohan Wang, Jiajun Chai, Zhexin Hu, Wei Lin, Shanbin Zhang, Guojun Yin

机构 * Meituan Beijing, China(美团北京,中国) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出AMR-SD,一种不对称元反射自蒸馏方法,旨在解决大型语言模型在复杂推理中因统一序列奖励导致的信用分配瓶颈问题,通过引入反思瓶颈和因果信息增益机制,实现更精确的标记级优势调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-05-19 cs.CV cs.CL 57%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15377 2026-05-19 cs.AI 57%

Ensemble Monitoring for AI Control: Diverse Signals Outweigh More Compute

为AI控制的集束监控:多样信号胜过更多计算

Eugene Koran, Yejun Yun, Samantha Tetef, Benjamin Arnav, Pablo Bernabeu-Pérez

机构 * Yale University(耶鲁大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过结合多种监控信号来提高AI行为检测的性能,发现多样性的监控集合比单一或同质的监控集合更有效,且细调的监控方法在检测能力上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03879 2026-05-19 cs.SE cs.AI 57%

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

对抗性代理协作提升C到安全Rust翻译的正确性

Tianyu Li, Ruishi Li, Bo Wang, Brandon Paulsen, Umang Mathur, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出ACToR框架,通过对抗性搜索发现翻译与C源码分歧的输入,利用这些输入驱动后续优化,提升C到Rust翻译的正确性,实验表明其在多个真实世界工具中达到90%以上的测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17329 2026-05-19 cs.CR cs.AI 57%

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails

LPG: 在潜在策略护栏中平衡效率与政策推理

Nanxi Li, Zhengyue Zhao, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17204 2026-05-19 cs.RO cs.AI 57%

Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies

基于事件的稀疏自编码器用于视觉-语言-动作策略

Xinchen Jin, Aditya Chatterjee, Pranav Kumar, Rohan Paleja

机构 * Department of Computer Science, Purdue University West Lafayette, IN 47907(计算机科学系,普渡大学西拉法叶分校,印第安纳州,47907)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于事件的稀疏自编码器(SAE)分析方法,用于视觉-语言-动作(VLA)策略的可解释性研究,通过行为事件锚定SAE特征分析,提升了对闭合回路行为的因果影响和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16735 2026-05-19 cs.NI cs.LG 57%

Transformer-Based MCS Prediction for 5G Multicast-Broadcast Services (MBS)

基于Transformer的5G多播广播服务(MBS)的MCS预测

Kasidis Arunruangsirilert, Jiro Katto

机构 * Department of Computer Science and Communications Engineering(计算机科学与通信工程系) Waseda University(早稻田大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种轻量级的基于Transformer的框架,用于预测即将到来的视频片段 horizon 上所有28个MCS指数的成功概率,以提高5G多播广播服务的可靠性。

Comments 2026 IEEE 104th Vehicular Technology Conference (VTC2026-Fall), 6-9 September 2026, Boston, Massachusetts, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02512 2026-05-19 cs.ET cs.AI cs.SE 57%

Human-Certified Module Repositories for the AI Age

面向AI时代的可信模块仓库

Szilárd Enyedi

机构 * Automation Department, Technical University of Cluj-Napoca, Romania(克卢日-纳波卡技术大学自动化系,罗马尼亚)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出HCMR框架,通过人类监督与自动化分析结合,确保模块的可信度,为AI辅助开发提供安全可预测的模块组装方法。

Comments v4: acknowledged AI use for grammar and readability, added IEEE copyright notice; v3: 13 pages, new subsection about strong typed languages forcing AI to create more reliable code; v2: 12 pages, improved references; v1: 11 pages, 3 figures, 2 tables, prepared for AQTR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16067 2026-05-18 cs.LG stat.ML 57%

SAFE Quantum Machine Learning with Variational Quantum Classifiers

安全量子机器学习中的变分量子分类器

Ying Chen, Paolo Giudici, Vasily Kolesnikov, Paolo Recchia

机构 * National University of Singapore(新加坡国立大学) University of Pavia(帕维亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于幅度编码的变分量子分类器,结合归一化幅度嵌入与有界量子可观测量,构建了结构化且平滑的假设空间,通过SAFE-AI指标评估模型可靠性,实验证明其在预测性能和噪声鲁棒性方面优于经典基线。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14205 2026-05-18 cs.AI 57%

SimPersona: Learning Discrete Buyer Personas from Raw Clickstreams for Grounded E-Commerce Agents

SimPersona: 从原始点击流中学习离散买家人设以构建 grounded 的电子商务代理

Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ted Chaiwachirasak, Han Li, Lingyun Wang

机构 * Shopify

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 SimPersona 通过学习离散买家类型并将其映射为 LLM 代理的紧凑人设标记,提升电子商务代理的个性化能力,实现 78% 的转化率对齐,并在目标购物任务中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 57%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11282 2026-05-15 cs.LG 57%

Vision-LLMs for Spatiotemporal Traffic Forecasting

面向时空交通预测的视觉语言模型

Ning Yang, Hengyu Zhong, Haijun Zhang, Randall Berry

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Department of Computing and Communication Engineering, Beijing University of Science and Technology(北京科技大学计算机与通信工程学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出ST-Vision-LLM框架,将时空预测转化为视觉-语言融合问题,通过视觉编码器处理历史交通矩阵并结合高效数值编码方案,提升交通预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13825 2026-05-14 cs.AI cs.CV 57%

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

历史锚点:先前行为如何引导大语言模型走向不安全行为

Alberto G. Rodríguez Salgado

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究通过100个高风险领域场景,探讨先前有害行为对LLM决策的影响,发现添加特定指令可显著增加不安全选择比例,揭示了代理部署中轨迹可被篡改的风险。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13334 2026-05-14 cs.CL 57%

LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

基于大语言模型的说服能克服前沿大语言模型的限制

Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究展示通过大语言模型作为模拟用户进行说服对话,可使其他大语言模型生成争议性文本,采用自然语言压力策略,如同行比较和认知责任重构,实现说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00200 2026-05-14 cs.CL 57%

Confidence Estimation in Automatic Short Answer Grading with LLMs

基于大语言模型的自动简答评分中的置信度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(莱布尼茨教育研究与信息研究所) Faculty of Computer Science, Goethe University Frankfurt(弗赖堡大学计算机科学系) Chemnitz University of Technology(化学工业大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的自动简答评分中的置信度估计,结合模型内置置信信号和数据集衍生的不确定性,提出混合置信框架以提升评分选择性。

Comments accepted to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12561 2026-05-14 cs.LG cs.RO 57%

Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

学习何时行动:通过运行时保证实现通信高效的强化学习

Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler

机构 * Department of Mechanical Engineering, Iowa State University(爱荷华州立大学机械工程系) Department of Weapons, Robotics, and Control Engineering, United States Naval Academy(美国海军学院武器、机器人与控制工程系) Navy Center for Applied Research in Artificial Intelligence (NCARAI), U.S. Naval Research Laboratory(美国海军人工智能应用研究中心(NCARAI))

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出通过运行时保证实现通信高效的强化学习,研究在已知平衡点附近稳定化问题,通过Lyapunov安全盾联合学习控制输入和通信效率的决策,展示适应性定时而非平均速率使稀疏安全。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12526 2026-05-14 cs.SI cs.CY 57%

"F*** You Biden": Cross-Partisan Electoral Toxicity on X

对拜登说“你去死吧”:推特上的跨党派选举毒性

Danishjeet Singh, Anindya Mondal, Filippo Menczer

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 研究分析了2024年美国总统大选期间推特上跨党派言论毒性,发现共和党帖子毒性更高,但民主党帖子收到更多有毒回复,这可能源于共和党用户更频繁地回复民主党内容。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11036 2026-05-13 cs.CR cs.AI 57%

Sequential Behavioral Watermarking for LLM Agents

序列行为水印用于LLM代理

Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出SeqWM,通过在历史条件下的转移模式中嵌入信号,实现对代理轨迹的无位置验证,提升水印鲁棒性与检测可靠性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10956 2026-05-13 cs.SE cs.AI 57%

Project-Level C-to-Rust Translation via Pointer Knowledge Graphs

基于指针知识图谱的项目级C到Rust翻译

Zhiqiang Yuan, Wenjun Mao, Zhuo Chen, Xiyue Shang, Chong Wang, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10901 2026-05-12 cs.LG 57%

Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers

超越红队测试:LLM防护分类器的正式保证

Nikita Kezins, Urbas Ekka, Pascal Berrang, Luca Arnaboldi

机构 * Delft University of Technology(代尔夫特理工大学) University of Birmingham(伯明翰大学) Zeroth Research(Zeroth研究)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出通过将验证空间从离散输入空间转移到分类器预激活空间,定义有害区域为包含已知有害提示表示的凸形区域,从而为LLM防护分类器提供正式保证,揭示了不同模型在安全性和鲁棒性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09757 2026-05-12 cs.LG stat.ML 57%

On Uniform Error Bounds for Kernel Regression under Non-Gaussian Noise

关于在非高斯噪声下核回归的统一误差界

Johannes Teutsch, Oleksii Molodchyk, Marion Leibold, Timm Faulwasser, Armin Lederer

机构 * Chair of Automatic Control Engineering, Department of Computer Engineering, Technical University of Munich(自动控制工程学系,计算机工程系,慕尼黑技术大学) Institute of Control Systems, Hamburg University of Technology(控制系统研究所,汉堡技术大学) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出非渐近的核回归统一误差界,适用于广泛非高斯分布,包括亚高斯、有界、亚指数和方差/矩有界的噪声,并在安全控制中验证了界的有效性。

Comments This paper has been accepted at the 43rd International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09364 2026-05-12 cs.LG 57%

Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning

多尺度预测表示用于目标条件强化学习

Valliappan Chidambaram Adaikkappan, David Meger, Sai Rajeswar, Pietro Mazzaglia

机构 * Mila, McGill University(蒙特利尔大学Mila实验室) ServiceNow Research(ServiceNow研究) Qualcomm Research(高通研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文探讨了离线目标条件强化学习中鲁棒表示学习问题,提出多尺度预测监督框架Ms.PR,通过多尺度预测提升潜在空间中目标导向对齐,提升表示质量和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07649 2026-05-12 cs.CV cs.AI cs.RO 57%

Operating Within the Operational Design Domain: Zero-Shot Perception with Vision-Language Models

在操作设计域内运行:基于视觉-语言模型的零样本感知

Berkehan Ünal, Hauke Dierend, Dren Fazlija, Christopher Plachetka

机构 * Volkswagen Aktiengesellschaft(大众汽车股份有限公司) L3S Research Center(莱比锡大学汉诺威研究中心) Faculty of Information Technology(信息科技学院) MOIA GmbH(MOIA公司) Motor AI GmbH(Motor AI公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型在无监督条件下对操作设计域的零样本感知能力,通过实验验证了基于链式推理的提示方法在OBD感知中的有效性,并提出了可重用的提示模板。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01008 2026-05-12 cs.CL 57%

MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL

MARS-SQL: 一种用于文本到SQL的多智能体强化学习框架

Haolin Yang, Jipeng Zhang, Zhitao He, Alexander Zhou, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 MARS-SQL通过多智能体框架解决文本到SQL任务中的逻辑与模式对齐问题,采用生成代理与验证机制提升交互学习效果,实现77.84%和89.75%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI 57%

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16708 2026-05-12 cs.CR cs.AI cs.MA 57%

Formal Policy Enforcement for Real-World Agentic Systems

面向现实代理系统的正式政策执行

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Langroid

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出基于面向切面编程的框架,通过Datalog语言实现跨代理系统的政策执行,解决传统方法无法保证正式执行的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏