arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2603.25145 2026-03-27 cs.CV cs.LG 83%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24849 2026-03-27 cs.HC cs.AI cs.CV cs.CY 73%

Gaze patterns predict preference and confidence in pairwise AI image evaluation

注视模式预测成对AI图像评估中的偏好和信心

Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai, Ankur Samanta, Paul Sajda

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.CY

AI总结 研究通过眼动追踪揭示成对AI图像评估中的偏好形成过程,发现注视模式能预测二元选择和信心,表明眼动数据能提供与偏好注释质量相关的隐含信号。

Comments This paper has been accepted to ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2506.13734 2026-03-27 cs.CL cs.AI cs.LG 67%

Instruction Following by Principled Boosting Attention of Large Language Models

通过原理性提升大语言模型的注意力来实现指令遵循

Vitoria Guardieiro, Avishree Khare, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25022 2026-03-27 cs.AI cs.CR cs.CY cs.LG 67%

A Public Theory of Distillation Resistance via Constraint-Coupled Reasoning Architectures

通过约束耦合推理架构的公开蒸馏阻力理论

Peng Wei, Wesley Shu

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种理论框架,通过约束耦合推理架构减少蒸馏 asymmetry,核心观点是高阶能力与内部稳定性约束耦合时蒸馏价值降低,提供可验证的理论主张和实验假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 62%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25419 2026-03-27 cs.CL 57%

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

TAPO:多语言数学推理中的翻译增强策略优化

Xu Huang, Zhejian Lai, Zixian Huang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 TAPO通过引入翻译增强策略优化框架,提升多语言数学推理能力,有效结合语言理解和推理能力,优于基线方法并在未见语言和领域任务中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25100 2026-03-27 cs.MA cs.AI cs.CR cs.DC 57%

From Logic Monopoly to Social Contract: Separation of Power and the Institutional Foundations for Autonomous Agent Economies

从逻辑垄断到社会契约:权力分离与自主代理经济制度的基础

Anbang Ruan

机构 * NetX Foundation(NetX 基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过社会契约实现权力分离,解决多智能体框架中的逻辑垄断问题,引入Agent Enterprise paradigm并构建NetX Enterprise Framework,建立自主代理经济体系。

Comments 143 pages, 15 tables, 23 figures, 173 references, 4 appendices. Working paper -- pre-peer-review preprint. LaTeX source with arXiv-style template. Three companion manuscripts under development targeting peer-reviewed venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25035 2026-03-27 cs.AI 57%

Mechanistically Interpreting Compression in Vision-Language Models

视觉语言模型压缩的机理解释

Veeraraju Elluru, Arth Singh, Roberto Aguero, Ajay Agarwal, Debojyoti Das, Hreetam Paul

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校) AIM Intelligence National Institute of Technology Agartala(国立阿加尔塔拉理工学院) Fordham University(福特汉姆大学) University of Fukui(福井大学) Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过因果电路分析和交叉编码器特征比较,研究了剪枝和量化对视觉语言模型内部结构的影响,并提出VLMSafe-420基准测试,揭示压缩对安全行为的影响。

Comments 15 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24908 2026-03-27 cs.RO cs.AI cs.MA 57%

Integrated Multi-Drone Task Allocation, Sequencing, and Optimal Trajectory Generation in Obstacle-Rich 3D Environments

集成多无人机任务分配、任务序列和最优轨迹生成在障碍密集的3D环境中

Yunes Alqudsi, Murat Makaraci

机构 * Aerospace Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院航空航天工程系) Interdisciplinary Research Center for Aviation and Space Exploration, KFUPM(法赫德国王石油矿产大学航空与空间探索跨学科研究中心) Mechanical Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院机械工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出IMD-TAPP框架,通过结合离散任务规划和连续轨迹合成,解决多无人机在障碍密集环境中的任务分配、序列规划和安全轨迹生成问题,实现动态可行且无碰撞的高效路径。

Comments Resubmission following accepted appeal (MOD-78958). Resubmitting to cs.RO with cross-lists cs.MA and cs.AI as advised by arXiv Support

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24595 2026-03-27 cs.PL cs.AI 57%

Model2Kernel: Model-Aware Symbolic Execution For Safe CUDA Kernels

Model2Kernel: 用于安全CUDA内核的模型感知符号执行

Mengting He, Shihao Xia, Haomin Jia, Wenfei Wu, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器实验室) Peking University(北京大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Model2Kernel,通过模型感知动态分析验证LLM推理中CUDA内核的内存安全,利用专门的符号执行技术发现353个未知bug,仅产生9个误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 57%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 50%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2509.24296 2026-03-27 cs.CL cs.AI 84%

DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models

DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复

Zherui Li, Zheng Nie, Zhenhong Zhou, Yue Liu, Yitong Zhang, Yu Cheng, Qingsong Wen, Kun Wang, Yufei Guo, Jiaheng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Squirrel Ai Learning(松鼠AI) Peking University(北京大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI 81%

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25164 2026-03-27 cs.CR cs.AI 79%

PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems

PIDP-Attack:将提示注入与数据库污染攻击结合在检索增强生成系统中

Haozhen Wang, Haoyue Liu, Jionghao Zhu, Zhichao Wang, Yongxin Guo, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝和天猫集团)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出PIDP-Attack,结合提示注入与数据库污染攻击,针对检索增强生成系统中的对抗攻击问题,通过在推理时添加恶意字符并注入少量污染文档,有效操控LLM响应,实验显示其在开放域问答任务中攻击成功率提升4%-16%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25176 2026-03-27 cs.CL 77%

Prompt Attack Detection with LLM-as-a-Judge and Mixture-of-Models

基于LLM-as-a-Judge和混合模型的提示攻击检测

Hieu Xuan Le, Benjamin Goh, Quy Anh Tang

机构 * GovTech, Singapore(新加坡政府科技局)

专题命中 越狱攻击 :safety(abstract);red teaming(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文探讨轻量级通用LLM在真实生产环境中作为安全判断者的可靠性,通过结构化推理过程检测提示攻击,实验表明Gemini-2.0-Flash-Lite-001等模型可有效用于实时防护,同时评估混合模型对攻击检测的提升效果。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11864 2026-03-27 cs.CR 67%

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

NeuroStrike:对对齐大语言模型的神经层面攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2603.23783 2026-03-27 cs.LG cs.AI math.OC math.PR stat.ML 81%

Probabilistic Geometric Alignment via Bayesian Latent Transport for Domain-Adaptive Foundation Models

通过贝叶斯潜在传输的概率几何对齐用于领域自适应基础模型

Aueaphum Aueawatthanaphisut, Kuepon Auewattanapisut

机构 * School of Information, Computer Communication Technology Sirindhorn International Institute of Technology, Thammasat University Pathumthani, Thailand 0009-0006-4313-7359 epartment of Architecture, Faculty of Architecture Khon Kaen University Khon Kaen, Thailand

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种概率潜在传输框架,通过在表示空间中将领域适应建模为随机几何对齐问题,解决领域自适应中的潜在分布不匹配、优化动态不稳定和不确定性传播校准问题。

Comments 11 pages, 8 Figures, 25 Equations, 5 Tables and 3 Theorems

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 2 篇

2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 隐私与版权 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24772 2026-03-27 cs.CL cs.AI cs.LG 67%

Evaluating Fine-Tuned LLM Model For Medical Transcription With Small Low-Resource Languages Validated Dataset

评估细调LLM模型在医疗转录中的表现:针对小规模低资源语言验证数据集

Mohammed Nowshad Ruhani Chowdhury, Mohammed Nowaz Rabbani Chowdhury, Sakari Lukkarinen

机构 * School of ICT and Industrial Management(信息通信技术与工业管理学院) Metropolia University of Applied Sciences(Metropolia应用科学大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在有限的芬兰语验证数据集上微调LLaMA 3.1-8B,评估了领域对齐的NLP模型在医疗转录中的有效性,结果显示BLEU、ROUGE-L和BERTScore F1等指标表现良好,表明细调在芬兰语医疗口语转录中的可行性。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 20 篇

2603.24904 2026-03-27 cs.AI cs.CR 85%

On the Foundations of Trustworthy Artificial Intelligence

人工智能可信性的基础

TJ Dunham

机构 * ARC

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出确定性推理是可信AI的必要充分条件,并通过信任熵量化非确定性的成本,证明验证失败概率精确为1-2^{-H_T}。通过构建纯整数推断引擎,验证了跨架构模型的确定性,展示了AI信任的本质是算术问题。

Comments 26 pages, 10 tables, 1 figure, 17 theorems/definitions/corollaries

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25692 2026-03-27 cs.LG cs.AI cs.AR cs.ET 81%

A Unified Memory Perspective for Probabilistic Trustworthy AI

概率可信人工智能的统一内存视角

Xueji Zhao, Likai Pei, Jianbo Liu, Kai Ni, Ningyuan Cao

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一内存视角分析概率可信AI,揭示随机需求降低数据访问效率并驱动系统进入熵受限操作,定义内存级评估标准,分析传统架构局限并探讨新型概率计算内存方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 79%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06055 2026-03-27 cs.LG 79%

A Trustworthy By Design Classification Model for Building Energy Retrofit Decision Support

为建筑节能改造决策支持设计的可信分类模型

Panagiota Rempi, Sotiris Pelekis, Alexandros Menelaos Tzortzis, Evangelos Spiliotis, Evangelos Karakolis, Christos Ntanos, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(雅典国家技术大学电气与计算机工程学院决策支持系统实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出一种可信-by-设计的机器学习框架,通过条件表格生成对抗网络和神经网络多标签分类器,为住宅建筑提供节能策略推荐,结合SHAP解释层提升透明度和可信度,验证了在不同数据条件下性能提升达53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 79%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 76%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI 62%

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 62%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24618 2026-03-27 cs.AR cs.AI cs.LG 62%

Causal AI For AMS Circuit Design: Interpretable Parameter Effects Analysis

因果AI用于AMS电路设计:可解释的参数影响分析

Mohyeu Hussain, David Koblah, Reiner Dizon-Paradis, Domenic Forte

机构 * University of Florida(佛罗里达大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于因果推理的框架,通过SPICE仿真数据构建DAG并估算ATE,实现参数影响的可解释性分析,验证了因果AI在AMS设计中的高精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏