arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7978 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7978 篇

2603.12298 2026-03-16 cs.LG cs.AI 62%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 62%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11950 2026-03-13 cs.AI cs.LG 62%

Learning Transferable Sensor Models via Language-Informed Pretraining

通过语言引导预训练学习可迁移的传感器模型

Yuliang Chen, Arvind Pillai, Yu Yvonne Wu, Tess Z. Griffin, Lisa Marsch, Michael V. Heinz, Nicholas C. Jacobson, Andrew Campbell

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 SLIP通过语言引导预训练学习可迁移的传感器模型,整合对比对齐与传感器条件标注,支持不同时间分辨率和输入长度,实现跨领域任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05598 2026-03-13 cs.LG astro-ph.IM cs.AI physics.comp-ph 62%

On the Value of Tokeniser Pretraining in Physics Foundation Models

在物理基础模型中tokenizer预训练的价值

Hadi Sotoudeh, Payel Mukhopadhyay, Ruben Ohana, Michael McCabe, Neil D. Lawrence, Shirley Ho, Miles Cranmer

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。

Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09527 2026-03-11 cs.LG cs.AI 62%

Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation

通过参数和数据高效适应实现草稿模型的高效对齐

Luxi Lin, Zhihang Lin, Zhanpeng Zeng, Yuhao Chen, Qingyu Zhang, Jixiang Luo, Xuelong Li, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Shanghai Innovation Institute(上海创新研究院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI)) University of Science and Technology of China (USTC)(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出高效草稿适应框架EDA,通过解耦架构、数据再生策略和样本选择机制,实现草稿模型在特定领域微调时的高效适应,降低训练成本并提升推测解码性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 62%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21735 2026-03-11 cs.SE cs.AI cs.CL cs.MA 62%

GateLens: A Reasoning-Enhanced LLM Agent for Automotive Software Release Analytics

GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析

Arsham Gholamzadeh Khoee, Shuai Wang, Robert Feldt, Dhasarathy Parthasarathy, Yinan Yu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08425 2026-03-10 cs.AI cs.HC cs.LG cs.MA cs.SY eess.SY 62%

IronEngine: Towards General AI Assistant

IronEngine:迈向通用AI助手

Xi Mo

机构 * NiusRobotLab(尼乌斯机器人实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IronEngine通过统一编排核心实现通用AI助手,具备多阶段流程、智能工具路由和高效执行能力,适用于个人助手和自动化框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 62%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03992 2026-03-09 cs.CY cs.AI 62%

Measuring AI R&D Automation

衡量人工智能研发自动化

Alan Chan, Ranay Padarath, Joe Kwon, Hilary Greaves, Markus Anderljung

机构 * GovAI University of Oxford(牛津大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04805 2026-03-06 cs.CL cs.AI 62%

Attention's Gravitational Field:A Power-Law Interpretation of Positional Correlation

注意力的引力场:位置相关性的幂律解释

Edward Zhang

机构 * Edward Zhang 1(Edward Zhang)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04516 2026-03-06 cs.LG astro-ph.IM cs.AI 62%

Augmenting representations with scientific papers

用科学论文增强表示

Nicolò Oreste Pinciroli Vago, Rocco Di Tella, Carolina Cuesta-Lázaro, Michael J. Smith, Cecilia Garraffo, Rafael Martínez-Galarza

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。

Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04045 2026-03-05 cs.LG cs.AI 62%

Inference-Time Toxicity Mitigation in Protein Language Models

蛋白质语言模型中的推理时间毒性缓解

Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin Moreno, Enzo Ferrante

机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) Goodfire APOLO Biotech(APOLO生物技术)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03304 2026-03-05 cs.LG cs.AI 62%

Knowledge Graph and Hypergraph Transformers with Repository-Attention and Journey-Based Role Transport

知识图谱与超图变换器与仓库注意力和基于旅程的角色传输

Mahesh Godavarti

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合句子和结构化数据的模型,通过仓库注意力和基于旅程的角色传输实现语言和知识表示的分离,并支持多任务学习。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 62%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02765 2026-03-04 cs.LG cs.AI 62%

Next Embedding Prediction Makes World Models Stronger

下一步嵌入预测使世界模型更强大

George Bredis, Nikita Balagansky, Daniil Gavrilov, Ruslan Rakhimov

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI 62%

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01438 2026-03-03 cs.CL cs.AI 62%

Enhancing Persona Following at Decoding Time via Dynamic Importance Estimation for Role-Playing Agents

通过动态重要性估计增强解码时的个性跟随以用于角色扮演代理

Yuxin Liu, Mingye Zhu, Siyuan Liu, Bo Hu, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于理论的动态重要性估计方法,通过加权奖励引导解码提升角色扮演代理在动态场景中的个性跟随能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01274 2026-03-03 cs.LG cs.AI 62%

GlassMol: Interpretable Molecular Property Prediction with Concept Bottleneck Models

GlassMol:通过概念瓶颈模型实现可解释的分子属性预测

Oscar Rivera, Ziqing Wang, Matthieu Dagommer, Abhishek Pandey, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14760 2026-03-03 cs.CL cs.AI 62%

Residual Connections and the Causal Shift: Uncovering a Structural Misalignment in Transformers

残差连接与因果偏移:揭示变换器中的结构性不一致

Jonathan Lys, Vincent Gripon, Bastien Pasdeloup, Axel Marmoret, Lukas Mauch, Fabien Cardinaux, Ghouthi Boukli Hacene

机构 * IMT Atlantique, Lab-STICC, UMR CNRS 6285, Brest, France(IMT Atlantique,Lab-STICC,CNRS 6285研究所,布列塔尼,法国) Sony Europe Ltd. Stuttgart Technology Center, EUREC, Germany(索尼欧洲有限公司,斯图加特技术中心,EUREC,德国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了自回归变换器中残差连接与因果偏移的结构性不一致,并提出基于残差衰减的轻量级缓解方法,通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05296 2026-03-03 cs.AI cs.LG 62%

Control Tax: The Price of Keeping AI in Check

控制税:保持AI受控的成本

Mikhail Terekhov, Zhen Ning David Liu, Caglar Gulcehre, Samuel Albanie

机构 * EPFL(瑞士联邦理工学院) MATS

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出控制税概念,通过理论框架量化控制成本,评估语言模型在对抗性环境下的安全性,并开发优化的监控策略以平衡安全与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17692 2026-03-03 cs.LG cs.AI 62%

Agentic Unlearning: When LLM Agent Meets Machine Unlearning

代理反学习:当大语言模型代理遇见机器反学习

Bin Wang, Fan Wang, Pingping Wang, Jinyu Cong, Yang Yu, Yilong Yin, Zhongyi Han, Benzheng Wei

机构 * Center for Medical Artificial Intelligence, Shandong University of Traditional Chinese Medicine(山东中医药大学中医人工智能中心) School of Software, Shandong University(山东大学软件学院) School of Medical Information Engineering, Shandong University of Traditional Chinese Medicine(山东中医药大学医学信息工程学院) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SBU框架,通过同步双更新协议实现参数与记忆路径的联合反学习,有效减少敏感信息痕迹并保持数据保留质量。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22611 2026-03-03 cs.LG cs.AI 62%

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

分位数优势估计:稳定LLM推理的RLVR

Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过分位数优势估计方法,稳定RLVR训练过程,提升LLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24174 2026-03-02 cs.CL cs.AI cs.IT math.IT 62%

Task-Centric Acceleration of Small-Language Models

面向任务的小型语言模型加速

Dor Tsur, Sharon Adar, Ran Levy

机构 * Amazon(亚马逊)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24081 2026-03-02 cs.LG cs.AI 62%

Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning

自适应相关加权内在奖励用于强化学习

Viet Bac Nguyen, Phuong Thai Nguyen

机构 * Institute for Artificial Intelligence(人工智能研究所) VNU-University of Engineering and Technology(越南工程与技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ACWI通过自适应相关加权内在奖励机制提升稀疏奖励强化学习中的探索效率和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23387 2026-03-02 cs.SD cs.AI cs.CL eess.AS 62%

Hello-Chat: Towards Realistic Social Audio Interactions

Hello-Chat: 向真实社交音频交互迈进

Yueran Hou, Peilei Jia, Zihan Sun, Qihang Lu, Wenbing Yang, Yingming Gao, Ya Li, Jun Gao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20031 2026-02-27 cs.AI cs.LG 62%

Latent Introspection: Models Can Detect Prior Concept Injections

潜在自我反思:模型可以检测先前概念注入

Theia Pearson-Vogel, Martin Vanek, Raymond Douglas, Jan Kulveit

机构 * ACS Research, CTS, Charles University(ACS研究机构、CTs、查尔斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Qwen 32B模型能检测并识别先前注入的概念,通过提供准确的AI自我反思机制信息可显著提升检测效果,同时提高注入概念间的互信息。

Comments 28 pages, 17 figures. Submitted to ICML 2026. Workshop version submitted to ICLR 2026 Workshop on Latent and Implicit Thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22576 2026-02-27 cs.CL cs.IR cs.LG 62%

Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training

Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练

Tianle Xia, Ming Xu, Lingxiang Hu, Yiding Sun, Wenwei Li, Linfang Shang, Liqun Liu, Peng Shu, Huan Yu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21442 2026-02-26 cs.LG cs.AI 62%

MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning

MINAR: 图神经网络中神经算法推理的机制可解释性

Jesse He, Helen Jenne, Max Vargas, Davis Brown, Gal Mishne, Yusu Wang, Henry Kvinge

机构 * Pacific Northwest National Laboratory, Richland, WA(太平洋西北国家实验室) Halıcıoğlu Data Science Institute, University of California, San Diego, San Diego, CA(哈利奇奥格鲁数据科学研究所,加州大学圣地亚哥分校) Department of Computer and Information Science, University of Pennsylvania, Pennsylvaina, PA(计算机与信息科学系,宾夕法尼亚大学) Department of Mathematics, University of Washington, Seattle, WA(数学系,华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 MINAR是一种用于图神经网络中神经算法推理的机制可解释性工具,通过归因修补方法发现电路,揭示训练过程中的电路形成和剪枝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21365 2026-02-26 cs.CV cs.AI cs.LG eess.IV 62%

Towards Controllable Video Synthesis of Routine and Rare OR Events

面向常规和罕见OR事件可控视频合成

Dominik Schneider, Lalithkumar Seenivasan, Sampath Rapuri, Vishalroshan Anil, Aiza Maksutova, Yiqing Shen, Jan Emily Mangulabnan, Hao Ding, Jose L. Porras, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University Munich(慕尼黑技术大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。

Comments Accepted to IPCAI 2026 and submitted to IJCARs

详情

展开后加载摘要…

URL PDF HTML 收藏