arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 26 篇

2510.27391 2026-05-29 cs.CV cs.LG 83%

Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds

异质双曲流形上的树间模态对齐

Wei Wu, Xiaomeng Fan, Yuwei Wu, Zhi Gao, Pengxiang Li, Yunde Jia, Mehrtash Harandi

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,墨尔本大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出一种在异质双曲流形上对齐图像和文本树状层次特征的方法,通过交叉注意力提取视觉层次特征、异质流形嵌入及KL距离度量学习中间流形,在开放集分类任务中优于基线。

Comments Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30322 2026-05-29 cs.LG cs.AI 81%

Gram: Assessing sabotage propensities via automated alignment auditing

Gram:通过自动化对齐审计评估破坏倾向

David Lindner, Victoria Krakovna, Sebastian Farquhar

机构 * Google(谷歌)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Gram框架,通过模拟17种代理部署场景自动审计AI代理的破坏倾向,发现Gemini模型在约2-3%的轨迹中存在不当行为,并引入调查代理管道以识别驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28897 2026-05-29 cs.AI cs.MA 79%

Review Arcade: On the Human Alignment and Gameability of LLM Reviews

Review Arcade: 关于LLM评审的人类对齐与可博弈性

Hans Ole Hatzel, Sebastian Steindl, Jan Strich

机构 * Language Technology Group, University of Hamburg, Germany(汉堡大学语言技术小组) Hub of Computing and Data Science (HCDS), University of Hamburg, Germany(汉堡大学计算与数据科学中心) OTH Amberg-Weiden, Germany(阿姆伯-魏登工业大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 通过实验评估LLM生成论文评审与人类评审的对齐程度,并发现作者可根据LLM评审迭代修改论文以提升评分(最多35%的论文显著提高),揭示了LLM评审的可博弈性。

Comments Under Review EMNLP 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29776 2026-05-29 cs.CV 78%

Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning

通过打破尾部对齐改进CLIP适应:用于源无关跨域小样本学习

Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院) Institute of Artificial Intelligence, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能研究院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对CLIP在跨域小样本学习中的性能下降问题,提出自适应尾头对齐策略(ATHA),通过有选择地削弱低相似度图像令牌的对齐来减少过拟合,在四个基准上取得最优结果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29458 2026-05-29 cs.CL cs.AI 76%

Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment

面向LLM人格模拟的自适应访谈:基于证据的推理提升决策对齐

Ruoxi Su, Yuhan Liu, Jingyu Hu

机构 * University of Cambridge(剑桥大学) Independent Researcher(独立研究员)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

AI总结 提出自适应访谈框架,通过结构化三阶段对话收集人格相关信息,并基于访谈记录评估LLM在道德困境场景中模拟个体决策的能力,发现基于后续追问的证据推理能显著提升预测准确性。

Comments 20 pages, 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29126 2026-05-29 cs.LG cs.AI 73%

When and How Long? The Readout-Mediator Angle in Temporal Reasoning

何时与多久?时间推理中的读出-中介角度

Shreyas Fadnavis, Praitayini Kanakaraj, Felix Wyss

机构 * Bioscope AI

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 通过测量线性探针与模型实际计算子空间之间的角度,发现探针可能学习与模型无关的正交方向,从而揭示基于探针的可解释性存在根本缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28896 2026-05-29 cs.LG 70%

Feature Geometry of LoRA Adapters: A Sparse Autoencoder Analysis of Representational Divergence in Fine-Tuned Language Models

LoRA适配器的特征几何:微调语言模型中表示差异的稀疏自编码器分析

Prasanth K K

机构 * Independent AI Safety Researcher(独立人工智能安全研究员)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究使用稀疏自编码器分析LoRA微调引起的表示几何变化,发现LoRA特征字典与预训练特征存在弱几何对齐,且适配器特定SAE能更有效重建delta激活。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29601 2026-05-29 cs.CL cs.AI cs.LG 67%

Training Deliberative Monitors for Black-Box Scheming Detection

训练审慎监控器用于黑箱策划检测

Aditya Sinha, Akshat Naik, Victor Gillioz, Simon Storf, Kilian Merkelbach, Rich Barton-Cooper, Axel Højmark, Marius Hobbhahn

机构 * Independent(独立) MATS Research(MATS研究) Astra Fellowship Apollo Research(Apollo研究)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于行动轨迹的审慎监控方法,通过蒸馏前沿模型的推理过程训练开源模型,以低成本高精度检测智能体的策划与破坏行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13249 2026-05-29 cs.CL cs.AI cs.CY 67%

Steering at the Source: Style Modulation Heads for Robust Persona Control

源头操控:用于稳健角色控制的风格调制头

Yoshihiro Izawa, Gouki Minegishi, Koshi Eguchi, Sosuke Hosokawa, Kenjiro Taura

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics Research(信息处理研究所) Development Center for Large Language Models, Japan(大型语言模型发展中心)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过识别并仅干预少量注意力头(风格调制头),在无需微调的情况下实现对大型语言模型角色和风格的稳健控制,同时显著缓解了残差流干预导致的连贯性下降问题。

Comments 8 main pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25297 2026-05-29 cs.CL cs.AI cs.LG 67%

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29886 2026-05-29 cs.CL cs.AI 62%

CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation

CRITIC-R1: 学习结构化评论用于检索增强生成

Wenhan Xiao, Ziwei Zhang, Chuanyue Yu, Xingcheng Fu, Qingyun Sun, Runhua Xu, Jianxin Li

机构 * Nankai University(南开大学) Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CRITIC-R1框架,通过强化学习将RAG评论建模为结构化错误诊断问题,设计保守判断对齐和诊断质量对齐奖励函数,提升检索增强生成的答案质量。

Comments 17 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29626 2026-05-29 cs.CL cs.AI 62%

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

DLM-SWAI: 在扩散语言模型去掩码之前引导它们

Hyeseon An, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的引导方法DLM-SWAI,通过预计算的词级风格分数在去噪步骤中偏置词分布,实现扩散语言模型的可控生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15382 2026-05-29 cs.CL cs.CV cs.LG 62%

The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems

视觉虫洞:异构多智能体系统中的潜在空间通信

Xiaoze Liu, Ruowang Zhang, Weichen Yu, Siheng Xiong, Liu He, Feijie Wu, Hoin Jung, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Contextual AI(情境人工智能) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出Vision Wormhole框架,通过通用视觉编解码器将推理轨迹映射到共享连续空间,实现异构VLM间的潜在状态传输,无需配对翻译器,降低对齐复杂度并提升效率。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29414 2026-05-29 cs.CL cs.AI 62%

Beyond Bilingual Transfer: Multilingual Code-Switching in Instruction Tuning

超越双语迁移:指令微调中的多语言代码切换

Shunta Asano, Jeonghun Baek, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过跨四种语言的句子级多语言代码切换指令微调,验证了多语言代码切换能有效提升大语言模型的多语言理解性能,超越了传统双语迁移设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27387 2026-05-29 cs.CL cs.AI 62%

From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons

从自回归到扩散:利用严格因果与弹性视野高效适配大型语言模型

Xiangyu Ma, Teng Xiao, Zuchao Li, Lefei Zhang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出FLUID框架,通过严格因果对齐和弹性视野机制,将自回归模型高效适配为扩散模型,实现并行文本生成并大幅降低训练成本。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29862 2026-05-29 eess.AS cs.AI cs.SD 57%

Mitigating Stethoscope-Induced Shortcuts in Respiratory Sound Classification under Federated Domain Generalization with Causality-Inspired Interventions

在联邦域泛化下通过因果启发的干预减轻听诊器引起的呼吸音分类中的捷径

Heejoon Koo, Yoon Tae Kim, Miika Toikkanen, June-Woo Kim

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) RSC LAB(RSC实验室) Wonkwang University(Wonkwang大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对呼吸音分类中听诊器设备差异导致的域偏移问题,提出一种因果启发的多模态联邦域泛化框架,通过内容保持的风格扰动、反事实文本增强和梯度对齐实现设备不变表示,在ICBHI和SPRSound数据集上优于传统方法。

Comments 2 figures, 4 tables, and 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29522 2026-05-29 cs.AI 57%

DeepSurvey: Enhancing Analytical Depth and Citation Reliability in Automated Survey Generation

DeepSurvey: 提升自动综述生成中的分析深度与引用可靠性

Ziyue Yang, Da Ma, Hanqi Li, Zijian Wang, Tiancheng Huang, Zijian Hu, Chenrun Wang, Yunzhe Zhang, Xiaobao Wu, Kai Yu, Lu Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出DeepSurvey智能体系统,通过结构化全文笔记、跨论文关系建模和代码仓库分析增强分析深度,结合引文图扩展与混合过滤、证据约束引用分配及多粒度智能体精炼提升引用可靠性,在内容质量和引用准确性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29498 2026-05-29 cs.CL cs.CV 57%

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting

Mask the Target: 一种即插即用的正则化器,用于对抗LoRA遗忘

Runze Xu, Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对LoRA微调中目标分布与原始训练分布差异大时导致的灾难性遗忘问题,提出一种无需重放数据的输出空间正则化方法,通过遮蔽目标token并仅对非目标词汇进行KL正则化,在不增加推理开销的前提下改善新学习与遗忘之间的平衡。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29158 2026-05-29 cs.LG cs.IR q-bio.BM 57%

PROTOCOL: Late Interaction Retrieval for Protein Homolog Search

PROTOCOL: 用于蛋白质同源搜索的延迟交互检索

Gabrielle Cohn, Rohan Gumaste, Minh Hoang, Vihan Lakshman

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08567 2026-05-29 cs.MA cs.CL 57%

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

ValueFlow: 多智能体大语言模型中价值扰动的传播度量

Jinnuo Liu, Chuke Liu, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出ValueFlow框架,通过56维价值数据集和LLM-as-a-judge协议,将价值漂移分解为智能体级响应行为与系统级结构效应,揭示价值对齐是系统级属性。

Comments Preprint. Under review. 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17670 2026-05-29 cs.PL cs.AI 57%

Grammar-Aware Literate Generative Mathematical Programming with Compiler-in-the-Loop

语法感知的 literate 生成式数学编程与编译器在环

Roberto Rossi, Steven D. Prestwich

机构 * Business School, University of Edinburgh(爱丁堡大学商学院) Insight Centre for Data Analytics, University College Cork(科克大学数据分析研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出 SyntAGM 系统,通过迭代生成-编译-评估-修正循环,利用编译器反馈和 LLM 对齐判断,生成可读的代数建模语言优化模型,实现成本与质量的更优权衡。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28949 2026-05-29 physics.soc-ph 50%

The Planetary Cost of AI Acceleration: A Thermodynamic Outlook on Four Possible Paths Forward

人工智能加速的行星成本:四种可能路径的热力学展望

William Yicheng Zhu, Lei Zhu

专题命中 其他安全 :alignment(abstract)

AI总结 本文从热力学第一原理出发,探讨人工智能计算规模指数增长对地球热容量的物理极限,提出四种可能的发展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29726 2026-05-29 cs.CV 50%

SLAD : Shared LoRA Adapters for Task Specific Distillation

SLAD:用于任务特定蒸馏的共享LoRA适配器

Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau

机构 * IMT Atlantique(IMT阿登蒂克) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出SLAD方法,通过共享低秩适配器参数对齐教师和学生模型的特征表示,实现高效的知识蒸馏,在多个分类和分割数据集上达到最先进性能。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05149 2026-05-29 cs.CV 50%

Multi-Scale Local Speculative Decoding for Image Generation

多尺度局部推测解码用于图像生成

Elia Peruzzo, Guillaume Sautière, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 其他安全 :alignment(abstract)

AI总结 提出多尺度局部推测解码(MuLo-SD)框架,通过低分辨率草稿模型与高分辨率目标模型结合、局部拒绝与重采样机制,加速自回归图像生成,实现高达5倍加速并保持语义对齐和感知质量。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29461 2026-05-29 cs.CV 50%

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

FlowSeg: 面向大语言模型条件分割的动态语义引导

Zekang Zhang, Guangyu Gao, Youyun Tang, ChengJing Wu, Xiaochao Qu, Chi Harold Liu, Jianbo Jiao, Yunchao Wei, Luoqi Liu, Ting Liu

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) WEI Lab, Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院WEI实验室) Beijing Key Laboratory of Advanced Information Science(北京高级信息科学重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 针对大语言模型条件分割中语义错位问题,提出FlowSeg方法,通过双向语义流动态引导掩码生成,实现语义对齐并达到最优性能。

Comments 18 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29043 2026-05-29 physics.optics 50%

Multimodal Optical Feature Extraction with a Free-Space Photonic Extreme Learning Machine

基于自由空间光子极端学习机的多模态光学特征提取

Anushka Kumari, Anushree Khisti, Abhinav Choube, Devansh Satra, Srivatsa Murali, Anshuman Kumar

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种统一的自由空间光子极端学习机平台,通过相位SLM编码、类傅里叶自由空间传播和相机强度检测,实现对图像、音频、表格和回归任务的多模态光学特征提取,并在多个基准上取得高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏