arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 19 篇

2602.17095 2026-03-09 cs.LG cs.AI 81%

FLoRG: Federated Fine-tuning with Low-rank Gram Matrices and Procrustes Alignment

FLoRG: 联邦微调与低秩格拉姆矩阵及普鲁斯特对齐

Chuiyang Meng, Ming Tang, Vincent W. S. Wong

机构 * The University of British Columbia(不列颠哥伦比亚大学) Southern University of Science and Technology(南方科技大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 FLoRG通过使用单一低秩矩阵和普鲁斯特对齐方法,提高联邦微调的效率和准确性,减少通信开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08820 2026-03-09 cs.CL 79%

CAReDiO: Cultural Alignment via Representativeness and Distinctiveness Guided Data Optimization

CAReDiO:通过代表性与独特性引导的数据优化实现文化对齐

Jing Yao, Xiaoyuan Yi, Jindong Wang, Zhicheng Dou, Xing Xie

机构 * Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 CAReDiO通过代表性与独特性引导的数据优化,提升多文化环境下LLM的对齐效果与文化建模精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06077 2026-03-09 cs.IT cs.GT math.IT 78%

Distributed Semantic Alignment over Interference Channels: A Game-Theoretic Approach

分布式语义对齐 over 干扰信道:一种博弈论方法

Giuseppe Di Poce, Mattia Merluzzi, Emilio Calvanese Strinati, Paolo Di Lorenzo

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出了一种基于博弈论的分布式语义对齐方法,通过非合作博弈优化MIMO收发器,解决语义匹配和干扰问题,提升AI驱动系统通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05762 2026-03-09 eess.SY cs.SY 78%

Combinatorial Safety-Critical Coordination of Multi-Agent Systems via Mixed-Integer Responsibility Allocation and Control Barrier Functions

通过混合整数责任分配和控制屏障函数实现多智能体系统的组合安全关键协调

Johannes Autenrieb, Mark Spiller, Hyo-Sang Shin, Namhoon Cho

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出通过混合整数规划和控制屏障函数实现多智能体系统的安全关键协调,以提高避障效率和减少计算复杂性。

Comments 6 pages, 4 figures, submitted to the IEEE for possible publication,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06495 2026-03-09 cs.LG cs.AI cs.CL 67%

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

COLD-Steer: 通过上下文一步学习动态引导大型语言模型

Kartik Sharma, Rakshit S. Trivedi

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COLD-Steer通过近似学习动态实现无需训练的LLM引导,有效提升引导效果并减少样本需求。

Comments ICLR 2026. Code available at https://github.com/Ksartik/cold-steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 67%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL 67%

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03992 2026-03-09 cs.CY cs.AI 62%

Measuring AI R&D Automation

衡量人工智能研发自动化

Alan Chan, Ranay Padarath, Joe Kwon, Hilary Greaves, Markus Anderljung

机构 * GovAI University of Oxford(牛津大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06459 2026-03-09 cs.CV cs.AI 57%

Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement

基础模型知道几何吗?通过冻结特征进行连续物理测量

Yakov Pyotr Shkolnikov

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究发现视觉-语言模型通过冻结特征可实现连续几何测量,LoRA微调和架构分析揭示了路径训练缺陷及中层注意力头对几何信号的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06024 2026-03-09 cs.CL cs.CV 57%

ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning

ViewFusion:多视角推理的结构化空间思维链

Xingjian Tao, Yiwei Wang, Yujun Cai, Yifan Song, Jing Tang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 ViewFusion通过两阶段框架提升多视角推理准确率,通过空间预对齐与问题驱动推理结合,有效提升复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22289 2026-03-09 q-bio.QM cs.LG q-bio.GN 57%

What Topological and Geometric Structure Do Biological Foundation Models Learn? Evidence from 141 Hypotheses

生物基础模型学习了哪些拓扑和几何结构?来自141个假设的证据

Ihor Kendiukhov

机构 * Department of Computer Science University of Tübingen(计算机科学系图宾根大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 生物基础模型通过大规模假设筛选发现,其学习的几何结构具有生物意义,且在不同模型间共享,但基因位置存在差异,同时信号在免疫组织中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13350 2026-03-09 cs.LG 57%

Beyond Mapping : Domain-Invariant Representations via Spectral Embedding of Optimal Transport Plans

超越映射:通过最优运输计划的谱嵌入获得领域不变表示

Abdel Djalil Sad Saoud, Fred Maurice Ngolè Mboula, Hanane Slimani

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过谱嵌入平滑运输计划来获得领域不变表示,以解决训练与推理数据分布偏移问题,在多个音频和电气检测任务中取得优异性能。

Comments Accepted at The IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03738 2026-03-09 cs.CL 57%

Activation-Space Personality Steering: Hybrid Layer Selection for Stable Trait Control in LLMs

激活空间人格引导:用于LLMs中稳定特质控制的混合层选择

Pranav Bhandari, Nicolas Fay, Sanjeevan Selvaganapathy, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理学科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出通过混合层选择方法,在LLMs中实现稳定的人格控制,利用Big Five人格特质构建低秩子空间,以提升模型输出的可控性与实用性。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17859 2026-03-09 eess.SY cs.LG cs.SY 57%

Mixed Monotonicity Reachability Analysis of Neural ODE: A Trade-Off Between Tightness and Efficiency

神经ODE的混合单调性可达性分析:紧致性与效率之间的权衡

Abdelrahman Sayed Sayed, Pierre-Jean Meyer, Mohamed Ghazel

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于区间的方法,利用混合单调性技术对神经ODE进行可达性分析,在紧致性和效率之间取得平衡,适用于高维实时安全应用。

Comments 27 pages, 11 figures, Accepted for publication in PMLR proceedings of NeurReps 2025 co-located with NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06265 2026-03-09 cs.CV cs.AI 57%

SPARC: Concept-Aligned Sparse Autoencoders for Cross-Model and Cross-Modal Interpretability

SPARC:概念对齐的稀疏自编码器用于跨模型和跨模态可解释性

Ali Nasiri-Sarvi, Hassan Rivaz, Mahdi S. Hosseini

机构 * Department of Computer Science and Software Engineering (CSSE) Concordia University, Canada(计算机科学与软件工程系(CSSE)康科迪亚大学,加拿大) Department of Electrical and Computer Engineering (ECE) Concordia University, Canada(电气与计算机工程系(ECE)康科迪亚大学,加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SPARC通过稀疏自编码器实现跨模型和跨模态的概念对齐,提升概念表示的一致性与可解释性

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06037 2026-03-09 cs.SE 50%

Detecting Semantic Alignments between Textual Specifications and Domain Models

检测文本规范与领域模型之间的语义对齐

Shwetali Shimangaud, Lola Burgueño, Rijul Saini, Jörg Kienzle

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出了一种基于自然语言处理和大型语言模型的方法,用于检测文本规范与领域模型之间的语义对齐,通过分类模型元素的对齐状态并提供相关证据句子,实现高精度的对齐检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05787 2026-03-09 cs.CV 50%

Spectral Probing of Feature Upsamplers in 2D-to-3D Scene Reconstruction

特征上采样器在2D到3D场景重建中的频谱探测

Ling Xiao, Yuliang Xiu, Yue Chen, Guoming Wang, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) Westlake University(西湖大学) Zhejiang University(浙江大学) The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出频谱诊断框架,通过六个指标评估特征上采样器对3D重建的影响,发现频谱一致性比空间细节更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05546 2026-03-09 cs.RO cs.CV 50%

Digital-Twin Losses for Lane-Compliant Trajectory Prediction at Urban Intersections

面向城市交叉口的数字孪生轨迹预测中的损失函数

Kuo-Yi Chao, Erik Leo Haß, Melina Gegg, Jiajie Zhang, Ralph Raßhofer, Alois Christian Knoll

机构 * Technical University of Munich, Munich, Germany(慕尼黑技术大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出基于数字孪生的多损失学习方法,用于提升城市交叉口的V2X轨迹预测安全性与准确性。

Comments 7 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15481 2026-03-09 cs.CV 50%

FunnyNodules: A Customizable Medical Dataset Tailored for Evaluating Explainable AI

FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI

Luisa Gallée, Yiheng Xiong, Meinrad Beer, Michael Götz

机构 * Ulm University Medical Center(乌尔姆大学医学中心) XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)

专题命中 其他安全 :alignment(abstract)

AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。

Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏