arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-21 至 2026-05-21 共收录 25 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 25 篇

2605.21217 2026-05-21 stat.ML cs.LG 83%

Federated LoRA Fine-Tuning for LLMs via Collaborative Alignment

通过协作对齐的联邦LoRA微调大型语言模型

Shuaida He, Liwen Chen, Long Feng

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文研究了在联邦学习环境下使用LoRA进行参数高效微调的问题,提出了一种名为CLAIR的框架,通过结构低秩加块稀疏分解来恢复共享LoRA子空间并检测污染客户端,从而在噪声情况下实现精确恢复,并在不同条件下实现稳定和一致的协作集恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20640 2026-05-21 cs.CV cs.AI 79%

Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics

帕累托优化的肖像生成:用于对齐、真实性和美学的视觉对齐文本监督

Yunlong Wang, Jinjin Shi, Wenbin Gao, Xuran Xu, Runyu Shi, Ying Huang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态扩散变换器(MM-DiT)的特征监督方法,通过引入轻量级的跨模态对齐机制,隐式提取多粒度的视觉对齐文本表示,以提升文本-图像对齐、真实性和美学质量,从而在Pareto前沿上实现协同改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03526 2026-05-21 cs.CL eess.AS 79%

Enhancing Speech Large Language Models through Reinforced Behavior Alignment

通过强化行为对齐增强语音大语言模型

Yansong Liu, Jiateng Li, Yuan Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出了一种名为强化行为对齐(RBA)的框架,通过自合成方法生成高质量对齐数据来提升语音大语言模型(SpeechLMs)的语言生成能力,实验表明该方法显著提升了SpeechLMs的指令遵循能力,并可扩展至语音问答和语音转文本翻译等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05972 2026-05-21 cs.LG stat.ML 79%

AI-based Prediction of Independent Construction Safety Outcomes from Universal Attributes

基于AI的独立施工安全结果的属性预测

Henrietta Baker, Matthew R. Hallowell, Antoine J. -P. Tixier

机构 * University of Edinburgh, UK(爱丁堡大学,英国) University of Colorado at Boulder, USA(科罗拉多大学博尔德分校,美国)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文改进并验证了先前研究中通过机器学习从属性中预测安全结果的方法,使用NLP提取属性并训练模型预测伤害严重性、类型、受影响身体部位和事件类型,通过独立人工标注消除潜在的人工相关性,结果表明属性仍具有高度预测性,同时引入了更大的数据集、新模型、模型堆叠和更合适的评估指标,最终成功预测伤害严重性,这是重大进展。

Comments Added author contributions and journal reference, updated corresponding author, fixed a few typos

Journal ref Automation in Construction 118 (2020): 103146

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20808 2026-05-21 cs.CV 78%

Spatial Gram Alignment for Ultra-High-Resolution Image Synthesis

基于超高清图像合成的空间图对齐

Jinjin Zhang, Xiefan Guo, Di Huang

机构 * Beihang University(北航大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出空间图对齐(SGA)方法,通过利用视觉基础模型的表示先验,保留LDMs的生成能力,解决超高清图像合成中生成质量与结构完整性之间的冲突,实现高质量的文本到图像合成。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20730 2026-05-21 cs.CL cs.AI 76%

Distributional Alignment as a Criterion for Designing Task Vectors in In-Context Learning

分布对齐作为设计任务向量在上下文学习中的准则

Jihoon Kwon, Jiwon Choi, Jy-yong Sohn

机构 * Seoul National University(首尔国立大学) Yonsei University(延世大学)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出通过分布对齐来设计任务向量,引入了NTP距离作为衡量指标,并开发了线性任务向量方法以提升性能和效率。

Comments 9 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20668 2026-05-21 cs.CL cs.AI cs.LG 67%

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

人工智能审稿人的局限与机遇:对Nature系列论文审稿的45位专家科学家的审查

Seungone Kim, Dongkeun Yoon, Kiril Gashteovski, Juyoung Suk, Jinheon Baek, Pranjal Aggarwal, Ian Wu, Viktor Zaverkin, Spase Petkoski, Daniel R. Schrider, Ilija Dukovski, Francesco Santini, Biljana Mitreska, Yong Jeong, Kyeongha Kwon, Young Min Sim, Dragana Manasova, Arthur Porto, Biljana Mojsoska, Makoto Takamoto, Marko Shuntov, Ruoqi Liu, Hyunjoo Jenny Lee, Niyazi Ulas Dinç, Yehhyun Jo, Sunkyu Han, Chungwoo Lee, Huishan Li, Esther H. R. Tsai, Ergun Simsek, Khushboo Shafi, Yeonseung Chung, Jihye Park, Aleksandar Shulevski, Henrik Christiansen, Yoosang Son, Elly Knight, Amanda Montoya, Jeongyoun Ahn, Christian Langkammer, Heera Moon, Changwon Yoon, Nikola Stikov, Mooseok Jang, Edward Choi, Junhan Kim, Yeon Sik Jung, Woo Youn Kim, Jae Kyoung Kim, Ishraq Md Anjum, Hyun Uk Kim, Drew Bridges, Carolin Lawrence, Xiang Yue, Alice Oh, Akari Asai, Sean Welleck, Graham Neubig

机构 * Nature(自然)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模专家标注研究,探讨了AI审稿人在科学同行评审中的能力与局限,发现AI审稿在准确性、显著性和证据充分性方面表现优异,但存在领域知识有限、上下文管理不足等弱点,表明AI审稿是人类审稿的补充而非替代。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20268 2026-05-21 cs.LG cs.AI cs.CL 67%

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

Chronicle:一种用于联合语言和时间序列理解的多模态基础模型

Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

机构 * InertialAI Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17631 2026-05-21 cs.LG cs.AI 62%

Time-Prompt: Integrated Heterogeneous Prompts for Unlocking LLMs in Time Series Forecasting

Time-Prompt: 集成异构提示以解锁时间序列预测中的LLM

Zesen Wang, Lijuan Lan, Yonggang Li

机构 * Central South University, Changsha, China(中南大学,长沙,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Time-Prompt框架,通过构建统一的提示范式、设计语义空间嵌入和跨模态对齐模块以及高效微调LLM参数,提升时间序列预测性能,并在碳排放数据集上验证其有效性。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20449 2026-05-21 cs.LG cs.AI 62%

LLM Pretraining Shapes a Generalizable Manifold: Insights into Cross-Modal Transfer to Time Series

LLM预训练塑造了可泛化的流形:跨模态迁移至时间序列的洞察

Alexis Roger, Prateek Humane, Zhenghan Tai, Gwen Legate, Andrei Mircea, Vasilii Feofanov, Irina Rish

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) University of Toronto(多伦多大学) Concordia University(康科迪亚大学) com(42.com)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言预训练的Transformer能否成为有效的时序预测器,并揭示了跨模态迁移的机制,指出预训练构建了流形,微调则将数值动态投影到任务相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21272 2026-05-21 cs.CV cs.AI 57%

MONET: A Massive, Open, Non-redundant and Enriched Text-to-image dataset

MONET:一个大规模、开放、非冗余且增强的文本到图像数据集

Benjamin Aubin, Gonzalo Iñaki Quintana, Onur Tasar, Sanjeev Sreetharan, Urszula Czerwinska, Damien Henry, Clément Chadebec

机构 * Jasper Research(Jasper研究)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出MONET数据集,通过多阶段过滤和增强,提供高质量的文本到图像数据,以降低大规模可重复研究的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17618 2026-05-21 cs.AI 57%

Prediction of Challenging Behaviors Associated with Profound Autism in a Classroom Setting Using Wearable Sensors

使用可穿戴传感器预测课堂环境中与深度自闭症相关的行为问题

Yadhu Kartha, Conor Anderson, Jenny Foster, Theresa Hamlin, Johanna Lantz, Ryan Lay, Juergen Hahn, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) The Center For Discovery(发现中心) Rensselaer Polytechnic Institute(伦斯勒理工学院) Georgia Institute of Technology, Emory University(佐治亚理工学院与埃默里大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究通过可穿戴传感器和机器学习方法,在真实课堂环境中预测自闭症深度患者的行为问题,展示了在教育环境中提前10分钟预测行为问题的可行性,并实现了AUC-ROC为0.78的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04916 2026-05-21 q-bio.QM cs.CL 57%

AFD-INSTRUCTION: A Comprehensive Antibody Instruction Dataset with Functional Annotations for LLM-Based Understanding and Design

AFD-INSTRUCTION: 一个全面的抗体指令数据集,具有功能注解,用于基于LLM的理解和设计

Ling Luo, Wenbin Jiang, Hongyuan Chang, Xinkang Wang, Xushi Zhang, Yueting Xiong, Mengsha Tong, Rongshan Yu

机构 * National Institute for Data Science in Health and Medicine(健康医学数据科学国家研究院) Institute of Artificial Intelligence(人工智能研究院) School of Life Sciences(生命科学学院) School of Informatics(信息学院) State Key Laboratory of Vaccines for Infectious Diseases(传染病疫苗国家重点实验室) Xiang An Biomedicine Laboratory(翔安生物医学实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出AFD-INSTRUCTION数据集,通过功能注解提升LLM在抗体理解与设计中的性能,为抗体建模和治疗发现提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21186 2026-05-21 cs.CV cs.AI 57%

SAM-Sode: Towards Faithful Explanations for Tiny Bacteria Detection

SAM-Sode:迈向微小细菌检测的可信解释

Wanying Tan, Shuo Yan, Dazhi Huang, Yazheng Liu, Zili Shao, Rufeng Chen, Hechang Chen, Mude Shi, Tianxing Ji, Sihong Xie

机构 * Shenzhen University, Shenzhen, China The Second Affiliated Hospital, Guangzhou Medical University, Guangzhou, China The Hong Kong University of Science Technology (Guangzhou), Guangzhou, China Jilin University, Changchun, China Guangdong ACXEL Micro \& Nano Tech Co., Ltd., Guangzhou, China

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出SAM-Sode框架,通过几何感知提示和双约束机制提升微小细菌检测的解释性与透明度,有效抑制背景冗余并增强决策透明度。

Comments 10 pages, 4 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20619 2026-05-21 cs.LG math.OC stat.ML 57%

SURF: Steering the Scalarization Weight to Uniformly Traverse the Pareto Front

SURF: 通过调整标量化权重以均匀遍历帕累托前沿

Liuyuan Jiang, Chentong Huang, Lisha Chen

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出SURF方法,通过调整标量化权重以实现帕累托前沿的均匀覆盖,解决了传统标量化方法在多目标优化中导致非均匀覆盖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14364 2026-05-21 cs.LG 57%

MoRe: Modular Representations for Principled Continual Representation Learning on Sequential Data

MoRe:模块化表示用于序列数据的原理化持续表示学习

Jiaqi Sun, Boyang Sun, Rasmy M. H., Xiangchen Song, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出MoRe框架,通过模块化表示方法实现序列数据的原理化持续学习,其核心贡献是通过分解知识为可识别的模块层级,实现模块的重用、对齐和扩展,从而在保持旧模块的同时提升模型的可塑性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12960 2026-05-21 cs.CL 57%

DiM\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging

DiM\textsuperscript{3}: 通过方向和幅度感知融合连接多语言和多模态模型

Zijing Wang, Mingyang Wang, Ercong Nie, Yongkang Liu, Shi Feng, Mengjie Zhao, Daling Wang, Xiaocui Yang, Hinrich Schütze

机构 * Northeastern University, China(东北大学,中国) CIS, LMU Munich, Germany(慕尼黑莱布尼茨大学计算机学院,德国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出DiM3方法,通过在共享语言模型骨干中融合残差更新,实现多语言和多模态能力的无缝整合,从而提升多语言性能并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23152 2026-05-21 cs.LG cond-mat.dis-nn math.OC math.RT stat.ML 57%

A Differentiable Measure of Algebraic Complexity: Provably Exact Discovery of Group Structures

一种可微的代数复杂性度量:证明精确发现群结构

Dongsung Huh, Lior Horesh, Halyun Jeong

机构 * Independent Researcher(独立研究者) IBM Research(IBM研究院) University at Albany, SUNY(阿尔巴尼大学,SUNY)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种可微的代数复杂性度量,通过Cayley表完成问题,证明了通过超立方体操作符张量分解可以精确发现群结构,解决了Huh(2025)的核心开放猜想。

Comments 29 pages, 3 figures. All theoretical conjectures are formally proven as theorems and verified in Lean 4. v4: Minor typographical corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20442 2026-05-21 cs.HC cs.AI 57%

Modeling Emotional Dynamics in Agent-to-Agent Interactions on Moltbook

在Moltbook上代理间交互中情感动态建模

Syed Mhamudul Hasan, Abdur R. Shahid

机构 * Southern Illinois University(南伊利诺伊大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究了Moltbook中代理间交互的情感动态,提出了一种情感感知框架,用于将文本交互映射到预定义的细粒度情感类别,提取结构化的情感档案,并引入了基于情感的Persona-Stimulus-Reaction(PSR)领域来评估行为可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20233 2026-05-21 cs.CV cs.AI 57%

AI-Assisted Competency Assessment from Egocentric Video in Simulation-Based Nursing Education

基于仿真护理教育的自主学习能力评估:通过第一人称视频进行AI辅助评估

Hanchen David Wang, Yilin Liu, Madison J. Lee, Surya Chand Rayala, Gautam Biswas, Daniel T. Levin, Meiyi Ma

机构 * Vanderbilt University(范德比大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于第一人称视频的AI辅助评估框架,通过提取动作时间线、序列特征和识别指标,发现识别准确率与能力之间存在负相关关系,表明识别准确率可以作为自动化评估中的教学信息信号。

Comments Accepted at CVPR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21132 2026-05-21 cs.CV 50%

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

SurgOnAir: 基于层次感知的实时手术视频评论

Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi

机构 * Computer Aided Medical Procedures (CAMP), TU Munich, Germany Munich Center for Machine Learning (MCML), Munich, Germany University of Strasbourg, France The Chinese University of Hong Kong, Hong Kong

专题命中 其他安全 :safety(abstract)

AI总结 本研究提出SurgOnAir,一种流式视觉-语言模型,通过层次化数据集实现对手术流程多层级的实时理解与评论生成,提升手术过程中的即时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20737 2026-05-21 cs.CV 50%

Resolving Long-Tail Ambiguity in Unsupervised 3D Point Cloud Segmentation with Language Priors

通过语言先验解决无监督3D点云分割中的长尾歧义

Siqi Wei, Hongbin Xu, Feng Xiao, Tian Lan, Chun Li, Ming Li, Qiuxia Wu

机构 * South China University of Technology(华南理工大学) Bytedance(字节跳动) Tsinghua University(清华大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Guangming Laboratory(光明实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LangTail框架,利用语言模型中的平衡世界知识来缓解无监督3D分割中的长尾歧义问题,通过建立语言衍生语义先验与视觉上不常见的小类之间的多级关联,提升小类的表示能力,实验表明在ScanNet-v2、S3DIS和nuScenes数据集上均取得显著提升。

Comments In submission. The code will be released at: https://github.com/Whisky0129/langtail_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14201 2026-05-21 cs.RO cs.CV 50%

MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving

MAPLE:基于潜在空间的多智能体交互用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng, Shizhong Han, Yunxiao Shi, Meysam Sadeghigooghari, Hanno Ackermann, Litian Liu, Pranav Desai, Fatih Porikli, Mohammad Ghavamzadeh, Hong Cai

机构 * Qualcomm AI Research(英矽人工智能研究)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出MAPLE框架,通过在视觉-语言-动作模型的潜在空间中实现反应式多智能体滚动,以解决传统模仿学习框架下闭环设置中模型易碎的问题,通过监督微调和强化学习结合多样性奖励,实现了可扩展且无需外部模拟器的闭环训练,提升了端到端自动驾驶系统的鲁棒性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07599 2026-05-21 cs.SI 50%

Can social media shape the security of next-generation connected vehicles?

社交媒体能否塑造下一代联网车辆的安全性?

Nicola Scarano, Luca Mannella, Alessandro Savino, Stefano Di Carlo

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种社交媒体汽车威胁情报(SOCMATI)框架,用于评估汽车网络安全中的潜在威胁,通过利用先进的情报技术和机器学习模型从社交媒体中提取有价值的信息,以提高威胁评估流程。

Comments Position paper, four pages, two images

Journal ref Proceeding of the 2024 IEEE 30th International Symposium on On-Line Testing and Robust System Design (IOLTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11401 2026-05-21 cs.HC cs.MA 50%

FACET: Teacher-Centred LLM-Based Multi-Agent Systems-Towards Personalized Educational Worksheets

FACET:以教师为中心的基于大语言模型的多智能体系统——向个性化教育工作表迈进

Jana Gonnermann-Müller, Jennifer Haase, Konstantin Fackeldey, Sebastian Pokutta

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出FACET框架,一种面向教师的基于大语言模型的多智能体系统,旨在生成整合学习者认知和动机维度的个性化课堂材料,通过三个专门智能体实现,展示了多智能体LLM架构在异质课堂环境中的规模化、情境感知个性化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏