arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2603.25727 2026-03-27 cs.AI cs.MM 57%

Back to Basics: Revisiting ASR in the Age of Voice Agents

回归基础:在语音助手时代重新审视ASR

Geeyang Tay, Wentao Ma, Jaewon Lee, Yuzhi Tang, Daniel Lee, Weisu Yin, Dongming Shen, Silin Meng, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 57%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18840 2026-03-27 cs.CV cs.CL 57%

See the Text: From Tokenization to Visual Reading

查看文本:从分词到视觉阅读

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11413 2026-03-27 cs.HC cs.AI 57%

Evaluation format, not model capability, drives triage failure in the assessment of consumer health AI

评估格式而非模型能力驱动消费者健康AI的分诊失败

David Fraile Navarro, Farah Magrabi, Enrico Coiera

机构 * Centre for Health Informatics(健康信息学中心) Australian Institute of Health Innovation(澳大利亚健康创新研究所) Macquarie University(麦考瑞大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究通过对比考试式与自然场景下的分诊测试,发现评估格式显著影响分诊准确性,指出消费者健康AI的评估需模拟真实使用场景以获得可靠结果。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 50%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25092 2026-03-27 cs.IR 50%

AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation

AuthorityBench: 评估LLM权威感知以实现可靠的检索增强生成

Zhihui Yao, Hengran Zhang, Keping Bi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出AuthorityBench基准,通过三个数据集评估LLM权威感知能力,发现ListJudge和PairJudge方法与真实权威最相关,且权威感知对检索增强生成的准确性有显著提升。

Comments 11 pages, 4 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24837 2026-03-27 cs.CR 50%

Bridging Code Property Graphs and Language Models for Program Analysis

连接代码属性图与语言模型用于程序分析

Ahmed Lekssays

专题命中 安全评测 :safety(abstract)

AI总结 本文提出codebadger,结合Joern的代码属性图引擎与LLM,解决代码分析中的挑战,通过高级工具实现程序切片、污点追踪等,提升大规模代码库的分析能力。

Comments Accepted at Software Vulnerability Management Workshop @ ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24703 2026-03-27 cs.SE cs.RO cs.SY eess.SY 50%

IndustriConnect: MCP Adapters and Mock-First Evaluation for AI-Assisted Industrial Operations

IndustriConnect:MCP适配器与先假测试用于AI辅助工业操作

Melwin Xavier, Melveena Jolly, Vaisakh M A, Midhun Xavier

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出IndustriConnect,通过MCP适配器将工业操作暴露为可发现的AI工具,支持协议特定连接和安全控制,并通过先假测试和确定性基准验证适配器的正确性、并发行为和结构化错误处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24696 2026-03-27 cs.CV 50%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24684 2026-03-27 cs.CV 50%

KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins

KitchenTwin: 基于语义和几何的3D厨房数字孪生

Quanyun Wu, Kyle Gao, Daniel Long, David A. Clausi, Jonathan Li, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2509.13854 2026-03-27 cs.CY cs.AI 81%

Understanding the Process of Human-AI Value Alignment

理解人机价值对齐的过程

Jack McKinlay, Marina De Vos, Janina A. Hoffmann, Andreas Theodorou

机构 * University of Bath(巴斯大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过系统文献综述,探讨人工智能中价值对齐的核心方法与挑战,提出更精确的定义,识别六个关键主题以指导未来研究。

Comments 39 pages, 7 figures

Journal ref JAIR, Vol 85, Article 29 (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25379 2026-03-27 cs.AI cs.HC 57%

Does Structured Intent Representation Generalize? A Cross-Language, Cross-Model Empirical Study of 5W3H Prompting

结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。

Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 10 篇

2603.21149 2026-03-27 cs.SE cs.AI cs.MA 83%

Emergent Formal Verification: How an Autonomous AI Ecosystem Independently Discovered SMT-Based Safety Across Six Domains

涌现形式验证:自主AI生态系统如何在六个领域独立发现基于SMT的安全性

Octavian Untila

机构 * Aisophical SRL

专题命中 其他安全 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 自主AI生态系统在无显式形式方法指令下,独立在六个AI安全领域发现SMT求解器的应用,提出统一框架实现100%准确验证。

Comments 10 pages, 3 figures, 5 tables. Code: https://github.com/octavuntila-prog/substrate-guard. Companion paper: https://doi.org/10.5281/zenodo.19157571

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25499 2026-03-27 cs.CV cs.LG 79%

Knowledge-Guided Failure Prediction: Detecting When Object Detectors Miss Safety-Critical Objects

基于知识的故障预测:检测对象检测器何时错过安全关键对象

Jakob Paul Zimmermann, Gerrit Holzbach, David Lerch

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Fraunhofer IOSB(弗劳恩霍夫光电、系统技术及图像处理研究所)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文提出KGFP框架,通过检测内部特征与视觉基础模型嵌入之间的语义偏差来识别对象检测器的故障,提升安全关键对象的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25460 2026-03-27 cs.SD 71%

CLAR: CIF-Localized Alignment for Retrieval-Augmented Speech LLM-Based Contextual ASR

CLAR:基于检索增强的语音大语言模型的上下文语音识别中的CIF局部对齐

Shangkun Huang, Huan Shen, Wei Zou, Yunzhang Chen

机构 * BRVoice Team, Bairong, Inc., China(BRVoice团队,百融云创,中国)

专题命中 其他安全 :alignment(title)

AI总结 CLAR通过CIF学习单调性token级对齐,提升语音识别中专有名词和长尾词的识别效果,减少表示稀释和注意力漂移,提高检索准确率。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24736 2026-03-27 cs.AI cs.LG 62%

AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation

AutoSAM:一种用于自动化生成SAM代码输入文件的代理框架,结合多模态检索增强生成

Zaid Abulawi, Zavier Ndum Ndum, Eric Cervi, Rui Hu, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University. Engineering Division, Argonne National Laboratory

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 AutoSAM通过多模态检索增强生成技术,自动化生成SAM代码输入文件,解决异构工程文档中提取设计数据并转换为求解器语法的难题,实现100%结构化输入利用和88%PDF文本提取。

Comments 34 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19102 2026-03-27 cs.LG 57%

OWLEYE: Zero-Shot Learner for Cross-Domain Graph Data Anomaly Detection

OWLEYE:跨域图数据异常检测的零样本学习者

Lecheng Zheng, Dongqi Fu, Zihao Li, Jingrui He

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 OWLEYE提出一种跨域图数据异常检测框架,通过跨域特征对齐模块、多域多模式字典学习和截断注意力重构模块,实现零样本学习和持续学习能力,提升异常检测性能与泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05696 2026-03-27 cs.LG q-bio.QM 57%

SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型

Bohao Xu, Yingzhou Lu, Chenhao Li, Ling Yue, Xiao Wang, Tianfan Fu, Minjie Shen, Lulu Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25091 2026-03-27 cs.CV cs.AI 57%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 57%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08881 2026-03-27 cs.CV cs.AI 57%

TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts

TAG-MoE:基于任务的门控用于统一的生成混合专家

Yu Xu, Hongbin Yan, Juan Cao, Yiji Cheng, Tiankai Hang, Runze He, Zijin Yin, Shiyi Zhang, Yuxin Zhang, Jintao Li, Chunyu Wang, Qinglin Lu, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文言) National Cheng-Kung University(国立成功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出TAG-MoE框架,通过引入层次化任务语义标注方案和预测对齐正则化,解决密集扩散变换器架构中任务干扰问题,提升生成质量和保真度。

Comments Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03983 2026-03-27 cs.SD eess.AS 50%

MiDashengLM: Efficient Audio Understanding with General Audio Captions

MiDashengLM:通过通用音频字幕实现高效的音频理解

Heinrich Dinkel, Gang Li, Jizhong Liu, Jian Luan, Yadong Niu, Xingwei Sun, Tianzi Wang, Qiyang Xiao, Junbo Zhang, Jiahao Zhou

机构 * MiLM Plus Xiaomi Inc.(小米公司)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MiDashengLM,一个基于通用音频字幕的开放音频语言模型,通过ACAVCaps数据集实现高效且全面的音频理解,提升透明度和可重复性,并提供更快的推理速度和更高的吞吐量。

Comments Added ACAVCaps reference (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏