arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-18 至 2026-05-18 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 19 篇

2605.15300 2026-05-18 cs.CV 79%

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01201 2026-05-18 cs.LG cs.CV 70%

Escaping Plato's Cave: JAM for Aligning Independently Trained Vision and Language Models

走出洞穴:JAM用于对齐独立训练的视觉和语言模型

Lauren Hyoseo Yoon, Yisong Yue, Been Kim

机构 * Computation and Neural Systems(计算与神经系统) California Institute of Technology(加利福尼亚理工学院) Computation and Mathematical Sciences(计算与数学科学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出JAM方法,通过联合训练模态特定的自编码器,优化视觉和语言模型的对齐,提升细粒度上下文区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE 67%

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22440 2026-05-18 cs.CY cs.LG cs.MA econ.GN q-fin.EC 62%

From Model Design to Organizational Design: Complexity Redistribution and Trade-Offs in Generative AI

从模型设计到组织设计:生成AI中的复杂性再分配与权衡

Sharique Hasan, Alexander Oettl, Sampsa Samila

机构 * Duke University(杜克大学) Georgia Institute of Technology(佐治亚理工学院) IESE Business School(IESE商学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CY、cs.LG

AI总结 本文提出GAS框架,分析大语言模型如何重塑组织与竞争策略,揭示生成AI中通用性、准确性与简洁性之间的权衡及复杂性再分配对管理挑战的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15549 2026-05-18 cs.LG cs.AI cs.CE 62%

CTF4Nuclear: Common Task Framework for Nuclear Fission and Fusion Models

CTF4Nuclear: 用于核裂变和核聚变模型的通用任务框架

Stefano Riva, Carolina Introini, Antonio Cammi, Dean Price, Alexey Yermakov, Yue Zhao, Philippe M. Wyder, Judah Goldfeder, Jan Williams, Amy Sara Rude, Matteo Tomasetto, Joe Germany, Joseph Bakarji, Georg Maierhofer, Miles Cranmer, J. Nathan Kutz

机构 * Autodesk Research(Autodesk研究院) Department of Energy, Nuclear Engineering Division, Politecnico di Milano(能源部,核工程系,米兰理工学院) Nuclear Science and Engineering, Massachusetts Institute of Technology(核科学与工程,麻省理工学院) Department of Applied Mathematics, University of Washington(应用数学系,华盛顿大学) Department of Electrical and Computer Engineering, University of Washington(电气与计算机工程系,华盛顿大学) High Performance Machine Learning, SURF(高性能机器学习,SURF) Distyl AI Department of Computer Science, Columbia University(计算机科学系,哥伦比亚大学) Department of Mechanical Engineering, University of Washington(机械工程系,华盛顿大学) Department of Mechanical Engineering, Politecnico di Milano(机械工程系,米兰理工学院) Department of Mathematics, American University in Beirut(数学系,贝鲁特美国大学) Department of Mechanical Engineering, American University in Beirut(机械工程系,贝鲁特美国大学) Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTF4Nuclear框架,用于核工程中机器学习方法的标准化评估,通过12个指标和稀疏测量系统监控,提升核工业科学ML的严谨性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14309 2026-05-18 cs.CV cs.AI cs.LG 62%

ICED: Concept-level Machine Unlearning via Interpretable Concept Decomposition

ICED: 通过可解释的概念分解实现概念级机器去学习

Shen Lin, Jing Lin, Junhao Dong, Piotr Koniusz, Li Xu

机构 * Fujian Normal University(福建师范大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Data61 CSIRO(Data61澳大利亚联邦科学与工业研究组织)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ICED框架,通过多模态大语言模型构建任务特定概念词汇,实现VLMs中概念级去学习,有效去除目标知识并保留非目标语义,实验表明其在目标遗忘和模型效用方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16165 2026-05-18 cs.CV cs.AI 57%

Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models

二阶多级方差校正用于多模态模型中的模态竞争

Yishun Lu, Wes Armour

机构 * University of Oxford, Oxford, United Kingdom(牛津大学,英国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出ML-FOP-SOAP框架,通过多级方差校正提升多模态对齐稳定性,实验显示在Janus和Emu3数据集上,该方法提高了样本效率和训练速度,适用于大规模多模态基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14344 2026-05-18 cs.AI 57%

CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

CrystalReasoner: 基于推理和强化学习的性质条件晶体结构生成

Yuyang Wu, Stefano Falletta, Delia McGrath, Sherry Yang

机构 * Tsinghua University(清华大学) Radical AI New York University(纽约大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 CrystalReasoner通过引入物理先验和强化学习,实现从自然语言指令生成稳定且具有特定性质的晶体结构,提升了生成精度和科学合理性。

Comments Our work is available at https://crystalreasoner.github.io/, with code at https://github.com/wyy603/CrystalReasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05966 2026-05-18 cs.CL 57%

FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures

FinReporting: 一种用于跨司法管辖区财务披露本地化报告的代理工作流

Fan Zhang, Mingzi Song, Rania Elbadry, Yankai Chen, Shaobo Wang, Yixi Zhou, Xunwen Zheng, Yueru He, Yuyang Dai, Georgi Georgiev, Ayesha Gull, Muhammad Usman Safder, Fan Wu, Liyuan Meng, Fengxian Ji, Junning Zhao, Xueqing Peng, Jimin Huang, Yu Chen, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI The University of Tokyo(东京大学) Meiji Gakuin University(明治大学) McGill University(麦吉尔大学) Kyoto University(京都大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出FinReporting,一种代理工作流,用于跨司法管辖区的财务披露本地化报告。该系统构建了涵盖损益表、资产负债表和现金流量表的统一本体,将报告分解为可审计的阶段,并通过约束验证器提升一致性和可靠性。

Comments Accepted at ACL 2026 Demo Track. 9 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15661 2026-05-18 cs.CV cs.AI 57%

VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation

VAGS:图像编辑与生成的速率自适应引导尺度

Yan Luo, Ahmadou Aidara, Jingyi Lu, Jeremy Moebel, Kai Han, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 VAGS通过自适应引导尺度提升图像编辑和生成的结构保真度和生成质量,无需微调或额外计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16179 2026-05-18 cs.CV 50%

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

MAgSeg:利用多模态大语言模型对高分辨率卫星图像进行农业景观分割

Piyush Tiwary, Utkarsh Ahuja, Depanshu Sani, Aishwarya Jayagopal, Sagar Gubbi, Subhashini Venugopalan, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌) Indian Institute of Science(印度科学研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MAgSeg,一种无需视觉解码器的多模态大语言模型分割方法,有效解决南半球农业景观分割中的碎片化地块、高类内方差和标注数据稀缺问题,实现高效农业环境制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16120 2026-05-18 cs.IR 50%

MERVIN: A Unified Framework for Multimodal Event Retrieval in Vietnamese News Videos

MERVIN:一种用于越南新闻视频多模态事件检索的统一框架

Anh-Tai Pham-Nguyen, Tung-Duong Le-Duc, Anh-Duy Le, Trung-Hieu Truong-Le

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MERVIN框架,整合关键帧、转录文本和视频摘要,通过Gemini 1.5 Flash提升转录质量,利用Perception Encoder提取视觉特征,并结合越南语言模型生成文本嵌入,实现高效的多模态事件检索。

Comments Accepted to SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16080 2026-05-18 cs.CV 50%

ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation

ReAlign:通过推理对齐表示实现通用图像伪造检测

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出ReAlign框架,通过对比学习将LLM生成的高质量推理文本转化为轻量级AIGI检测器,提升检测准确性和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15924 2026-05-18 cs.HC 50%

Synchronized Realities: Towards Magic Mobile Experiences through Aligned AR

同步现实:通过对齐AR实现魔幻移动体验

Jan Henry Belz

专题命中 其他安全 :alignment(abstract)

AI总结 本文探讨了在移动场景中通过同步现实实现上下文感知AR体验的重要性,分析了现有同步体验的共性与差异,并讨论了与物理世界同步AR体验的机会与挑战。

Comments Part of the CHI 2026 Workshop on Next Steps for Augmented Reality On-the-Move: Challenges and Opportunities

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15601 2026-05-18 cs.DC cs.PF 50%

LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind

LMDeploy通过TurboMind加速混合精度LLM推理

Li Zhang, Youhe Jiang, Guoliang He, Xin Chen, Han Lv, Qian Yao, Ningsheng Ma, Fangcheng Fu, Kai Chen

专题命中 其他安全 :alignment(abstract)

AI总结 LMDeploy通过TurboMind实现高效混合精度LLM推理,通过通用化和高效的混合精度流水线优化矩阵运算和注意力计算,降低延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 50%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07074 2026-05-18 cs.CV 50%

Decoupling Semantics and Fingerprints: A Universal Representation for AI-Generated Image Detection

解耦语义与指纹:一种通用表示法用于AI生成图像检测

Zhiyuan Wang, Yanxiang Chen, Pengcheng Zhao, Yunfeng Diao, Xin Liao

机构 * Hefei University of Technology(合肥工业大学) Key Laboratory of Knowledge Engineering with Big Data (Hefei University of Technology), Ministry of Education(知识工程与大数据重点实验室(合肥工业大学)) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院) Intelligent Interconnected Systems Laboratory of Anhui Province (Hefei University of Technology)(安徽省智能互联系统实验室(合肥工业大学)) School of Computer Science, Nanjing Audit University(南京审计大学计算机学院) College of Cyber Science and Technology, Hunan University(湖南大学计算机科学与技术学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出ODP-Net通过解耦通用伪造痕迹与生成器特定指纹及语义内容,实现对未见架构的AI生成图像检测,验证了结构解耦对泛化能力的关键作用。

Comments ~10 pages (IEEEtran two-column), 6 figures, 6 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05030 2026-05-18 cs.CV 50%

LUIVITON: Learned Universal Interoperable VIrtual Try-ON

LUIVITON: 学习通用互操作虚拟试衣

Cong Cao, Xianhang Cheng, Jingyuan Liu, Yujian Zheng, Zhenhui Lin, Ren Li, Meriem Chkir, Hao Li

机构 * The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种全自动虚拟试衣系统,通过SMPL作为中间代理,解决服装与人体之间的对应问题,实现复杂多层服装在多样化人体上的合理 draped 效果,且支持快速定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21698 2026-05-18 cs.CV 50%

Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging

通过查询驱动专家桥梁适应基础视觉-语言模型用于医学诊断

Yitong Li, Morteza Ghahremani, Christian Wachinger

机构 * Lab for AI in Medical Imaging, Technical University of Munich (TUM)(医学影像人工智能实验室,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MedBridge框架,通过结合领域对齐、分辨率保持和多标签推理的互补VLM专家,解决医学影像诊断中的领域差距问题,实现跨领域泛化和领域内特化,提升多标签胸腔疾病诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏