arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 686 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 686 篇

2510.07940 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM:测试时优化与记忆化用于组合视频生成

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。

Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18464 2026-02-25 cs.CY cs.AI cs.CL cs.CR 67%

How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?

LLM代理能多好地模拟终端用户的安全和隐私态度和行为?

Yuxuan Li, Leyang Li, Hao-Ping Lee, Sauvik Das

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Science and Engineering, University of Notre Dame(诺特难大学计算机科学与工程系)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究LLM代理在模拟用户安全隐私态度和行为方面的有效性,发现现有模型表现有限,但通过特定提示策略可提升匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17645 2026-02-25 cs.CV cs.AI cs.CL cs.LG cs.MM 67%

HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning

HoloLLM:面向语言基础的人感知与推理的多感官基础模型

Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HoloLLM通过整合LiDAR、红外、毫米波雷达和Wi-Fi等多感官数据,提升语言基础的人感知与推理能力,实验表明其在真实场景中的性能提升达30%。

Comments Camera-ready version. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04536 2026-02-19 cs.CL cs.AI cs.LG 67%

Evaluating Language Model Agency through Negotiations

通过谈判评估语言模型的代理能力

Tim R. Davidson, Veniamin Veselovsky, Martin Josifoski, Maxime Peyrard, Antoine Bosselut, Michal Kosinski, Robert West

机构 * EPFL(瑞士联邦理工学院) UGA(普罗万大学) CNRS(法国国家科学研究中心) LIG(里莫恩-盖朗实验室) Stanford University(斯坦福大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。

Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14275 2026-01-27 cs.CR cs.AI cs.CL cs.LG 67%

FedMentor: Domain-Aware Differential Privacy for Heterogeneous Federated LLMs in Mental Health

FedMentor: 域感知差分隐私用于心理健康领域异构联邦大语言模型

Nobin Sarwar, Shubhashis Roy Dipta

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FedMentor通过整合LoRA和域感知差分隐私,实现对心理健康领域异构联邦大语言模型的隐私保护微调,提升安全性并保持模型效用。

Comments NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10532 2025-12-18 cs.LG cs.AI cs.CL 67%

Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination

推理还是记忆?由于数据污染导致强化学习不可靠的结果

Mingqi Wu, Zhihao Zhang, Qiaole Dong, Zhiheng Xi, Jun Zhao, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Huijie Lv, Ming Zhang, Yanwei Fu, Qin Liu, Songyang Zhang, Qi Zhang

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文发现Qwen2.5系列模型易受数据污染影响,通过生成清洁算术问题验证了准确奖励信号对数学推理性能的提升作用

Comments 28 pages, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06192 2025-12-03 cs.DB cs.AI cs.CL cs.LG 67%

SQLBarber: A System Leveraging Large Language Models to Generate Customized and Realistic SQL Workloads

SQLBarber: 借助大型语言模型生成定制化和真实SQL工作负载的系统

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SQLBarber利用大型语言模型生成定制化且真实的SQL工作负载,通过声明式接口和贝叶斯优化器高效生成符合目标成本分布的查询。

Comments Accepted by SIGMOD 2026; extended version with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10946 2025-10-23 cs.LG cs.AI cs.CL 67%

GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models

Peizhi Niu, Evelyn Ma, Huiting Zhou, Duo Zhou, Huan Zhang, S. Rasoul Etesami, Olgica Milenkovic

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08727 2025-10-23 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Memorization-Compression Cycles Improve Generalization

Fangyuan Yu

机构 * Thoughtworks

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 6 figures, NeurIPS2025 NEGEL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16731 2025-07-23 cs.DC 67%

Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges

Senyao Li, Haozhao Wang, Wenchao Xu, Rui Zhang, Song Guo, Jingling Yuan, Xian Zhong, Tianwei Zhang, Ruixuan Li

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract)

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06528 2025-07-10 cs.CL cs.AI cs.ET cs.LG 67%

InvestAlign: Overcoming Data Scarcity in Aligning Large Language Models with Investor Decision-Making Processes under Herd Behavior

Huisheng Wang, Zhuoshi Pan, Hangjing Zhang, Mingxiao Liu, Hanqing Gao, H. Vicky Zhao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15093 2025-06-19 cs.CR 67%

Flexible Hardware-Enabled Guarantees for AI Compute

James Petrie, Onni Aarne, Nora Ammann, David Dalrymple

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06233 2025-04-29 cs.CL cs.AI cs.LG 67%

Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models

Shahriar Golchin, Mihai Surdeanu

机构 * Department of Computer Science, University of Arizona(计算机科学系,亚利桑那大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Final version; accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05212 2025-02-11 cs.CR cs.AI cs.CL cs.LG 67%

Preserving Privacy in Large Language Models: A Survey on Current Threats and Solutions

Michele Miranda, Elena Sofia Ruzzetti, Andrea Santilli, Fabio Massimo Zanzotto, Sébastien Bratières, Emanuele Rodolà

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Transactions on Machine Learning Research (TMLR) https://openreview.net/forum?id=Ss9MTTN7OL

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15017 2024-12-05 cs.CL cs.AI cs.CV cs.HC cs.LG 67%

Knowledge Mechanisms in Large Language Models: A Survey and Perspective

Mengru Wang, Yunzhi Yao, Ziwen Xu, Shuofei Qiao, Shumin Deng, Peng Wang, Xiang Chen, Jia-Chen Gu, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024 Findings; 39 pages (v4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19211 2024-12-03 cs.LG cs.AI cs.CL 67%

Dual-Personalizing Adapter for Federated Foundation Models

Yiyuan Yang, Guodong Long, Tao Shen, Jing Jiang, Michael Blumenstein

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20448 2024-07-17 cs.CR 67%

A Survey on Federated Unlearning: Challenges, Methods, and Future Directions

Ziyao Liu, Yu Jiang, Jiyuan Shen, Minyi Peng, Kwok-Yan Lam, Xingliang Yuan, Xiaoning Liu

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10290 2024-06-18 cs.CL cs.AI cs.LG 67%

MobileAIBench: Benchmarking LLMs and LMMs for On-Device Use Cases

Rithesh Murthy, Liangwei Yang, Juntao Tan, Tulika Manoj Awalgaonkar, Yilun Zhou, Shelby Heinecke, Sachin Desai, Jason Wu, Ran Xu, Sarah Tan, Jianguo Zhang, Zhiwei Liu, Shirley Kokane, Zuxin Liu, Ming Zhu, Huan Wang, Caiming Xiong, Silvio Savarese

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01757 2024-06-05 cs.LG cs.AI cs.CY 67%

Position: Cracking the Code of Cascading Disparity Towards Marginalized Communities

Golnoosh Farnadi, Mohammad Havaei, Negar Rostamzadeh

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09391 2024-04-16 cs.LG cs.AI cs.CR cs.CY 67%

Privacy at a Price: Exploring its Dual Impact on AI Fairness

Mengmeng Yang, Ming Ding, Youyang Qu, Wei Ni, David Smith, Thierry Rakotoarivelo

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02031 2023-08-07 cs.CY cs.AI cs.CR cs.LG 67%

Knowledge-enhanced Neuro-Symbolic AI for Cybersecurity and Privacy

Aritran Piplai, Anantaa Kotal, Seyedreza Mohseni, Manas Gaur, Sudip Mittal, Anupam Joshi

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 4 pages, 1 figure (To Appear in IEEE Internet Computing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.11665 2020-05-01 cs.CR cs.NI 67%

6G White paper: Research challenges for Trust, Security and Privacy

Mika Ylianttila, Raimo Kantola, Andrei Gurtov, Lozenzo Mucchi, Ian Oppermann, Zheng Yan, Tri Hong Nguyen, Fei Liu, Tharaka Hewa, Madhusanka Liyanage, Ahmad Ijaz, Juha Partala, Robert Abbas, Artur Hecker, Sara Jayousi, Alessio Martinelli, Stefano Caputo, Jonathan Bechtold, Ivan Morales, Andrei Stoica, Giuseppe Abreu, Shahriar Shahabuddin, Erdal Panayirci, Harald Haas, Tanesh Kumar, Basak Ozan Ozparlak, Juha Röning

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22651 2026-08-14 cs.LG cs.AI cs.CE cs.MA 版本更新 62%

Automated Design Optimization via Strategic Search with Large Language Models

通过大语言模型的战略搜索实现自动化设计优化

Anthony Carreon, Vansh Sharma, Venkat Raman

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。

Comments 16 pages, 4 tables, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06265 2026-08-07 cs.AI cs.DB cs.LG 新提交 62%

Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints

在效用约束下提升合成临床基准的真实性

Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher

机构 * Oracle Health and Life Sciences(甲骨文健康与生命科学部门)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文针对合成临床基准的结构不真实问题,提出在不破坏下游效用检查的前提下提升其真实性的方法,通过确定性修正改善基准指标,明确需将效用作为约束而非真实性的充分证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-06 cs.CL cs.AI 新提交 62%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08604 2026-08-06 cs.CL cs.AI 版本更新 62%

Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications

医学领域大型语言模型中的记忆现象:普遍性、特征与影响

Anran Li, Lingfei Qian, Mengmeng Du, Yu Yin, Yan Hu, Zihao Sun, Yihang Fu, Hyunjae Kim, Erica Stutz, Xuguang Ai, Qianqian Xie, Rui Zhu, Jimin Huang, Yifan Yang, Siru Liu, Yih-Chung Tham, Lucila Ohno-Machado, Hyunghoon Cho, Zhiyong Lu, Hua Xu, Qingyu Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨医学领域大型语言模型的记忆现象,分析其普遍性、特征及对医疗应用的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18535 2026-07-29 cs.CR cs.AI cs.LG 62%

A Survey of Zero-Knowledge Proof Based Verifiable Machine Learning

基于零知识证明的可验证机器学习综述

Zhizhi Peng, Chonghe Zhao, Taotao Wang, Guofu Liao, Zibin Lin, Yifeng Liu, Bin Cao, Long Shi, Qing Yang, Shengli Zhang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Computer Science and Cyber Engineering, Guangzhou University(广州大学计算机科学与网络工程学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室) School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子工程与光电技术学院)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了从2017年6月至2025年8月间发表的零知识机器学习研究,涵盖可验证训练、测试和推理三大核心任务,分析了实现瓶颈与改进技术,为可信隐私保护机器学习提供参考。

Comments This manuscript has been accepted for publication in Artificial Intelligence Review

Journal ref Artificial Intelligence Review, 59, 157 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16660 2026-07-21 cs.SE cs.AI cs.CR cs.IR cs.LG 新提交 62%

How Do You Choose Your AI Component? An Interview Study of Secure AI Integration in Practice

你如何选择人工智能组件?关于安全人工智能集成实践的访谈研究

Mahzabin Tamanna, Elizabeth Lin, Sparsha Gowda, Laurie Williams, Dominik Wermke

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过访谈了解从业者选择和集成人工智能组件的决策及安全考量,发现其选模型多受功能标准驱动,安全常被忽视,集成过程缺安全关注,行业重蹈早期软件依赖管理覆辙,为此给出相关建议倡导安全设计方法。

Comments 18 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06963 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Large Language Models (LLMs) and Generative AI in Cybersecurity and Privacy: A Survey of Dual-Use Risks, AI-Generated Malware, Explainability, and Defensive Strategies

大型语言模型(LLMs)和生成式人工智能在网络安全与隐私中的应用:两用风险、人工智能生成的恶意软件、可解释性及防御策略综述

Kiarash Ahi, Saeed Valizadeh

机构 * Virelya Intelligence Research Labs(Virelya智能研究实验室) Google(谷歌)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 综述大型语言模型和生成式人工智能在网络安全中的应用,涵盖两用风险等多方面。通过回顾众多资料及实际案例研究,给出负责任部署建议与安全路线图,为应对人工智能驱动的网络安全挑战提供关键参考。

Comments Invited survey paper. 10 pages, 5 figures, 2 tables

Journal ref IEEE 6th Silicon Valley Cybersecurity Conference (SVCC), San Francisco, CA, USA, 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 62%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏