arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1832 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1832 篇

2512.04408 2025-12-05 cs.AI 57%

Executable Governance for AI: Translating Policies into Rules Using LLMs

可执行治理 for AI:利用 LLMs 将政策翻译成规则

Gautam Varma Datla, Anudeep Vurity, Tejaswani Dash, Tazeem Ahmad, Mohd Adnan, Saima Rafi

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。

Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04232 2025-12-05 q-bio.PE cs.CY 57%

Decentralized Social Media and Artificial Intelligence in Digital Public Health Monitoring

去中心化的社交媒体与人工智能在数字公共卫生监测中的应用

Marcel Salathé, Sharada P. Mohanty

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文探讨了去中心化社交媒体与人工智能在数字公共卫生监测中的应用,分析了数据获取与AI技术之间的矛盾,并提出了适应性策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15478 2025-12-04 cs.CL 57%

A Group Fairness Lens for Large Language Models

为大语言模型引入群体公平性视角

Guanqun Bi, Yuqiang Xie, Lei Shen, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出从群体公平性角度评估大语言模型的偏见,引入 GFAIR 数据集和 GF-THINK 方法,以缓解模型中的偏见问题。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02508 2025-12-03 cs.LG 57%

Water Quality Estimation Through Machine Learning Multivariate Analysis

通过机器学习多变量分析估计水质

Marco Cardia, Stefano Chessa, Alessio Micheli, Antonella Giuliana Luminare, Francesca Gambineri

机构 * University of Pisa(比萨大学) ARCHA S.R.L.(ARCHA公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文通过结合紫外-可见光谱与机器学习,提出了一种用于水质评估的多变量分析方法,以实现快速、准确且可解释的水质参数检测。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01214 2025-12-02 cs.CV cs.AI 57%

M4-BLIP: Advancing Multi-Modal Media Manipulation Detection through Face-Enhanced Local Analysis

M4-BLIP:通过面部增强的局部分析推进多模态媒体篡改检测

Hang Wu, Ke Sun, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing(多媒体可信感知与高效计算重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 M4-BLIP通过引入面部增强的局部分析,提升多模态媒体篡改检测的准确性和可解释性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00410 2025-12-02 cs.RO cs.AI 57%

Balancing Efficiency and Fairness: An Iterative Exchange Framework for Multi-UAV Cooperative Path Planning

平衡效率与公平:多无人机协作路径规划的迭代交换框架

Hongzong Li, Luwei Liao, Xiangguang Dai, Yuming Feng, Rong Feng, Shiqin Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Computer Science and Engineering, Chongqing Three Gorges University(重庆三峡大学计算机科学与工程学院) Chinese Academy of Sciences, New Territories, Hong Kong(中国科学院香港新 Territories 分院) City University of Hong Kong, Kowloon, Hong Kong(香港城市大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出一种迭代交换框架,用于多无人机协作路径规划,通过任务交换和路径细化平衡效率与公平性,实验表明其在总距离和makespan之间取得更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09439 2025-12-02 cs.CY cs.SY eess.SY 57%

Towards Ethical AI in Power Electronics: How Engineering Practice and Roles Must Adapt

迈向电力电子中的伦理AI:工程实践和角色必须如何适应

Fanfan Lin, Peter Wilson, Xinze Li, Alan Mantooth

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨电力电子中AI伦理的重要性,提出四个核心伦理支柱,并呼吁工程师和IEEE推动伦理标准与人才发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22483 2025-12-01 cs.LG 57%

Enhancing Trustworthiness with Mixed Precision: Benchmarks, Opportunities, and Challenges

通过混合精度提升可信度:基准测试、机遇与挑战

Guanxi Lu, Hao Mark Chen, Zhiqiang Que, Wayne Luk, Hongxiang Fan

机构 * Department of Computing Imperial College London(计算系 帝国理工学院伦敦分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文研究了量化对可信度指标的影响,提出了一种混合精度集合投票方法,提升了可信度指标性能。

Comments ASP-DAC 2026 Special Session

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20783 2025-11-27 cs.CL 57%

On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey

在预训练语言模型中通用文本嵌入的作用:综述

Meishan Zhang, Xin Zhang, Xinping Zhao, Shouzheng Huang, Baotian Hu, Min Zhang

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文综述了预训练语言模型在通用文本嵌入中的作用,探讨了其架构、核心方法及未来研究方向。

Comments 45 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 57%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20230 2025-11-20 cs.LG 57%

Coresets from Trajectories: Selecting Data via Correlation of Loss Differences

Manish Nagaraj, Deepak Ravikumar, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

Journal ref Transactions on Machine Learning Research 2025, issn=2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14693 2025-11-19 cs.CL 57%

Talk, Snap, Complain: Validation-Aware Multimodal Expert Framework for Fine-Grained Customer Grievances

Rishu Kumar Singh, Navneet Shreya, Sarmistha Das, Apoorva Singh, Sriparna Saha

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments To be published in the Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026 Special Track on AI for Social Impact )

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13865 2025-11-19 econ.GN cs.AI q-fin.EC 57%

Randomized Controlled Trials for Conditional Access Optimization Agent

James Bono, Beibei Cheng, Joaquin Lozano

机构 * Microsoft Corporation(微软公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11789 2025-11-18 cs.MA cs.AI 57%

From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions

Jiayi Li, Xiao Liu, Yansong Feng

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

Comments AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08641 2025-11-13 cs.CR cs.CY cs.MA 57%

QOC DAO -- Stepwise Development Towards an AI Driven Decentralized Autonomous Organization

Marc Jansen, Christophe Verdot

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07941 2025-11-12 cs.CV cs.AI 57%

Libra-MIL: Multimodal Prototypes Stereoscopic Infused with Task-specific Language Priors for Few-shot Whole Slide Image Classification

Zhenfeng Zhuang, Fangyu Zhou, Liansheng Wang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02241 2025-11-12 cs.CL 57%

Isolating Culture Neurons in Multilingual Large Language Models

Danial Namazifard, Lukas Galke Poech

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23628 2025-11-11 physics.soc-ph cs.CY cs.DS cs.GT econ.TH 57%

Matchings Under Biased and Correlated Evaluations

Amit Kumar, Nisheeth K. Vishnoi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments To appear in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13182 2025-11-11 cs.LO cs.AI 57%

Information Science Principles of Machine Learning: A Causal Chain Meta-Framework Based on Formalized Information Mapping

Jianfeng Xu

机构 * Koguan School of Law, China Institute for Smart Justice, School of Computer Science, Shanghai Jiao Tong University(柯 guar 法学院、中国智能正义研究院、计算机科学学院、上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25863 2025-11-05 cs.CR cs.AI 57%

AAGATE: A NIST AI RMF-Aligned Governance Platform for Agentic AI

Ken Huang, Kyriakos Rock Lambros, Jerry Huang, Yasir Mehmood, Hammad Atta, Joshua Beck, Vineeth Sai Narajala, Muhammad Zeeshan Baig, Muhammad Aziz Ul Haq, Nadeem Shahzad, Bhavya Gupta

机构 * RockCyber Kleiner Perkins Qorvex Consulting & Roshan Consulting SAS Institute OWASP Wentworth Institute of Higher Education & Machine Learning Professional Skylink Antenna Roshan Consulting & Robotic Process Automation Stanford University

专题命中 AI治理与伦理 :red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01550 2025-11-04 cs.AI 57%

Analyzing Sustainability Messaging in Large-Scale Corporate Social Media

Ujjwal Sharma, Stevan Rudinac, Ana Mićković, Willemijn van Dolen, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26309 2025-10-31 cs.AI cs.IR 57%

GraphCompliance: Aligning Policy and Context Graphs for LLM-Based Regulatory Compliance

Jiseong Chung, Ronny Ko, Wonchul Yoo, Makoto Onizuka, Sungmok Kim, Tae-Wan Kim, Won-Yong Shin

机构 * Seoul National University(首尔国立大学) Osaka University(大阪大学) Yonsei University(延世大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

Comments Under review at The Web Conference 2026 (Semantics & Knowledge track). Code will be released upon acceptance. This arXiv v1 contains no repository links to preserve double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10492 2025-10-29 cs.LG 57%

Blockchain-Based Federated Learning: Incentivizing Data Sharing and Penalizing Dishonest Behavior

Amir Jaberzadeh, Ajay Kumar Shrestha, Faijan Ahamad Khan, Mohammed Afaan Shaikh, Bhargav Dave, Jason Geng

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

Comments To appear in the 5th International Congress on Blockchain and Applications (BLOCKCHAIN'23). Publish by the Lecture Notes in Networks and Systems series of Springer Verlag

Journal ref Blockchain and Applications, 5th International Congress. BLOCKCHAIN 2023. Lecture Notes in Networks and Systems, vol 778. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22286 2025-10-28 cs.CY 57%

Hybrid Instructor Ai Assessment In Academic Projects: Efficiency, Equity, And Methodological Lessons

Hugo Roger Paz

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments 12 pages, in Spanish language, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21967 2025-10-28 cs.HC cs.CY 57%

We Need Accountability in Human-AI Agent Relationships

Benjamin Lange, Geoff Keeling, Arianna Manzini, Amanda McCroskery

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21203 2025-10-27 cs.CY 57%

The Nuclear Analogy in AI Governance Research

Sophia Hatz

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

Comments Hatz, S. (in press). The Nuclear Analogy in AI Governance Research. In M. Furendal & M. Lundgren (Eds.), Handbook on the Global Governance of Artificial Intelligence. Edward Elgar Publishing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19196 2025-10-23 cs.CY 57%

Integration of AI in STEM Education, Addressing Ethical Challenges in K-12 Settings

Shaouna Shoaib Lodhi, Shoaib Lodhi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

Comments This paper pursues three goals: (1) analyzing ethical challenges in AI-driven STEM education, (2) evaluating AI and ethics curricula for STEM relevance, and (3) proposing a research-based framework for responsible integration that bridges teacher readiness gaps and promotes equity through STEM-focused strategies

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18556 2025-10-22 cs.CL 57%

Building Trust in Clinical LLMs: Bias Analysis and Dataset Transparency

Svetlana Maslenkova, Clement Christophe, Marco AF Pimentel, Tathagata Raha, Muhammad Umar Salman, Ahmed Al Mahrooqi, Avani Gupta, Shadab Khan, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

Comments Accepted to EMNLP Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04650 2025-10-21 cs.LG 57%

Neural Network Reprogrammability: A Unified Theme on Model Reprogramming, Prompt Tuning, and Prompt Instruction

Zesheng Ye, Chengyi Cai, Ruijiang Dong, Jianzhong Qi, Lei Feng, Pin-Yu Chen, Feng Liu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02649 2025-10-21 cs.AI 57%

Fully Autonomous AI Agents Should Not be Developed

Margaret Mitchell, Avijit Ghosh, Alexandra Sasha Luccioni, Giada Pistilli

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏