arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1836 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1836 篇

2211.13130 2022-11-24 cs.CY cs.AI cs.LG 56%

A Brief Overview of AI Governance for Responsible Machine Learning Systems

Navdeep Gill, Abhishek Mathur, Marcos V. Conde

专题命中 AI治理与伦理 :分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)

Comments NeurIPS 2022 Trustworthy and Socially Responsible Machine Learning (TSRML) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10028 2026-03-12 cs.CY cs.AI 54%

How to Count AIs: Individuation and Liability for AI Agents

如何计算AI:AI代理的个体化与责任归属

Yonathan Arbel, Peter Salib, Simon Goldstein

机构 * University of Alabama(阿拉巴马大学) University of Hong Kong(香港大学) University of Houston(休斯顿大学) HKU AI & Humanity Lab(香港大学AI与人类实验室) Center for Law & AI Risk(法律与人工智能风险中心) Institute for Law & AI(法律与人工智能研究所)

专题命中 AI治理与伦理 :分类 cs.AI、cs.CY;safety(comments);AI safety(comments)

AI总结 本文提出通过‘算法公司’解决AI代理的个体识别与责任归属问题,通过法律虚构实体实现对AI行为的追踪与责任划分。

Comments 36 pages. Presented at the Law Following AI conference, Cambridge University. Interdisciplinary: AI safety, AI governance, legal theory

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05244 2024-07-09 cs.AI cs.CL 54%

Some Issues in Predictive Ethics Modeling: An Annotated Contrast Set of "Moral Stories"

Ben Fitzgerald

专题命中 AI治理与伦理 :分类 cs.CL、cs.AI;safety(comments);AI safety(comments)

Comments This project was a runner-up to the Novel Research prize for the BlueDot Impact course AI Safety Fundamentals. View my contrast set as JSONL, the UI used to generate it, and Emelin et. al."s initial paper and code at https://github.com/bfitzgerald3132/MoralStoriesContrastSet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04306 2026-08-18 cs.MA 版本更新 50%

Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems

组织控制层:LLM代理系统执行边界的治理基础设施

Tianyu Shi, Yang Mo, Yiou Liu, Zhuonan Hao, Yin Wang, Wenzhuo Hu, Nan Yu, Meng Zhou, Jiangbo Yu

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对LLM代理在执行边界产生的动作治理问题,提出组织控制层(OCL),通过策略执行和升级机制拦截生成动作,在不修改底层LLM生成器的情况下将不安全执行从88%降至接近零,同时将有效成功率从12%提升至96%。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13969 2026-08-17 cs.CV 新提交 50%

PPOM: Marginalizing Patch-Grid Phase for CLIP-Based Generalizable Vision-Language Prompt Tuning

PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化

Liang Wang, Haoyang Li, Chao Wang, Guodong Long, Jing Jiang, Yan Peng

机构 * Shanghai University(上海大学) University of Technology Sydney(悉尼科技大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04341 2026-08-11 eess.SY cs.SY 版本更新 50%

Reinforcement Learning for Freeway Lane-Change Regulation via Connected Vehicles

基于网联车辆的高速公路车道变更调控强化学习方法

Ke Sun, Huan Yu

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对低自动驾驶渗透率下车道变更控制适用性受限的问题,提出基于多智能体强化学习的网联车辆高速公路车道变更调控框架,可提升交通效率并保障安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 50%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 50%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01661 2026-08-04 cs.CV 新提交 50%

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

机构 * Shenzhen University(深圳大学) Shandong Artificial Intelligence Institute(山东省人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) Tianjin University of Technology(天津理工大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03697 2026-08-04 eess.AS 版本更新 50%

Improving ASR Fairness for Cleft Lip and Palate Speech: A Study on Severity-Aware Data Mixing

改善唇腭裂语音的自动语音识别公平性:一项关于严重程度感知数据混合的研究

Susmita Bhattacharjee, Jagabandhu Mishra, H. S. Shekhawat, Ravi Jasuja, S. R. Mahadeva Prasanna

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 该研究针对唇腭裂(CLP)语音的ASR公平性问题,提出严重程度感知的CLP与正常语音混合策略,在AIISH和NMCPC数据集上使GMM-HMM、Whisper等模型的词错误率显著降低,提升了ASR公平性。

Comments Submitted to Speech Communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29610 2026-08-03 cs.SE 新提交 50%

Educating the Agentic Engineer: Curricula, Collaboration, and Continuous Learning in the AI Era

培养智能体工程师:AI时代的课程、协作与持续学习

Mamdouh Alenezi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交 50%

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23118 2026-07-30 cs.CV cs.MM 版本更新 50%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 50%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17675 2026-07-29 cs.SE cond-mat.mtrl-sci 版本更新 50%

Bridging the Gap on AI-Assisted Scientific Software Development Through Transparency and Traceability

通过透明性和可追溯性弥合人工智能辅助科学软件开发的差距

Chaitanya Bhave, Pierre-Clément A. Simon, Casey Icenhour, Lin Yang, Cody J. Permann, Daniel Schwen, Christopher S. Ritter

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨了在严格软件质量保证背景下如何负责任地使用人工智能辅助科学软件开发,提出了一种结构化框架用于AI辅助的验证与验证案例开发,以确保软件质量。

Comments 11 figures, 25 main pages (42 total pages including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 50%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18988 2026-07-28 cs.CV 版本更新 50%

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

DobicVLM:通过群体相对策略优化使胸部X光报告生成与临床基础的程序化奖励保持一致

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni

机构 * Dobic Health(多比克健康公司) University of Ibadan(伊巴丹大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究针对自动胸部X光报告生成难题,提出DobicVLM模型,结合监督微调、GRPO及临床奖励,用可解释规则组件执行标准,经训练和评估,该模型多数标准优于Gemini 2.5 Flash,证明GRPO在资源受限设置中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19667 2026-07-23 eess.SY cs.SY 新提交 50%

A Human-AI Teaming Framework for Deep Reinforcement Learning-Based Voltage Regulation in Distribution Networks

一种用于配电网中基于深度强化学习的电压调节的人机协作框架

Mahmuda Akter, Hamidreza Nazaripouya

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对分布式能源资源增加致配电网电压调节难的问题,提出人机协作强化学习框架。该框架结合SAC智能体与自适应拉格朗日约束机制,并融入人类指导模块,在特定环境实现。相比基线方法,显著降低电压违规严重性及功率损耗。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25003 2026-07-21 cs.MA 50%

Emergent Coordinated Behaviors in Networked LLM Agents: Modeling the Strategic Dynamics of Information Operations

网络化生成代理中的涌现协调行为:信息操作的战略动态建模

Gian Marco Orlando, Jinyi Ye, Valerio La Gatta, Mahdi Saeedi, Vincenzo Moscato, Emilio Ferrara, Luca Luceri

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了生成代理在模拟信息操作中的协调行为,发现通过共享目标即可实现接近人工协调的水平,揭示了自动化信息操作的社会风险。

Journal ref WWW '26: Proceedings of the ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 50%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15862 2026-07-20 math.OC 新提交 50%

PriEco-DRL: Joint Optimization of Electric-Bus Eco-Driving and Transit-Priority Adaptive Signals via Deep Reinforcement Learning

PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化

Dingshan Sun, Ang Li, Chaopeng Tan, Zicheng Su, Wanjing Ma, Marco Rinaldi

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07070 2026-07-20 cs.SE 50%

Building an Open AIBOM Standard in the Wild

在真实环境中构建开放的AIBOM标准

Gopi Krishnan Rajbahadur, Keheliya Gallaba, Elyas Rashno, Arthit Suriyawongkul, Karen Bennet, Kate Stewart, Ahmed E. Hassan

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过行动研究方法,在真实环境中构建了AIBOM规范,旨在为人工智能系统提供开放的标准框架。

Comments Accepted to be published at the IEEE/ACM 48th International Conference on Software Engineering (ICSE) - Software Engineering in Practice (SEIP) track. April 12 - 18, 2026. Rio de Janeiro, Brazil

Journal ref Proc. IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26), 2026, pp. 842--853

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新 50%

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11601 2026-07-14 cs.CR 新提交 50%

Cardano's Voltaire Governance: Complete Specification and Research Program

卡尔达诺的伏尔泰治理:完整规范与研究计划

Nimrod Talmon, Oghenekaro Elem

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05442 2026-07-08 cs.GT 新提交 50%

The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release

神谕者的策略:负责任的人工智能发布的博弈论框架

Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01485 2026-07-03 cs.IR 新提交 50%

CoPersona: Collaborative Persona Graphs for Robust LLM Personalization

CoPersona: 面向鲁棒LLM个性化的协作人格图

Yangtian Zhang, Leyao Wang, Hiren Madhu, Ngoc Bui, Walter Roznyatovskiy, Rex Ying

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对用户历史稀疏和偏差导致的个性化脆弱问题,提出CoPersona框架,通过多面人格图从行为相似用户中借调信号,结合非参数检索与参数图推理的双分支架构,在多个领域和模型规模上超越强基线。

Comments Accepted at KDD '26. 12 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00046 2026-07-02 cs.MA cs.SE 新提交 50%

A Role-Based Multi-Agent Model for Climate Adaptation Deliberation Across Living Labs

基于角色的多智能体模型用于生活实验室间气候适应讨论

Önder Gürcan, David Eric John Herbert, F. LeRon Shultz, Christopher Frantz, Ivan Puga-Gonzalez

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出一种模块化多层级智能体架构,整合基于动机的个体决策、社会影响网络和机构策略模块,以模拟气候治理中的复杂互动,支持情景探索。

Comments 4 pages, 1 figure, accepted as poster at the 21st annual Social Simulation Conference (SSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31762 2026-07-01 cs.HC 新提交 50%

Investigating LLM-Powered Dissenting Minority Support in Power-Imbalanced Group Decision-Making: Counterargument and Mediation as Intervention Strategies

探究LLM赋能的异议少数群体在权力不平衡群体决策中的支持:反驳与调解作为干预策略

Soohwan Lee, Seoyeong Hwang, Mingyu Kim, Dajung Kim, Kyungho Lee

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究开发了LLM赋能的异议少数支持系统,通过AI生成的反驳或AI调解消息来关注少数观点,实验发现反驳增强满意度但调解增加参与却降低心理安全感,揭示了参与与心理安全之间的支持悖论。

Comments Accepted at CSCW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28340 2026-06-30 cs.IR 50%

Rethinking Fairness in LLM-Based Recommender Systems: A Survey

重新思考基于LLM的推荐系统中的公平性:一项综述

Song-Duo Ma, Chu-Yun Chen, Bang-An Li, Pin-Yu Chen, Shau-Yung Hsu, Yun-Nung Chen

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏