arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 128 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 128 篇

2607.07663 2026-07-09 cs.AI 新提交 57%

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

人工智能中的递归自我改进:从有界自我优化到自主研究循环

Mingguang Chen, Licheng Wang, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) AlphaAvatar(阿尔法阿凡达) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究人工智能系统自身改进,通过对1250篇论文调查区分有界自我优化与开放式递归自我改进(RSI),考察评估器设计空间并排序信号,发现自我改进强度与层次相关,失败模式源于违规,指出治理级测量是薄弱环节。

Comments 42 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03542 2026-07-07 cs.CY 新提交 57%

Macro-Prudential AI Governance: A Two-Layer Early Warning and Response System for Frontier AI

宏观审慎人工智能治理:前沿人工智能的双层预警与响应系统

Pranav Mehta

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 针对前沿人工智能治理问题,借鉴巴塞尔协议III框架等,提出宏观审慎预警与响应系统。通过A层特定流程和B层定量指标校准控制,能检测风险积累并设应对途径。

Comments 14 pages, 1 figure, 1 table. Accepted at the Second Workshop on Technical AI Governance Research (TAIGR 2026) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12502 2026-07-07 physics.soc-ph cs.AI 新提交 57%

A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints

价值的数学理论:资源约束下目标导向行为的综合

Cheng Qian

机构 * Cheng Qian(陈倩)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出价值是目标导向主体在资源约束下转化资源为目标进度的速率,通过尺度不变性公理导出对数度量,并推导出价值编码定理,实现价值与信息论的统一。

Comments Also available at https://doi.org/10.5281/zenodo.20487041 (v6). v2: the pre-registered continuation-gate experiment has been run -- prediction (i) confirmed on real frontier agents; prediction (ii) retired to mathematical scope. Code, pre-registrations, and raw run records: https://github.com/macrokit/value

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30970 2026-07-03 cs.AI 新提交 57%

Behavioral Governance for Autonomous AI Agents: The AgentBound Framework

AgentBound: 自主AI智能体的可验证行为治理

Anuj Kaul, Qianlong Lan, Pranay Gupta

机构 * eBay Inc.(eBay公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出AgentBound框架,通过委托授权、行为宪法和站点行动合同三权独立评估,结合形式化决策模型实现AI智能体行为的可验证治理,并生成加密可验证的治理收据以支持独立重放验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00423 2026-07-02 cs.CL 新提交 57%

Selective Test-Time Debiasing for CLIP via Reward Gating

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 提出基于强化学习的测试时自适应框架RG-TTA,根据输入对偏见的敏感性选择性应用去偏,在减少偏见的同时保持零样本性能。

Comments 15 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26595 2026-06-26 cs.AI 新提交 57%

LLM-based Models for Detecting Emerging Topics in Service Feedback

基于LLM的服务反馈中新兴主题检测模型

Mahsa Tavakoli, Ruth Bankey, Cristián Bravo

机构 * Department of Statistical and Actuarial Sciences, The University of Western Ontario(西安大略大学统计与精算科学系) Canada Revenue Agency(加拿大税务局)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型、统计技术和人机协作的方法,用于检测服务反馈中的新兴质量主题,并揭示潜在服务不公,经税务专家评估优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25012 2026-06-25 cs.LG 新提交 57%

Bias-Controlled Primal-Dual Natural Actor-Critic: Optimal Rates for Constrained Multi-Objective Average-Reward RL

偏置控制的原对偶自然演员-评论家:约束多目标平均奖励强化学习的最优速率

Ankur Naskar, Swetha Ganesh, Vaneet Aggarwal

机构 * Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度) Purdue University, USA(普渡大学,美国)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 针对平均奖励设置下的约束多目标强化学习,提出基于MLMC的原对偶自然演员-评论家算法,控制标量化目标、约束评估和演员-评论家估计中的偏置,实现最优全局收敛和约束违反率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24585 2026-06-24 cs.AI 新提交 57%

LLMs Prompted for Legal Context Object More: Overrefusal from Small On-Premises LLMs in Criminal Legal Context

LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝

Anastasiia Kucherenko, François Brouchoud, Dimitri Percia David, Andrei Kucharavy

机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)

专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.AI

AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23860 2026-06-24 cs.CY 新提交 57%

World Artificial Intelligence Cooperation Organization (WAICO): Mapping an Emerging Institution in the Global AI Governance Regime Complex

世界人工智能合作组织(WAICO):全球人工智能治理体制复合体中一个新兴机构的映射

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文通过编码15项国际AI治理文书和机构,分析中国提议的世界人工智能合作组织(WAICO)的设计特征,发现其结合了成员国开放、无价值观测试和发展优先议程,构成全球AI治理中基于主权与发展的第二极。

Comments 13 pages, 2 figures, 1 table. Data and code: https://github.com/williamguey/waico-ai-governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19816 2026-06-19 cs.CY 新提交 57%

Challenges to Grassroots Organization Engagement with AI Policy

基层组织开展AI政策参与的挑战

Carter Buckner, Jennifer Mickel, Nandhini Swaminathan, William Agnew, Jacob Hobbs, Sarthak Arora, Michelle Lin, Yanan Long, B. V. Alaka

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文通过案例研究,探讨基层组织和边缘化社区在参与AI政策制定中面临的挑战,并提出基于参与式设计的建议。

Comments To appear at ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19668 2026-06-19 cs.CL 新提交 57%

Code-Switching Reveals Language Anchoring in Multilingual LLMs

代码切换揭示多语言大模型中的语言锚定

Jeonghyun Park, Seunghyun Yoon, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(中央大学) Adobe Research(Adobe研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 通过语法强制代码切换诊断多语言大模型中的语言锚定现象,提出锚定偏差度量并设计CANVAS干预方法,有效缓解代码切换导致的问答性能下降。

Comments 36 pages, 13 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18537 2026-06-18 cs.LG 新提交 57%

Do as the Romans Do: Learning Universal Behaviors from Heterogeneous Agents

入乡随俗:从异构智能体学习通用行为

Caleb Chang, Davin Win Kyi, Natasha Jaques, Karen Leung

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 提出GRID方法,从追求不同目标的异构示范者中提取通用奖励,训练通用智能体以学习环境通用能力,避免模式平均偏差,提升下游任务微调效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18506 2026-06-18 cs.LG eess.SP stat.AP 新提交 57%

Beyond AHI: An Interpretable Causal-Discovery-Guided Framework for Sleep Recovery in Connected Health

超越AHI:一种可解释的因果发现引导的睡眠恢复框架在互联健康中的应用

Saba A. Farahani, Elahe Khatibi, Manoj Vishwanath, Amir M. Rahmani, Hung Cao

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 提出一种可解释的因果发现引导框架,从多模态PSG中推导层次化睡眠恢复评分(SRS),在两大队列中SRS与感知恢复的关联强度是AHI的2.5倍。

Comments 6 pages, 2 figures, 2 tables. Accepted at the 2nd Workshop on Sensing and Computing for Smart and Connected Health (SCH), co-located with IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交 57%

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11835 2026-06-11 cs.HC cs.AI 新提交 57%

Designing AI-Supported Focus Groups: A Role x Modality Playbook

设计AI支持的焦点小组:角色×模态剧本

Zhiqing Wang, Steven Dow

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对焦点小组资源密集且对引导高度敏感的问题,提出按AI角色(工具、联合主持、主持)和模态(文本、语音、具身)组织的剧本,并分析交互权衡与开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09414 2026-06-09 cs.HC cs.AI 新提交 57%

AI Assurance in UK Defence: Challenges in Operationalising JSP 936

英国国防中的人工智能保证:JSP 936 操作化的挑战

Callum Cockburn, Sam Farrow

机构 * Synoptix

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文通过结构化解释性审查,识别了英国国防中实施JSP 936进行AI保证的八大挑战,并指出其依赖未解决的技术、组织和保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07837 2026-06-09 cs.HC cs.AI 新提交 57%

Does Persona Make LLMs K-pop Fans? A Pilot Study of LLM-Based Online Concert Audience Agents

角色设定会让LLM成为K-pop粉丝吗?基于LLM的在线演唱会观众智能体初步研究

Kirak Kim, Hyojin Kim, Yejin Son, Sungyoung Kim, Kyung Myun Lee

机构 * Graduate School of Culture Technology, KAIST, Daejeon, South Korea(韩国成均馆大学文化科技研究生院) Department of Artificial Intelligence, Yonsei University, Seoul, South Korea(延世大学人工智能系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究通过多智能体系统模拟K-pop演唱会实时粉丝聊天,发现角色设定能提升聊天质量和自然度,但未增强社交连接或情感反应,表明有意义的集体体验需更深层次对齐。

Comments Accepted at the ICML 2026 Workshop on Culture x AI: Evaluating AI as a Cultural Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07628 2026-06-09 cs.CY cs.CV 新提交 57%

Frankenstein in the Pipeline: Computational Epistemicide in Facial Recognition

管道中的弗兰肯斯坦:面部识别中的计算性知识灭绝

Nina da Hora

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学) Instituto da Hora(时间研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文借鉴玛丽·雪莱的《弗兰肯斯坦》作为方法论框架,分析基于嵌入的面部识别如何通过检测、地标定位、对齐/正面化和嵌入等步骤,逐步将面部简化为数据,实施“计算性知识灭绝”,并论证废除主义作为规范性立场。

Comments Accepted to ACM FAccT 2026. Author's version. 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13969 2026-08-17 cs.CV 新提交 50%

PPOM: Marginalizing Patch-Grid Phase for CLIP-Based Generalizable Vision-Language Prompt Tuning

PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化

Liang Wang, Haoyang Li, Chao Wang, Guodong Long, Jing Jiang, Yan Peng

机构 * Shanghai University(上海大学) University of Technology Sydney(悉尼科技大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06829 2026-08-10 cs.SE 新提交 50%

How Reasoning Shapes Social Bias in LLM-Generated Code?

推理如何塑造大语言模型生成代码中的社会偏见?

Weifeng Sun, Jieke Shi, Zhou Yang, Yuchen Chen, Hongyan Li, Meng Yan, David Lo

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究首次系统探究基于推理的代码生成中的社会偏见,发现推理可降低偏见但会影响代码质量,进而提出ProbeDebias框架,有效检测并缓解代码偏见,同时保持较高质量。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 50%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01661 2026-08-04 cs.CV 新提交 50%

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

FairForensics:基于视觉-语言建模的通用公平深度伪造检测——表情感知与人口统计解析

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

机构 * Shenzhen University(深圳大学) Shandong Artificial Intelligence Institute(山东省人工智能研究院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) Tianjin University of Technology(天津理工大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文构建人口统计平衡的深度伪造检测基准,提出FairForensics视觉-语言模型,通过表情感知与人口统计正则化实现通用公平检测,在基准上达到泛化与公平性的SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29610 2026-08-03 cs.SE 新提交 50%

Educating the Agentic Engineer: Curricula, Collaboration, and Continuous Learning in the AI Era

培养智能体工程师:AI时代的课程、协作与持续学习

Mamdouh Alenezi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交 50%

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 50%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19667 2026-07-23 eess.SY cs.SY 新提交 50%

A Human-AI Teaming Framework for Deep Reinforcement Learning-Based Voltage Regulation in Distribution Networks

一种用于配电网中基于深度强化学习的电压调节的人机协作框架

Mahmuda Akter, Hamidreza Nazaripouya

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对分布式能源资源增加致配电网电压调节难的问题,提出人机协作强化学习框架。该框架结合SAC智能体与自适应拉格朗日约束机制,并融入人类指导模块,在特定环境实现。相比基线方法,显著降低电压违规严重性及功率损耗。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 50%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15862 2026-07-20 math.OC 新提交 50%

PriEco-DRL: Joint Optimization of Electric-Bus Eco-Driving and Transit-Priority Adaptive Signals via Deep Reinforcement Learning

PriEco-DRL:基于深度强化学习的电动公交生态驾驶与公交优先自适应信号联合优化

Dingshan Sun, Ang Li, Chaopeng Tan, Zicheng Su, Wanjing Ma, Marco Rinaldi

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出PriEco-DRL框架,运用深度强化学习将电动公交生态驾驶与公交优先自适应信号控制相结合,采用优先级加权最大压力控制器及结构化奖励,经集中训练和分散执行,实验表明其能降低电动公交能耗,实现能量-时间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11601 2026-07-14 cs.CR 新提交 50%

Cardano's Voltaire Governance: Complete Specification and Research Program

卡尔达诺的伏尔泰治理:完整规范与研究计划

Nimrod Talmon, Oghenekaro Elem

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究卡尔达诺的伏尔泰治理系统,给出其机制完整技术规范,涵盖架构、行动类型等;建立治理优化研究议程,含模拟平台设计等,提供初步结果如治理内核,助力推进区块链治理科学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05442 2026-07-08 cs.GT 新提交 50%

The Oracle's Gambit: A Game-Theoretic Framework for Responsible AI Release

神谕者的策略:负责任的人工智能发布的博弈论框架

Christoph R. Landolt, Tobias Lorenz, Marta Kwiatkowska, Mario Fritz

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究在人工智能模型能力提升背景下,负责任的人工智能发布决策问题。核心方法是将其视为双层斯塔克尔伯格博弈,通过承诺窗口设定双方能力。主要贡献是指出福利取决于能力差距,明确两用模型关键在于访问顺序而非部署阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏