arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1836 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1836 篇

2606.26729 2026-06-29 cs.HC 新提交 50%

'A bit of chaos and madness': The AI Assessment Scale and the work of assessment reform

“一丝混乱与疯狂”:AI评估量表与评估改革工作

Mike Perkins, Darius Postma, Jasper Roe, Susan Sisay, Craig Holdcroft

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本研究通过越南和英国两所大学的焦点小组,探讨AI评估量表(AIAS)的实施经验,发现其能促进真实评估设计,但若脱离学习成果和学科背景可能沦为合规工具。

Comments V2: Corrections of errata, additional limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01127 2026-06-24 cs.CR 版本更新 50%

Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense

多智能体LLM治理:SDN-IoT防御中安全的两时间尺度强化学习

Saeid Jamshidi, Negar Shahabi, Foutse Khomh, Carol Fung, Mohammad Hamdaqa

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出两时间尺度SDN-IoT防御方案,快时间尺度使用PPO智能体进行控制器感知的缓解,慢时间尺度使用多智能体LLM治理引擎生成可审计的策略更新,在保证安全约束下提升防御性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18924 2026-06-18 cs.SD 新提交 50%

Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs

谁赢得冲突?音频大模型中文本偏差的机制可解释性

Hyebin Cho, Suho Yoo, Jaehyuk Jang, Changick Kim, Joon Son Chung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文通过机制分析揭示音频大模型中的文本主导偏差,发现文本路径主动抑制完整音频表征,并提出无训练干预方法back-patching以增强音频表征,缓解文本主导。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14796 2026-06-16 cs.SE 新提交 50%

Faster Code, Deeper Debt? A Multivocal Literature Review on Technical Debt and Its Early Signs in LLM-Assisted Software Development

更快的代码,更深的债务?关于LLM辅助软件开发中技术债务及其早期迹象的多声部文献综述

Ramtin Ehsani, Shriya Rawal, Yuanfang Cai, Preetha Chatterjee

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过104篇文献的多声部综述,发现LLM辅助开发放大传统技术债务(代码、设计、文档债务)并引入新债务(快速集成、提示、伦理、数据、来源债务),提出人机协同、提示工程等缓解策略,但缺乏标准化基准。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17179 2026-06-16 cs.MA 版本更新 50%

Ablation Study of a Fairness Auditing Agentic System for Bias Mitigation in Early-Onset Colorectal Cancer Detection

公平性审计代理系统在早发性结直肠癌检测中缓解偏见的消融研究

Amalia Ionescu, Jose Guadalupe Hernandez, Jui-Hsuan Chang, Emily F. Wong, Paul Wang, Jason H. Moore, Tiffani J. Bright

专题命中 AI治理与伦理 :safety(abstract)

AI总结 提出双代理架构(领域专家代理+公平性顾问代理),通过消融实验比较不同配置下大语言模型在公平性审计中的表现,发现带RAG的代理系统在识别差异方面语义相似度最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12258 2026-06-11 cs.CV 新提交 50%

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

连接昼夜:基于协同提示与原型学习的无监督跨域重识别

Jiyang Xu, Rui Liu, Hang Dai

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出无监督昼夜重识别框架,结合提示学习和原型表示学习,通过两阶段训练实现无标注跨域身份关联,性能媲美全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07833 2026-06-11 cs.RO 版本更新 50%

Harnessing Embodied Agents: Runtime Governance for Policy-Constrained Execution

利用具身体 agent:运行时治理以实现政策约束执行

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚校区数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种政策约束执行框架,通过将 agent 认知与执行监督分离,增强了具身体 agent 的运行时治理能力,通过 1000 次随机模拟验证,显著提高了对未经授权动作的拦截率和系统恢复成功率。

Comments 36 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28167 2026-05-28 cs.CV 50%

DebFilter: Eradicating Biases Stashed in Value

DebFilter: 消除隐藏在值中的偏见

Seung Hyuk Lee, Songkuk Kim

机构 * School of Integrated Technology, BK21 Graduate Program in Intelligent Semiconductor Technology(整合技术学院,智能半导体技术BK21研究生项目)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 提出DebFilter,一种轻量级、无需训练的方法,通过调整交叉注意力中的值分量来纠正文本到图像扩散模型中的社会偏见,实现推理时偏差缓解。

Comments 8 pages, 7 figures, supplementary material included, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24729 2026-05-26 cs.HC 50%

"It Felt a Bit Eerie": Exploring Humanlike Interactions During Collaborative Writing with an Artificial Agent

"感觉有点诡异":与人工智能体协作写作中类人交互的探索

Michael Yin, Angela Chiang, Samuel Rhys Cox, Robert Xiao

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 通过构建三种不同类人程度的AI辅助编辑器并开展用户研究,探讨协作的时间与视觉维度如何影响写作体验及人机社会连接。

Comments 29 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23330 2026-05-25 cs.CR 50%

Security, Privacy, and Ethical Risks in OpenClaw

OpenClaw 中的安全、隐私与伦理风险

Yutong Jin, Zelin Zhang, Zhijin Lyu, Jianbing Ni

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统研究了本地可执行AI代理系统OpenClaw在安全、隐私、伦理及可追溯性方面的风险,并呼吁多方合作构建更安全可靠的AI代理系统。

Comments Accepted by Journal of Information and Intelligence(JII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21569 2026-05-22 cs.HC 50%

When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking

当支持加剧压力:在LLM对倾诉和寻求建议的回应中的调节与加剧

Vivienne Bihe Chi, Adithya V Ganesan, Ryan L Boyd, Lyle Ungar, Sharath Chandra Guntuku

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究探讨了大型语言模型在不同求助风格(倾诉与寻求建议)下对压力的调节与加剧作用,通过分析Reddit帖子发现LLM回应中调节和加剧是独立的维度,且不同角色设定(默认、朋友、治疗师)对调节和加剧的影响不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-05-15 cs.CV 50%

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13235 2026-05-14 cs.NI 50%

Intelligence Delivery Network: Toward an Internet Architecture for the AI Age

智能交付网络:面向人工智能时代的互联网架构

Hanling Wang, Qing Li, Dan Zhao, Yuhong Song, Xingchi Chen, Teng Gao, Peiyuan Zong, Zhuyun Qi, Yue Yu, Yong Jiang

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出智能交付网络(IDN),旨在通过将AI能力作为可交付的网络服务,解决传统云中心化部署在延迟、资源利用率和隐私问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 50%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO 50%

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05830 2026-05-08 cs.CR 50%

Fairness in Token Delegation: Mitigating Voting Power Concentration in DAOs

代币委托中的公平性:缓解DAO中的投票权集中问题

Johnnatan Messias, Ayae Ide

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究DAO治理中委托机制的问题,通过分析14个DAO论坛的数据,发现委托常与持有者优先级不一致,提出引入兴趣匹配以缓解权力集中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27825 2026-05-01 cs.SE 50%

Requirements Debt in AI-Enabled Perception Systems Development: An Industrial RE4AI Perspective

人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角

Hina Saeeda, Soniya Abraham

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23946 2026-05-01 physics.comp-ph physics.flu-dyn 50%

Learning subgrid interfacial area in two-phase flows with regime-dependent inductive biases

在两相流中利用相态依赖性归纳偏置学习子网格界面面积

Anirban Bhattacharjee, Luis H. Hatashita, Suhas S. Jain

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了在湍流多相流中利用物理结构嵌入学习过程以提高机器学习可靠性,开发并评估了两种子网格闭合模型,发现物理约束模型在不同Weber数下能提升预测精度并抑制非物理伪影。

Comments 34 pages, 17 figures, journal preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 50%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 50%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10069 2026-04-17 cs.RO 50%

Humanoid Factors: Design Principles for AI Humanoids in Human Worlds

人形因素:人工智能人形在人类世界中的设计原则

Xinyuan Liu, Eren Sadikoglu, Ransalu Senanayake, Lixiao Huang

机构 * School of Computing and Augmented Intelligence, Arizona State University, AZ, USA(计算与增强智能学院,亚利桑那州立大学,亚利桑那州,美国) School of Manufacturing Systems and Networks, Arizona State University, AZ, USA(制造系统与网络学院,亚利桑那州立大学,亚利桑那州,美国) Human Systems Engineering, Arizona State University, AZ, USA(人机系统工程,亚利桑那州立大学,亚利桑那州,美国)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出人形因素框架,旨在指导人工智能人形与人类共存与协作的设计,强调物理、认知、社会和伦理四个支柱,以解决人形与人类交互中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13103 2026-04-16 cs.SE cs.MA 50%

Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review

多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述

Corey Yang-Smith, Ronnie de Souza Santos, Ahmad Abdellatif

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。

Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08740 2026-04-15 econ.TH 50%

Misspecified Model Estimation and Its Impact on Predictions

模型误设估计及其对预测的影响

Junnan He, Lin Hu, Matthew Kovach, Anqi Li

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究线性统计模型中,因变量依赖于具有固定总体系数和观察特定潜系数的自变量及测量误差。决策者估计总体系数并用于预测给定观察的潜系数。分析模型误设如何扭曲预测,探讨残差信息与误设向量与潜变量到系数映射的对齐性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13538 2026-04-14 cs.SE cs.ET 50%

Model Context Protocol (MCP) at First Glance: Studying the Security and Maintainability of MCP Servers

模型上下文协议(MCP)初探:研究MCP服务器的安全性和可维护性

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文首次对MCP服务器进行大规模实证研究,发现其存在八种独特漏洞,强调需专门的漏洞检测技术,并呼吁加强MCP生态系统的治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09655 2026-04-09 cs.CR 50%

How Secure is Code Generated by ChatGPT?

ChatGPT生成的代码安全性如何?

Raphaël Khoury, Anderson R. Avila, Jacob Brunelle, Baba Mamadou Camara

专题命中 AI治理与伦理 :safety(abstract)

AI总结 研究评估了ChatGPT生成代码的安全性,探讨了通过提示提高安全性的方法及AI生成代码的伦理问题。

Journal ref 2023 IEEE International Conference on Systems, Man, and Cybernetics (SMC) October 1-4, 2023, Oahu, Hawaii, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02499 2026-04-06 cond-mat.mtrl-sci 50%

CARBON-2D Topological Descriptor (C2DTD): An Interpretable and Physics-Informed Representation for Two-Dimensional Carbon Networks

CARBON-2D拓扑描述符(C2DTD):一种可解释且物理导向的二维碳网络表示方法

Felipe Hawthorne, Marcelo Lopes Pereira Junior, Fabiano Manoel de Andrade, Cristiano Francisco Woellner, Raphael Matozo Tromer

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出C2DTD,一种用于二维碳系统的物理导向结构表示方法,通过整合局部几何统计、紧凑径向结构特征和显式原始环拓扑,实现高效且可解释的预测性能,适用于小数据集和缺陷工程石墨烯的分析。

Comments 22 pages and 06 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01056 2026-04-02 eess.SY cs.SY 50%

A Functional Learning Approach for Team-Optimal Traffic Coordination

团队最优交通协调的函数学习方法

Weihao Sun, Gehui Xu, Alessio Moreschini, Thomas Parisini, Andreas A. Malikopoulos

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出基于核的方法的策略迭代函数学习框架,用于计算交通协调问题中的团队最优策略,结合二次调节项和非线性安全惩罚项,通过核空间近似求解,并在SUMO中验证。

Comments 8 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22588 2026-04-02 cs.HC cs.ET 50%

Practitioner Voices Summit: How Teachers Evaluate AI Tools through Deliberative Sensemaking

实践者声音峰会:教师如何通过 deliberative sensemaking 评估 AI 工具

Dorottya Demszky, Christopher Mah, Helen Higgins

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨教师在整合AI工具时的评估标准及支持条件,通过全国峰会收集61名数学教师制定的200余条评估标准,揭示了 deliberative sensemaking 的五种机制及TPACK与代理的相互促进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27411 2026-03-31 cs.HC 50%

Relational Co-Adaptation in Emotionally Supportive AI: Tensions in Authentic Emotional Interaction

情感支持型AI中的关系共适应:真实情感互动中的张力

Mengqi Shi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了情感支持型AI中双向对齐的悖论,指出技术有效性可能引发伦理问题,如AI成为老年人唯一选项、情感需求与系统干预不匹配等。

详情

展开后加载摘要…

URL PDF HTML 收藏