arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 66 篇

2608.07641 2026-08-11 cs.CL 新提交 57%

SurveyReview: A Reviewer-Aligned Benchmark for Survey Evaluators

SurveyReview:面向综述评估者的审稿人对齐基准

Yuheng Zhang, Yuanchun Wang, Fanjin Zhang, Ruyu Zhao, Juanzi Li, Jie Tang, Jing Zhang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对现有LLM评估综述未与人类审稿人对齐的问题,提出SurveyReview基准及SurveyAlign基线,大幅提升自动评估与人类审稿人的对齐程度,为该领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 57%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 57%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 57%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07517 2026-08-11 cs.HC cs.CL stat.AP 新提交 57%

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

法官知道自己何时知晓:基于大语言模型的A/B测试预测的校准弃权(不执行)

Tyler Dooskin, Squoosh Technical Staff

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 该研究探究多模态LLM能否仅通过网页截图预测A/B测试结果,发现Gemini 3 Flash法官表现不佳,提出投票边际关卡隔离置信判断可提升性能,还在人类中重现了共识与真实结果脱节的现象,并发布了相关研究资源。

Comments 15 pages. Pre-registered experimental program with a public, tiered claims ledger; includes powered negative results, a label-validity audit, a cross-judge shared-prior measurement (n_eff ~ 2 of 16 votes), and a first-party 15-expert human baseline. Pre-registrations, statistical harness, human responses, and the full experiment ledger are released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07514 2026-08-11 cs.CY 新提交 57%

Open Technical Problems in Open-Weight AI Model Risk Management

开放权重AI模型风险管理中的开放技术问题

Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit Ghosh, Andrew Strait, Robert Kirk, Dan Hendrycks, Peter Henderson, Zico Kolter, Geoffrey Irving, Yarin Gal, Yoshua Bengio, Dylan Hadfield-Menell

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文指出开放权重AI模型风险管理存在16项涉及多环节的技术挑战,强调相关研究需兼顾开放性,以实现其益处并减轻危害。

Comments Published in Transactions on Machine Learning Research (03/2026) Reviewed on OpenReview: https: // openreview. net/ forum? id= 8QyGLnFkzc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 57%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新 57%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新 57%

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01045 2026-08-11 cs.AI 版本更新 57%

Med-CRAFT: An Information System for Explainable and Configurable Construction of Multimodal Medical QA Datasets

Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载

Shenxi Liu, Kan Li, Mingyang Zhao, Yuhang Tian, Bin Li

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。

Comments 23 pages, 4 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26159 2026-08-11 cs.AI cs.CY cs.LG 版本更新 56%

When benchmark inferences do not compose: Projectibility in AI evaluation

当基准推理无法组合:AI评估中的可投射性

Brett Reynolds

机构 * Humber Polytechnic(汉伯理工学院) University of Toronto(多伦多大学)

专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;alignment(comments)

AI总结 本文针对AI评估中基准推理无法组合的问题,提出非组合原则,结合古德曼的竞争延伸问题与基于论证的有效性框架,通过案例和模拟开发可投射性审计以诊断基准到应用论证的衔接缺陷。

Comments 34 pages, 2 figures, 5 tables. v2 substantially revises Secs. 5-8 and the conclusion, adds a measured instance of factor-structure instability, and corrects a claim in Sec. 3.3 that endpoint alignment suffices for composition. Supersedes the withdrawn arXiv:2510.15236. Code: https://github.com/BrettRey/benchmark-inference-composition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 50%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 50%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 安全评测 :alignment(abstract)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08785 2026-08-11 eess.SY cs.SY 新提交 50%

Robust Fault Detection and Classification in Power Systems via Physics-Informed and Data-Driven Learning

基于物理信息与数据驱动学习的电力系统鲁棒故障检测与分类

Biswash Basnet, Varsha Sen

专题命中 安全评测 :safety(abstract)

AI总结 本文提出结合物理信息与数据驱动学习的智能框架,基于SMOTE平衡数据集训练PINN等模型,实现电力系统故障的鲁棒检测与分类,在噪声及训练数据占比波动下仍保持高准确率,可用于电网实时保护与广域监测控制。

Comments 19 pages, published journal article

Journal ref Journal of Electrical Engineering and Automation 7(3), 241-259 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 50%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08280 2026-08-11 quant-ph 新提交 50%

Machine Learning for Specialized QKD Aspects: A Survey of Adaptive Protocols, Free-Space Links, 6G Integration, and Steerability-Aware Security

面向量子密钥分发(QKD)特定场景的机器学习:自适应协议、自由空间链路、6G集成及可操纵性感知安全综述

Hasan Abbas Al-Mohammed, Afnan S. Al-Ali

专题命中 安全评测 :trustworthy(abstract)

AI总结 该综述聚焦自适应、非地面及应用集成QKD系统,梳理了ML、RL及QML在QKD多类特定场景的应用,分析了各主题的问题、方案与增益,并指出了相关开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14412 2026-08-11 eess.SY cs.SY 版本更新 50%

Assessing Risks of Hydro-Generator Shaft Fatigue from Data Center Load Oscillations

评估数据中心负载振荡对水轮发电机轴疲劳的风险

Kaustav Chatterjee, Meghana Ramesh, Shuchismita Biswas, Brett A. Ross, Antos C. Varghese, Sameer Nekkalapu, Slaven Kincic

专题命中 安全评测 :safety(abstract)

AI总结 研究大型AI数据中心负载振荡对水轮发电机轴疲劳的风险,基于双质量涡轮发电机轴表示法开发电磁暂态仿真模型,分两阶段评估风险。通过频率扫描等方法发现放大受惯性比和阻尼影响,古德曼安全系数可评估振荡对水轮发电机寿命的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 50%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 安全评测 :safety(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07846 2026-08-11 cs.CV 版本更新 50%

BRIDGE: Background Routing and Isolated Discrete Gating for Coarse-Mask Local Editing

BRIDGE:背景路由与孤立离散门控用于粗掩膜局部编辑

Peilin Xiong, Honghui Yuan, Junwen Chen, Keiji Yanai

机构 * Department of Informatics, The University of Electro-Communications(信息学系,电通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 BRIDGE通过背景路由和离散门控技术解决粗掩膜局部编辑中掩膜形状偏差问题,提升编辑区域与背景的稳定性与一致性。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 50%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06018 2026-08-11 cs.SE 50%

TARGET: Automated Scenario Generation from Traffic Rules for Testing Autonomous Vehicles via Validated LLM-Guided Knowledge Extraction

Yao Deng, Jiaohong Yao, Zhi Tu, Xi Zheng, Mengshi Zhang, Tianyi Zhang

专题命中 安全评测 :safety(abstract)

Journal ref IEEE Transactions on Software Engineering, Jul. 2025, pp. 1950-1968, vol. 51

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 12 篇

2608.05656 2026-08-11 cs.CY cs.AI cs.HC 版本更新 88%

Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics

研究人以研究AI:关于人类研究在AI安全与伦理中的认知适配性及障碍的专家观点

Jessica Y. Bo, Paula Akemi Aoyagui, Shalaleh Rismani, Dipto Das, Syed Ishtiaque Ahmed, Ashton Anderson

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究通过对93名AI安全与伦理领域专家的调查及17名专家的访谈,分析了人类研究在AI安全与伦理领域的认知适配性与障碍,并提出相关建议以避免流于形式的“人类洗白”。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15208 2026-08-11 cs.LG cs.AI 81%

Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels

量化消除了对齐:跨模型和精度水平的压缩LLM中的偏见涌现

Plawan Kumar Rath, Rahul Maliakkal

机构 * Meta

专题命中 AI治理与伦理 :alignment(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过压缩LLM的量化过程,发现3位量化导致6-21%的原本无偏项目出现新偏见,且标准质量指标无法检测到公平性关键的退化。

Comments 7 pages, 4 figures, 4 tables. Accepted at IEEE Cloud Summit 2026. This is the author's accepted version; the version of record will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22877 2026-08-11 cs.AI cs.HC cs.RO 版本更新 70%

Physical AI Governance: From Theory to Practice Across Life Cycle

物理人工智能治理:跨越生命周期从理论到实践

Wang Yang, Shaobo Wang, Hongxuan Liu, Xiaoran Cai, Yunyu He, Jingzong Zhou, Mengzhong Ma, Yi Yu, Rohit Sharma, Jingjing Fu, Peng Qi

机构 * Case Western Reserve University(凯斯西储大学) Shanghai Jiao Tong University(上海交通大学) Massachusetts Institute of Technology(麻省理工学院) Columbia University(哥伦比亚大学) University of California, Riverside(加州大学河滨分校) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Salesforce(Salesforce公司) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文对物理人工智能治理进行全面综述,综合现有原则形成统一框架,提出五阶段生命周期,通过具体实践展示各阶段治理操作,为构建安全可信且符合社会价值的物理人工智能系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07786 2026-08-11 cs.AI cs.LG 新提交 62%

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

谁构建了这个模型?通过权重空间中的光谱指纹追踪大语言模型(LLM)谱系

Yiwei Chen, Bingqi Shang, Sijia Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出几何指纹框架,通过权重空间的光谱能量和子空间对齐分析,实现对110余个开源权重LLM对的谱系区分,为模型溯源提供稳健可解释的信号。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16281 2026-08-11 cs.CY cs.AI 版本更新 62%

Post-Deployment Accountability in AI Governance: A Cross-Regulatory Empirical Analysis of AI Incidents

从被动到主动:对480起AI事件的多监管实证分析及数据驱动的治理合规框架

Ummara Mumtaz, Rabi Noor, Summaya Mumtaz

机构 * University of the Cumberlands, USA(卡姆伯兰大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析480起AI事件,揭示现有治理框架在部署后问责中的不足,并提出主动治理框架,旨在从被动响应转向部署前的合规保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07650 2026-08-11 cs.AI cs.CL 版本更新 62%

A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges

大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架

Chenchen Kuai, Jiwan Jiang, Zihao Zhu, Hao Wang, Keshu Wu, Zihao Li, Yunlong Zhang, Chenxi Liu, Zhengzhong Tu, Zhiwen Fan, Yang Zhou

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09857 2026-08-11 cs.RO cs.AI 新提交 57%

Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy

智能体 harness:面向机器人自主的大语言模型驱动验证层

Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai

机构 * Carnegie Mellon University(卡内基梅隆大学) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。

Comments 7 pages. Not yet finalized for conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交 57%

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08220 2026-08-11 cs.AI 新提交 57%

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德智能体的元规范理论

Aleks Knoks, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。

Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏