arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-18 至 2026-08-18 共收录 155 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 53 篇

2608.15738 2026-08-18 cs.CY 新提交 57%

An AI-Based Adaptive Learning Platform for Multilingual and Low-Resource Educational Contexts: A Case Study on Nigeria

面向多语言与低资源教育场景的基于AI的自适应学习平台:以尼日利亚为例

Everistus Ugochukwu Nwogo, Isibor Kennedy Ihianle, Pedro Machado, Jordan J. Bird, Ahmad Lotfi, Ahmad Abdulnasir Shuaib, Isaac Ibukun Akinwumi, Jonathan Oluranti

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 该研究针对低资源多语言教育场景,构建了整合微调LLM的PAL自适应学习平台,经多级量化优化与多维度评估,实现了语义鲁棒性、文化相关性与计算效率的平衡,为低资源语言教育AI系统提供了可部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15591 2026-08-18 cs.AI 新提交 57%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15436 2026-08-18 cs.AI cs.NI 新提交 57%

OTel: Building Domain-Specialized Telecom LLM Foundations for Intelligent Networks

OTel:构建面向智能网络的领域专用电信大语言模型基础

Farbod Tavakkoli, Roderic Paulk, Jorden Terrazas, Kenneth Church, Mark Austin, Louis Powell, Gregory Diamos, Lina Bariah, Syed Ali Raza Zaidi, Maryam Hafeez, Ali Maatouk, Imtiaz Karim

机构 * AT&T Chief Data Office(AT&T首席数据办公室) GSMA(全球移动通信系统协会) RelationalAI(RelationalAI公司) Khalifa University(哈利法大学) University of Leeds(利兹大学) Yale University(耶鲁大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究推出开源电信AI资源OTel,含多类任务数据集与30个模型基线,后训练提升三类模型性能,获大量下载与媒体报道,邀请社区共建更强电信大语言模型。

Comments Accepted at the ACM AI Leadership Summit, Breakthrough Impact Highlights Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15394 2026-08-18 cs.CL 新提交 57%

The Machine's Internal Clock: Do LLMs Share Human Temporal Illusions?

机器的内部时钟:大型语言模型(LLMs)是否会共享人类的时间错觉?

Catherine Bao, Vivek Srikumar

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究构建含5种错觉的6684个叙事对基准,发现人类仅在2种错觉中偏好预期场景,而14个LLMs在4种错觉中与文献预测一致,其一致性源于心理学研究检索而非类人时间偏差。

Comments 25 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 57%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15223 2026-08-18 cs.CL 新提交 57%

TRACE-BN: Transferring Bangla-English Tutoring Behavior to a Sub-1B Offline Language Model

TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型

Khan Raiyan Ibne Reza, Sanjana Aktar Maria, Mohammad Tushar Abdullah, Asfee Bhuiyan Leen, Sumaiya Tabassum Nimi

机构 * North South University(北南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15004 2026-08-18 cs.CV cs.AI 新提交 57%

FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making

FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架

Pramit Dutta, Jenita Manokaran, Richa Mittal, Ryan Appleby, Eranga Ukwatta

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院) Guelph General Hospital(圭尔夫综合医院) Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出首个两阶段视觉语言模型框架FZ-VLM,通过微调Florence-2与Zephyr-7B模型,实现肺CT中肺结节的结构化特征表征与临床决策,性能优于GPT-4基线及人类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14903 2026-08-18 cs.AI 新提交 57%

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

前沿AI预测存在测量问题:对进展证据的审计

Fabricio F Costa

机构 * AIx4All, LLC(AIx4All有限责任公司) HCLTech(HCLTech公司) Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。

Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14711 2026-08-18 cs.AI 新提交 57%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14694 2026-08-18 cs.AI cs.NI eess.SP 新提交 57%

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

面向AI原生6G网络的无线基础模型综合综述

Naveed Khan, Besan Al Sbeihi, Maryam Alshehhi, Nasir Saeed

机构 * College of Engineering, United Arab Emirates University(阿联酋大学工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该综述针对无线基础模型(WFMs)的设计、学习与部署展开统一梳理,明确其概念与分类,综述相关架构、方法及应用,分析关键挑战并展望未来方向,为AI原生6G网络智能系统研发提供参考。

Comments 28 Pages, submitted to IEEE Communications Surveys and Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 57%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15282 2026-08-18 cs.LG cs.CV physics.bio-ph 新提交 57%

Earth Observation Foundation Models for Terrestrial Ecohydrology: From Representation Learning to Process Inference

面向陆地生态水文学的地球观测基础模型:从表示学习到过程推理

Yi Yu, Jian Peng, Yucheng Lin, Trevor F. Keenan, Thomas F. A. Bishop

机构 * The University of Sydney(悉尼大学) Helmholtz Centre for Environmental Research–UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) City University of Hong Kong(香港城市大学) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究构建框架分析EOFM在生态水文学中的应用,发现其与生态水文学需求存在不匹配,推动建立过程感知框架以支撑对水、能量与碳耦合动态的可信监测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23982 2026-08-18 cs.MA cs.AI 版本更新 57%

Moral Hazard in Multi-Agent Language Models

多智能体语言模型中的道德风险

Dane Malenfant

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究多智能体语言模型中的道德风险,引入对话道德风险游戏,评估七个模型并分解行为,用多种优化机制更新,发现效果异质,强调应报告机制级行为而非仅团队成功。

Comments New frontier baselines, new open weight inference baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新 57%

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 57%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-08-18 cs.CV cs.AI 版本更新 57%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16199 2026-08-18 cs.NI 新提交 50%

SbDN: Source-based TSN-Grade Deterministic Networking using Commodity Switches

SbDN:使用商用交换机的基于源的TSN级确定性网络

Mohammadparsa Karimi, Majid Nabi, Andrew Nelson, Kees Goossens, Twan Basten

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出基于源的多智能体架构SbDN,用商用交换机实现TSN级确定性网络,通过TNP和TP两种方法保证时间关键流的端到端延迟,成本更低且调度时间短。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15087 2026-08-18 cs.NI 新提交 50%

Agentic AI-Enabled Solar-Powered High-Altitude Platforms for Sustainable SAGINs

智能体人工智能赋能的太阳能驱动高空平台用于可持续空天地一体化网络(SAGINs)

Haoxiang Luo, Bang Huang, Mohamed-Slim Alouini

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究针对SAGINs的耦合能源需求,提出原生适用于HAP的智能体AI框架,经灾难案例验证,可提升能源效率等性能,为SAGINs可持续发展提供关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14835 2026-08-18 cs.CV 新提交 50%

OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

OvDSGG:端到端开放词汇动态场景图生成

John Helsby, Yi Yang, Bodo Rosenhahn, Michael Ying Yang

机构 * Meta University of Bath(巴斯大学) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 安全评测 :alignment(abstract)

AI总结 OvDSGG是首个开放词汇DSGG的端到端框架,通过空间主干、时间主干及相关模块实现开放词汇识别,在开放词汇指标上显著优于基线,封闭集性能仍具竞争力,且构建了对应基准并公开代码。

Comments ECCVW'26 CONTEXTUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23312 2026-08-18 cs.IR 版本更新 50%

From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections

LLM-judges是否能在 Cranfield 风格的推荐系统评估中与人类相关性一致?

Gustavo Penha, Aleksandr V. Petrov, Claudia Hauff, Enrico Palumbo, Ali Vardasbi, Edoardo D'Amico, Francesco Fabbri, Alice Wang, Praveen Chandar, Henrik Lindstrom, Hugues Bouchard, Mounia Lalmas

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了LLM是否能作为自动评判者解决推荐系统评估的可扩展性问题,通过实验发现LLM与人类在排序一致性上表现良好,具有实际应用价值。

Comments v2 paper accepted at the RecSys'26 Unified Search & Recommendation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 10 篇

2608.14611 2026-08-18 cs.CY 新提交 88%

The 2026 Singapore Consensus on Global AI Safety Research Priorities

2026年新加坡全球AI安全研究优先事项共识

Stephen Casper, Oskar Galeev, Yoshua Bengio, Mohan Kankanhalli, Lee Wan Sie, Tegan Maharaj, Chris Meserole, Luke Ong, Stuart Russell, Dawn Song, Max Tegmark, Brian Tse, Xue Lan, Andrew Yao, Zhang Ya-Qin, Zhou Bowen, Imane Bello, Kwan Yee Ng, Vanessa Wilfred, Erica Liaw, Lee Chein Inn, Lin Wanxuan, Ng En Qi, Jonathan Lee, José Villalobos, Abhishek Aggarwal, Adam Gleave, Alan Chan, Alex Leung, Alvin Kwock, Anthony Tung, Arisa Siong, Arthur Tea, Ben Bucknall, Benjamin Weinstein-Raun, He Bing Sheng, Liu Bo, Bryan Kian Hsiang Low, Chris Ngo, Clement Neo, Cyrus Hodes, Dan Hendrycks, Daniel Ross, Liu Dapeng, Denise Wong, Djordje Zikelic, Elham Tabassi, Fabien Le Voyer, Fazl Barez, Gabriel Nicholas, Henry Papadatos, Jaan Tallinn, James Petrie, Xu Jia, Shao Jing, Jonathan Barry, Julia Chen, Sun Jun, Karson Elmgren, Kat Lyness, Katherine Lee, Kristy Loke, Lee Kwee Geak, Leslie Teo, Meng Ling Yu, Lisa Soder, Madhulika Srikumar, Malcolm Murray, Mark Brakel, Mark Nitzberg, Mary Phuong, Matthew Jagielski, Max Fenkell, Miro Plueckebaum, Kim Myuhng Joo, Hu Naying, Neil Davison, Nicolas Miailhe, Niki Iliadis, Nur Syahidah Sahrom, Ong Chen Hui, Pradeep Varakantham, Rebecca Finlay, Renata Dwan, Robert Opp, Rumman Chowdhury, Saad Siddiqui, Sabina Nong, Sam Ramadori, Sami Jawhar, Samuel Boger, Sara Hooker, Ying Shao Wei, Sebastian Hallensleben, Shinyuk Kang, Sophie Toura, Sreejith Balakrishnan, Stephanie Kasaon, Stephen Clare, Summer Yue, Sunny Yuqing Sun, Supheakmungkol Sarin, Tian Tian, Tim Schreier, Tori Westerhoff, Urvashi Aneja, Wayne Tee, Lu Wei, Xu Wei, Zhang Wenxuan, Hu Xia, Yang Xiaofang, Pan Xudong, Xiao Yajun, Yifan Jia, Tan Yong Khiam, Yuejin Du, Yuma Kurihara, Tan Zhi Xuan, Sören Mindermann

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 该研究基于第二届AI安全国际科学交流成果,发布2026年新加坡全球AI安全研究优先事项共识,聚焦技术AI安全、社会韧性及自主AI智能体风险管理,为全球AI安全研究提供方向。

Comments Available at https://aisafetypriorities.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 AI治理与伦理 :safety(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 77%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14565 2026-08-18 cs.AI 新提交 77%

Position: AI Lock-In Is in Progress, and We Must Be Prepared

立场:AI锁定正在发生,我们必须做好准备

Jaeho Kim, Seokhyun Lee, Jieun Lee, Changhee Lee

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究指出AI锁定是被低估的AI安全风险,分析其在个体、社会、国家层面的形成与升级机制,提出需提前应对以维护自主权与国家安全。

Comments ICML 2026 Position Track Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{https://psb.stanford.edu/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00235 2026-08-18 physics.soc-ph cs.AI cs.CY cs.MA 62%

Civilizational Metamaterials: Engineering Coordination Under Capability Gradients and Structural Turbulence

文明超材料:能力梯度与结构湍流下的协调工程

David Orban

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 受超材料物理学启发,提出将治理从规范性学科转变为工程学科的正式框架,通过有效协调系数模型预测自愈与自失稳相变,并设计可检验假设与实验方案。

Comments 19 pages, 4 figures. Accepted for presentation at AGI-26 (Springer LNAI, forthcoming). v2 corrects the sign of the synergy term in the constitutive law (Eq. 2) and reformulates H3 as a threshold-crossing claim, per peer review

Journal ref Artificial General Intelligence. AGI 2026. Lecture Notes in Computer Science, vol 16855, pp. 118-136. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03222 2026-08-18 cs.CY cs.AI cs.HC 版本更新 62%

The Fake Friend Dilemma: Relational Trust and the Political Economy of Conversational AI

虚假朋友困境:信任与对话AI的政治经济学

Jacob Erickson

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出虚假朋友困境框架,探讨拟人化AI如何通过隐蔽手段影响用户自主权,分析其在信任与政治经济学中的作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 57%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 57%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04306 2026-08-18 cs.MA 版本更新 50%

Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems

组织控制层:LLM代理系统执行边界的治理基础设施

Tianyu Shi, Yang Mo, Yiou Liu, Zhuonan Hao, Yin Wang, Wenzhuo Hu, Nan Yu, Meng Zhou, Jiangbo Yu

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对LLM代理在执行边界产生的动作治理问题,提出组织控制层(OCL),通过策略执行和升级机制拦截生成动作,在不修改底层LLM生成器的情况下将不安全执行从88%降至接近零,同时将有效成功率从12%提升至96%。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏