arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-02 至 2026-03-02 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2509.24159 2026-03-02 cs.AI 85%

RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment

RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架

Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu

机构 * IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院) EE, Tsinghua University(电子工程系,清华大学) Li Auto Inc.(力汽车公司) SIGS, Tsinghua University(系统工程系,清华大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

AI总结 RE-PO是一种用于大语言模型对齐的鲁棒增强策略优化通用框架,通过期望最大化程序推断标签正确性并自适应加权数据点以减轻噪声,提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23371 2026-03-02 cs.CL cs.AI cs.LG 82%

Alignment through Meta-Weighted Online Sampling: Bridging the Gap between Data Generation and Preference Optimization

通过元权重在线采样对齐:弥合数据生成与偏好优化之间的差距

Junming Yang, Ning Xu, Biao Liu, Shiqi Qiao, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MetaAPO通过动态结合数据生成与模型训练,有效解决偏好优化中的分布不匹配问题,提升对齐效果并降低标注成本。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22745 2026-03-02 cs.CV 67%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15477 2026-03-02 cs.LG cs.AI cs.CL stat.ML 67%

What Makes a Reward Model a Good Teacher? An Optimization Perspective

什么使奖励模型成为好的老师?从优化角度出发

Noam Razin, Zixuan Wang, Hubert Strauss, Stanley Wei, Jason D. Lee, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 从优化角度研究奖励模型的有效性,发现奖励方差对优化效率至关重要,准确性不足以保证模型效果。

Comments Accepted to NeurIPS 2025; Code available at https://github.com/princeton-pli/what-makes-good-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24082 2026-03-02 cs.CL cs.AI 62%

Preference Packing: Efficient Preference Optimization for Large Language Models

偏好打包:大型语言模型高效偏好优化

Jaekyung Cho

机构 * AWS GenAI Innovation Center(AWS生成人工智能创新中心)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 偏好打包通过减少重复输入提示的注意力操作和KV缓存内存使用,提升大型语言模型的训练效率,实验显示训练时间减少37%并实现3.22倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-03-02 cs.CL 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23391 2026-03-02 cs.LG 57%

Detoxifying LLMs via Representation Erasure-Based Preference Optimization

通过基于表示擦除的偏好优化来净化大语言模型

Nazanin Mohammadi Sepahvand, Eleni Triantafillou, Hugo Larochelle, Doina Precup, Daniel M. Roy, Gintare Karolina Dziugaite

机构 * McGill University(麦吉尔大学) Mila Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出REPO方法,通过基于表示擦除的偏好优化,有效净化大语言模型,提升其对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2402.07462 2026-03-02 cs.AI cs.CY cs.LG cs.MA econ.TH 67%

A Hormetic Approach to the Value-Loading Problem: Preventing the Paperclip Apocalypse?

一种针对价值加载问题的激素方法:防止纸夹 apocalypse?

Nathan I. N. Henry, Mangor Pedersen, Matt Williams, Jamin L. B. Martin, Liesje Donkin

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 HALO通过激素分析方法解决价值加载问题,通过调节AI行为模式防止潜在的AI失控风险。

Comments 24 pages, 7 figures

Journal ref SN COMPUT. SCI. 6, 872 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23719 2026-03-02 cs.RO cs.AI 57%

SAGE-LLM: Towards Safe and Generalizable LLM Controller with Fuzzy-CBF Verification and Graph-Structured Knowledge Retrieval for UAV Decision

SAGE-LLM:面向安全且可泛化的LLM控制器,结合模糊-CBF验证和图结构知识检索用于无人机决策

Wenzhe Zhao, Yang Zhao, Ganchao Liu, Zhiyu Jiang, Dandan Ma, Zihao Li, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi’an 710072, China(人工智能学院、光学与电子学(iOPEN)、西北工业大学,西安 710072,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究所(TeleAI)、中国电信,中国)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 SAGE-LLM通过模糊-CBF验证和图结构知识检索,提升无人机决策的安全性和泛化能力,无需在线训练即可在复杂环境中保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 57%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23896 2026-03-02 cs.RO 50%

TSC: Topology-Conditioned Stackelberg Coordination for Multi-Agent Reinforcement Learning in Interactive Driving

TSC:基于拓扑条件的Stackelberg协调用于交互驾驶中的多智能体强化学习

Xiaotong Zhang, Gang Xiong, Yuanjing Wang, Siyu Teng, Alois Knoll, Long Chen

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Natural Sciences, University of Durham(达勒姆大学自然科学系) College of Civil and Transportation Engineering, Shenzhen University(深圳大学土木与交通工程学院) Chair of Robotics, Artificial Intelligence and Realtime Systems, Technical University of Munich(慕尼黑技术大学机器人、人工智能与实时系统教授职位)

专题命中 安全训练 :safety(abstract)

AI总结 TSC通过拓扑条件的Stackelberg协调方法,在无通信执行下实现密集交通中的去中心化多智能体强化学习,提升训练稳定性和安全性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2602.22291 2026-03-02 cs.LG cs.AI cs.CR 79%

Manifold of Failure: Behavioral Attraction Basins in Language Models

失败的流形:语言模型中的行为吸引盆地

Sarthak Munshi, Manish Bhatt, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Blake Gatto

机构 * Amazon Web Services(亚马逊网络服务) Cisco(思科) Shrewd Security(精明安全)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于MAP-Elites的方法,用于系统地映射语言模型的失败流形,揭示不同模型的拓扑结构和漏洞分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23397 2026-03-02 cs.CR cs.SY eess.SY 50%

Lifecycle-Integrated Security for AI-Cloud Convergence in Cyber-Physical Infrastructure

面向AI-云融合的生命周期集成安全机制:用于网络物理基础设施

S M Zia Ur Rashid, Deepa Gurung, Sonam Raj Gupta, Suman Rath

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出了一种生命周期集成的安全架构,通过综合AI治理、云安全和工业标准,实现对AI-云融合环境中多层攻击的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 5 篇

2602.24027 2026-03-02 cs.CV cs.MM 86%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(title)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24191 2026-03-02 cs.GT cs.AI cs.LO 57%

Resilient Strategies for Stochastic Systems: How Much Does It Take to Break a Winning Strategy?

随机系统中的稳健策略:打破获胜策略需要多大的代价?

Kush Grover, Markel Zubia, Debraj Chakraborty, Muqsit Azeem, Nils Jansen, Jan Kretinsky

机构 * Ruhr University Bochum Germany Nanyang Technological University, Singapore Technical University of Munich \& University of Konstanz Germany Ruhr University Bochum \& Radboud University Nijmegen Germany Masaryk University Czech Republic Ruhr University Bochum Technical University of Munich \& University of Konstanz Ruhr University Bochum \& Radboud University Nijmegen Masaryk University

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文研究了随机系统中稳健策略的定义与问题,探讨了马尔可夫决策过程和随机游戏中的可达性和安全目标,提出了一种基于干扰频率的稳健性度量方法。

Comments To appear in Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08448 2026-03-02 cs.LG 57%

Exploring Cross-model Neuronal Correlations in the Context of Predicting Model Performance and Generalizability

探索预测模型性能和泛化能力的跨模型神经元相关性

Haniyeh Ehsani Oskouie, Sajjad Ghiasvand, Lionel Levine, Majid Sarrafzadeh

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出通过跨模型神经元相关性评估模型性能和泛化能力,验证了表示对齐作为轻量级兼容性检查的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 50%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23109 2026-03-02 cs.RO 50%

Towards Intelligible Human-Robot Interaction: An Active Inference Approach to Occluded Pedestrian Scenarios

迈向可解释的人机交互:一种主动推断方法用于遮挡行人场景

Kai Chen, Yuyao Huang, Guang Chen

机构 * Tongji University(同济大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出基于主动推断的方法,用于解决遮挡行人场景中的安全挑战,通过结合 RBPF 和 CEM 增强的 MPPI 控制器,实现可解释的人机交互。

Comments 14 pages, 6 figures, Proceedings of the 2026 ACM/IEEE International Conference on Human-Robot Interaction (HRI'26)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 9 篇

2602.23753 2026-03-02 cs.CL 79%

Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space

通过潜在空间语义对齐的结构化提示优化实现少样本文本分类

Jiasen Zheng, Zijun Zhou, Huajun Zhang, Junjiang Lin, Jingyun Jia, Qi Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过潜在空间语义对齐的结构化提示优化方法,解决少样本文本分类中的语义冲突和标签模糊问题,提升分类性能和跨任务适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14135 2026-03-02 cs.AI cs.CR cs.CY 79%

ForesightSafety Bench: A Frontier Risk Evaluation and Governance Framework towards Safe AI

ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架

Haibo Tong, Feifei Zhao, Linghao Feng, Ruoyu Wu, Ruolin Chen, Lu Jia, Zhou Zhao, Jindong Li, Tenglong Li, Erliang Lin, Shuai Yang, Enmeng Lu, Yinqian Sun, Qian Zhang, Zizhe Ruan, Jinyu Fan, Zeyang Yue, Ping Wu, Huangrui Li, Chengyi Sun, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 78%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07319 2026-03-02 cs.CL cs.AI 62%

Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice

超越准确性:对幻觉医疗建议的风险敏感评估

Savan Doshi

机构 * ASU(亚利桑那州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种风险敏感的评估框架,用于评估医疗建议中的幻觉风险,通过量化风险性语言来识别高风险、低支撑的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21283 2026-03-02 cs.LG cs.AI 62%

DUET: Distilled LLM Unlearning from an Efficiently Contextualized Teacher

DUET:基于高效上下文化教师的蒸馏式大语言模型去学习

Yisheng Zhong, Zhengbang Yang, Zhuangdi Zhu

机构 * George Mason University(乔治·玛森大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 DUET通过结合上下文化和蒸馏方法,实现高效大语言模型去学习,提升遗忘控制与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23761 2026-03-02 cs.LG cs.CV 57%

OPTIAGENT: A Physics-Driven Agentic Framework for Automated Optical Design

OPTIAGENT:一种基于物理的代理框架用于自动光学设计

Yuyu Geng, Lei Sun, Yao Gao, Xinxin Hu, Zhonghua Yi, Xiaolong Qian, Weijian Hu, Jian Bai, Kaiwei Wang

机构 * Zhejiang University(浙江大学) INSAIT, Sofia University(INSAIT,索菲亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05179 2026-03-02 cs.LG 57%

DRL-ORA: Distributional Reinforcement Learning with Online Risk Adaption

DRL-ORA: 带在线风险适应的分布式强化学习

Yupeng Wu, Wenyun Li, Wenjie Huang, Chin Pang Ho

机构 * London Business School(伦敦商学院) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 DRL-ORA通过动态调整风险水平,在安全关键任务中提升强化学习的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 50%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18825 2026-03-02 cs.CV 50%

Q-Save: Towards Scoring and Attribution for Generated Video Evaluation

Q-Save:迈向生成视频评估的评分与归因

Xiele Wu, Zicheng Zhang, Mingtao Chen, Yixian Liu, Yiming Liu, Shushi Wang, Zhichao Hu, Yuhong Liu, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. AI治理与伦理 4 篇

2507.10619 2026-03-02 cs.LG cs.AI cs.NI 62%

Meta-Reinforcement Learning for Fast and Data-Efficient Spectrum Allocation in Dynamic Wireless Networks

元强化学习用于动态无线网络中快速且数据高效的频谱分配

Oluwaseyi Giwa, Tobi Awodunmila, Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Ali Jamshed

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出元学习框架用于动态无线网络中快速且数据高效的频谱分配,通过对比实验展示其在性能和适应性上的优势。

Comments 5 pages, 6 figures, under review at IEEE Wireless Communications Letters

Journal ref IEEE Wireless Communications Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23378 2026-03-02 cs.HC cs.AI cs.CY 62%

Now You See Me: Designing Responsible AI Dashboards for Early-Stage Health Innovation

现在你看到了:为早期健康创新设计负责任的AI仪表盘

Svitlana Surodina, Sinem Görücü, Lili Golmohammadi, Emelia Delaney, Rita Borgo

机构 * OPORA Health Technologies LTD(OPORA健康科技有限公司) King's College London(国王学院伦敦)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种面向早期健康创新的负责任AI治理仪表板设计方法,通过协作设计和治理机制支持决策和问责。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23720 2026-03-02 cs.AI 57%

The Auton Agentic AI Framework

自主AI框架

Sheng Cao, Zhao Chang, Chang Li, Hannan Li, Liyao Fu, Ji Tang

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 Auton框架通过分离认知蓝图与运行时引擎,实现自主代理系统的标准化创建、执行和治理,采用增强POMDP模型和三级自我进化框架提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏