arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1824 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 1824 篇

2604.14898 2026-04-17 cs.AI cs.CY cs.HC 62%

Governing Reflective Human-AI Collaboration: A Framework for Epistemic Scaffolding and Traceable Reasoning

引导反思的人工智能协作:一种知识支架和可追溯推理的框架

Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee

机构 * Faculty of Medicine, Lund University(Lund大学医学院) Department of Economics, Lund University School of Economics and Management(Lund大学经济学与管理学院经济系) Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种人机协作的推理框架,通过知识支架和可追溯推理提升AI透明度与可控性,不依赖新模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13705 2026-04-16 cs.CL cs.AI cs.GT cs.MA 62%

Beyond Arrow's Impossibility: Fairness as an Emergent Property of Multi-Agent Collaboration

超越阿罗不可能定理:公平性作为多智能体协作的涌现属性

Sayan Kumar Chaki, Antoine Gourru, Julien Velcin

机构 * Department of Computer Science(计算机科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨多智能体协作中公平性的涌现特性,通过医院急诊框架实验发现,智能体间的互动能产生比单一模型更公平的分配结果,揭示了公平性作为系统属性而非个体属性的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10590 2026-04-14 cs.CL cs.AI 62%

Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance

弥合语言鸿沟:预训练和数据集中的跨语言映射以提升多语言大语言模型性能

Weihua Zheng, Chang Liu, Zhengyuan Liu, Xin Huang, Kui Wu, Muhammad Huzaifah Md Shahrin, Aiti Aw, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research(新加坡科技研究局)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出在预训练阶段引入跨语言映射任务,提升多语言对齐能力,通过语言对齐系数量化一致性,实验显示在机器翻译、跨语言自然语言理解及问答任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06219 2026-04-09 cs.CY cs.AI 62%

From experimentation to engagement: on the paradox of participatory AI and power in contexts of forced displacement and humanitarian crises

从实验到参与:关于参与式AI与权力在流离失所和人道主义危机中的悖论

Stella Suge, Sarah W. Spencer, Nyalleng Moorosi, Helen McElhinney, Geoff Loane, Sue Black

机构 * FilmAid Kenya(肯尼亚电影援助组织) The Distributed AI Research Institute (DAIR)(分布式人工智能研究所) The CDAC Network(CDAC网络) Durham University(杜伦大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨参与式AI在流离失所和人道主义危机中的局限性,指出其可能加剧'参与洗白'和算法伤害,强调需更严谨的方法和独立治理架构。

Comments This paper was submitted to the ACM FAccT conference in 2025 and is published here as a preprint in March 2026. The research was conducted in December 2024. Since submission, AI deployment across the humanitarian sector has accelerated without commensurate development of independent accountability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06203 2026-04-09 cs.CY cs.AI 62%

Front-End Ethics for Sensor-Fused Health Conversational Agents: An Ethical Design Space for Biometrics

传感器融合健康对话代理的前端伦理:生物特征的伦理设计空间

Hansoo Lee, Rafael A. Calvo

机构 * Imperial College London(伦敦帝国理工学院) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了生物特征翻译的伦理设计,提出五个维度分析前端伦理风险,提出适应性披露作为安全机制,确保健康代理支持用户自主性。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05826 2026-04-08 cs.AI cs.CY 62%

Reciprocal Trust and Distrust in Artificial Intelligence Systems: The Hard Problem of Regulation

人工智能系统中的互惠信任与不信任:监管的难题

Martino Maggetti

机构 * Institute of Political Studies (IEP), University of Lausanne(洛桑大学政治研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨人工智能系统信任与不信任的互惠动态,提出应将AI视为可行使代理的工具,分析其对监管的影响及未来监管面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23406 2026-04-03 cs.AI cs.CL cs.HC 62%

Beyond Preset Identities: How Agents Form Stances and Boundaries in Generative Societies

超越预设身份:生成社会中代理如何形成立场和边界

Hanzhong Zhang, Siyang Song, Jindong Wang

机构 * University of Exeter(埃克塞特大学) William & Mary(威廉与玛丽学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过混合方法框架研究生成社会中代理的立场形成与边界构建,提出三个新指标揭示代理在复杂干预中的动态变化及信任与行为关系。

Comments 22 pages, 3 figures. arXiv admin note: substantial text overlap with arXiv:2508.17366

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 62%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28589 2026-03-31 cs.AI cs.LG 62%

Towards a Medical AI Scientist

迈向医疗AI科学家

Hongtao Wu, Boyun Zheng, Dingjie Song, Yu Jiang, Jianfeng Gao, Lei Xing, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Lehigh University(里海大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出医疗AI科学家框架,通过临床工程师协同推理机制生成可落地的医学研究想法,并基于结构化医学规范和伦理政策撰写论文,验证其在171案例、19临床任务和6种数据模态中的高质量表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12433 2026-03-31 cs.CL cs.AI 62%

Exploring Cultural Variations in Moral Judgments with Large Language Models

探索大语言模型在道德判断中的文化差异

Hadi Mohammadi, Ayoub Bagheri

机构 * Utrecht University(乌得勒支大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在捕捉文化多样性道德价值观方面的能力,通过对比不同模型与全球态度调查数据的关联性,发现指令微调模型在跨文化道德规范上表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 62%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20235 2026-03-24 cs.CY cs.AI cs.HC 62%

Writing literature reviews with AI: principles, hurdles and some lessons learned

用AI撰写文献综述:原则、障碍与一些经验教训

Saadi Lahlou, Annabelle Gouttebroze, Atrina Oraee, Julian Madera

机构 * London School of Economics and Political Science(伦敦政治经济学院) Paris Institute for Advanced Study(巴黎高级研究学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过比较不同AI辅助程度下的文献综述,揭示了AI生成内容的偏见、主流化倾向及局限性,强调了在使用AI撰写综述时需注意的防范措施。

Comments 31 pages and 193 pages of Appendices, including 6 different versions of the literature review, and complete chat with the LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20214 2026-03-24 cs.CY cs.AI cs.HC 62%

Beyond Detection: Governing GenAI in Academic Peer Review as a Sociotechnical Challenge

超越检测:将生成式人工智能在学术同行评审中的治理视为一个社会技术挑战

Tatiana Chakravorti, Pranav Narayanan Venkit, Sourojit Ghosh, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Salesforce AI Research(Salesforce AI研究) University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文通过混合方法研究,探讨生成式人工智能在学术同行评审中的社会技术风险,发现核心评估应由人类承担,同时提出保留问责机制的治理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20057 2026-03-23 cs.CL cs.AI 62%

Responsible AI Technical Report

负责任的人工智能技术报告

KT, :, Yunjin Park, Jungwon Yoon, Junhyung Moon, Myunggyo Oh, Wonhyuk Lee, Sujin Kim, Youngchol Kim, Eunmi Kim, Hyoungjun Park, Eunyoung Shin, Wonyoung Lee, Somin Lee, Minwook Ju, Minsung Noh, Dongyoung Jeong, Jeongyeop Kim, Wanjin Park, Soonmin Bae

机构 * Responsible AI Center(负责任AI中心) Tech. Innovation Group(技术创新组)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种负责任的人工智能评估方法和风险缓解技术,用于确保AI服务的安全性和可靠性,并提供实用工具来管理和缓解AI风险。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 62%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16746 2026-03-20 cs.CY cs.AI 62%

Beyond Partisan Leaning: A Comparative Analysis of Political Bias in Large Language Models

超越党派倾向:对大型语言模型中政治偏见的比较分析

Tai-Quan Peng, Kaiqi Yang, Sanguk Lee, Hang Li, Yucheng Chu, Yuping Lin, Hui Liu

机构 * Michigan State University(密歇根州立大学) Texas Christian University(德克萨斯基督教大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。

Journal ref Journal of Information Technology & Politics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16938 2026-03-19 cs.CR cs.AI cs.CY 62%

Cryptographic Runtime Governance for Autonomous AI Systems: The Aegis Architecture for Verifiable Policy Enforcement

面向自主AI系统的加密运行时治理:Aegis架构用于可验证的政策执行

Adam Massimo Mazzocchetti

机构 * SPQR Technologies Inc.(SPQR技术公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Aegis架构,通过加密技术将政策约束作为执行条件,实现自主AI系统的可验证政策执行,通过实验验证其在运行时治理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16926 2026-03-18 cs.CY cs.AI cs.HC 62%

Nishpaksh: TEC Standard-Compliant Framework for Fairness Auditing and Certification of AI Models

Nishpaksh:符合TEC标准的AI模型公平性审计与认证框架

Shashank Prakash, Ranjitha Prasad, Avinash Agarwal

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出Nishpaksh,一个符合TEC标准的AI模型公平性审计与认证工具,通过整合风险量化、上下文阈值确定和定量公平性评估,提供可复现的审计级评估,验证了其在COMPAS数据集上识别属性偏见和生成标准化公平评分的能力。

Comments Accepted and presented at 2026 18th International Conference on COMmunication Systems and NETworks (COMSNETS)

Journal ref 2026 18th International Conference on COMmunication Systems and NETworks (COMSNETS), Bengaluru, India, 2026, pp. 877-882

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14625 2026-03-17 cs.MA cs.AI cs.LG cs.SY eess.SY 62%

EcoFair-CH-MARL: Scalable Constrained Hierarchical Multi-Agent RL with Real-Time Emission Budgets and Fairness Guarantees

EcoFair-CH-MARL:具有实时排放预算和公平性保证的可扩展约束层次多智能体强化学习

Saad Alqithami

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EcoFair-CH-MARL框架,通过引入双重预算层、公平性奖励转换器和两级策略架构,实现高效、可持续且公平的海运物流解决方案,实验显示其在排放、吞吐量和公平性方面优于现有方法。

Comments Conference: The 28th European Conference on Artificial Intelligence (ECAI)

Journal ref Frontiers in Artificial Intelligence and Applications, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16624 2026-03-16 cs.CY cs.AI 62%

The GPT-4o Shock Emotional Attachment to AI Models and Its Impact on Regulatory Acceptance: A Cross-Cultural Analysis of the Immediate Transition from GPT-4o to GPT-5

GPT-4o震惊的对AI模型的情感依附及其对监管接受度的影响:对从GPT-4o到GPT-5即时过渡的跨文化分析

Hiroki Naito

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了GPT-4o到GPT-5的即时过渡引发的情感依附与监管接受度的跨文化影响,发现日文内容更侧重于损失叙事,英文内容包含更多愤怒与批判,且日文内容的情感依附显著更高。

Comments 9 pages ,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03998 2026-03-13 cs.HC cs.AI cs.CY 62%

TRACE: AI-Assisted Assessment of Collaborative Projects in Computer Science Education

TRACE:计算机科学教育中协作项目的AI辅助评估

Songmei Yu, Andrew Zagula

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 TRACE通过AI辅助分析提升计算机科学教育中协作项目评估的透明度和可扩展性。

Comments 7 pages, 3 figures. Accepted at EISTA 2025; published in the Journal of Systemics, Cybernetics and Informatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10351 2026-03-12 cs.CL cs.AI 62%

Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneck

通过解耦信息瓶颈缓解多语言大语言模型作为评判者的翻译偏差

Hongbin Zhang, Kehai Chen, Xuefen Bai, Youcheng Pan, Yang Xiang, Jinpeng Wang, Min Zhang

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DIBJudge框架,通过解耦信息瓶颈缓解多语言LLM的翻译偏差问题,有效提升多语言评估的公平性和准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07546 2026-03-10 cs.AI cs.LG 62%

COOL-MC: Verifying and Explaining RL Policies for Multi-bridge Network Maintenance

COOL-MC:多桥网络维护的强化学习策略验证与解释

Dennis Gross

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 COOL-MC通过概率模型检查和可解释性方法,验证并解释多桥网络维护的强化学习策略,揭示策略的安全性和偏见问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15904 2026-03-10 cs.CL cs.AI 62%

More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models

更多女性,相同刻板印象:解构大型语言模型中的性别偏见悖论

Evan Chen, Run-Jun Zhan, Yan-Bai Lin, Hung-Hsuan Chen

机构 * Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过自由叙事揭示大型语言模型中的性别偏见,发现其在职业性别分布上更接近人类刻板印象,而非现实数据,强调了平衡缓解措施的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 62%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03515 2026-03-05 cs.CY cs.AI 62%

The Controllability Trap: A Governance Framework for Military AI Agents

可控性陷阱:军事AI代理的治理框架

Subramanyam Sahoo

机构 * MARS (Mentorship for Alignment Researchers) 4.0 Fellow(MARS(对齐研究导师计划)4.0 Fellow) Cambridge AI Safety Hub (CAISH) University of Cambridge(剑桥AI安全中心(CAISH)剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AMAGF框架,通过预防、检测和纠正三个支柱,解决军事AI代理中的控制失效问题,通过控制质量评分实现持续控制管理。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild. 20 Pages and 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03341 2026-03-05 cs.CY cs.AI 62%

Ethical and Explainable AI in Reusable MLOps Pipelines

可重用MLOps流水线中的伦理与可解释性AI

Rakib Hossain, Mahmood Menon Khan, Lisan Al Amin, Dhruv Parikh, Farhana Afroz, Bestoun S. Ahmed

机构 * Washington University of Science and Technology(科学与技术华盛顿大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Karlstad University(卡尔斯塔德大学) American University of Bahrain(巴林美国大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一种整合伦理和可解释性AI的MLOps框架,通过自动化公平性控制和可解释性特征,在生产环境中实现公平性与预测效用的平衡。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01385 2026-03-03 cs.CL cs.AI 62%

Toward Graph-Tokenizing Large Language Models with Reconstructive Graph Instruction Tuning

迈向通过重构图指令微调的大型语言模型的图-词化

Zhongjian Zhang, Xiao Wang, Mengmei Zhang, Jiarui Tan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北航)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RGLM方法,通过重构图信息和显式图监督改进图-词化LLMs的对齐效果,提升对图结构的理解与利用。

Comments accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00428 2026-03-03 cs.CL cs.AI cs.CR 62%

When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems

当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应

Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks(帕洛阿尔托网络公司) OPPO Research Institute(OPPO研究院) Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于大语言模型的多智能体系统中的曼德拉效应,提出MANBENCH基准并提出缓解策略,实现74.40%的效应减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏