arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2502.17721 2026-03-09 cs.LG cs.AI cs.MA 84%

Aligning Compound AI Systems via System-level DPO

通过系统级DPO对复合AI系统进行对齐

Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Mila Quebec AI Institute(魁北克AI研究院)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05739 2026-03-09 cs.LG cs.AI 81%

Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment

重新审视最佳-N在推理时间对齐中的(次)最优性

Ved Sriraman, Adam Block

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视了最佳-N在推理时间对齐中的次优性,证明在特定条件下BoN在胜率上最优,并提出消除奖励黑客攻击的改进方法。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24142 2026-03-09 cs.CL cs.AI 62%

CoME: Empowering Channel-of-Mobile-Experts with Informative Hybrid-Capabilities Reasoning

CoME:赋能移动专家的 informative hybrid-capabilities 推理

Yuxuan Liu, Weikai Xu, Kun Huang, Changyu Chen, Jiankun Zhao, Pengzhi Gao, Wei Liu, Jian Luan, Shuo Shang, Bo Du, Ji-Rong Wen, Rui Yan

机构 * ruc(中国人民大学人工智能学院) xiaomi(小米公司) ntu(南洋理工大学) whu(武汉大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 CoME 通过四种专家架构和渐进训练策略,实现移动代理混合能力推理的解耦增强与平衡优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06424 2026-03-09 cs.CL 57%

From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring

从提示到偏好优化:基于LLM的自动作文评分方法比较研究

Minh Hoang Nguyen, Vu Hoang Pham, Xuan Thanh Huynh, Phuc Hong Mai, Vinh The Nguyen, Quang Nhut Huynh, Huy Tien Nguyen, Tung Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文比较了基于LLM的自动作文评分方法,发现结合k-SFT和RAG的配置在F1分数上表现最佳,为英语作为第二语言的自动评分提供了新的研究方向。

Comments 19 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06243 2026-03-09 cs.IR 50%

MLLMRec-R1: Incentivizing Reasoning Capability in Large Language Models for Multimodal Sequential Recommendation

MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力

Yu Wang, Yonghui Yang, Le Wu, Jiancan Wu, Hefei Xu, Hui Lin

专题命中 偏好对齐 :alignment(abstract)

AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。

Comments 14 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2603.05517 2026-03-09 cs.LG cs.AI cs.CR cs.SE 62%

Traversal-as-Policy: Log-Distilled Gated Behavior Trees as Externalized, Verifiable Policies for Safe, Robust, and Efficient Agents

路径作为策略:基于日志提炼的门控行为树作为可验证的外部化策略,用于安全、鲁棒且高效的智能体

Peiran Li, Jiashuo Sun, Fangzhou Lin, Shuo Xing, Tianfu Fu, Suofei Feng, Chaoqun Ni, Zhengzhong Tu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过日志提炼生成门控行为树作为外部化策略,提升智能体在安全、鲁棒性和效率方面的表现。

Comments 30 pages, 1 figurres, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-03-09 cs.CY 57%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

Comments Forthcoming, SMU Science and Technology Law Review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2509.11629 2026-03-09 cs.LG cs.AI 92%

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

理性安全对齐:通过答案后检查确保对抗攻击防御

Chentao Cao, Xiaojun Xu, Bo Han, Hang Li

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR小组,计算机科学系,香港 Baptist大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出答案后检查方法,通过推理增强模型对抗攻击防御能力,实验表明其在安全性和效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11247 2026-03-09 cs.CR cs.AI 57%

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

峰值+累积:多轮LLM攻击检测的代理层评分公式

J Alex Corll

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出一种基于峰值和累积的代理层评分公式,用于多轮LLM攻击检测,实现高召回率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2602.08877 2026-03-09 cs.LG 80%

Stress-Testing Alignment Audits With Prompt-Level Strategic Deception

通过提示级策略欺骗进行对齐审计压力测试

Oliver Daniels, Perusha Moodley, Benjamin M. Marlin, David Lindner

机构 * MATS University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Deepmind(谷歌DeepMind)

专题命中 红队测试 :alignment(title,abstract);分类 cs.LG;trustworthy(comments)

AI总结 本文提出自动红队流水线,通过生成针对白盒和黑盒审计方法的欺骗提示,揭示了当前对齐审计方法在面对强大非对齐模型时的脆弱性。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2506.15751 2026-03-09 cs.AI cs.CL cs.LG 67%

Sysformer: Safeguarding Frozen Large Language Models with Adaptive System Prompts

Sysformer: 通过自适应系统提示保护冻结的大语言模型

Kartik Sharma, Yiqiao Jin, Vineeth Rakesh, Yingtong Dou, Menghai Pan, Mahashweta Das, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) Visa Research(Visa研究)

专题命中 提示注入 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sysformer通过自适应系统提示提高大语言模型的安全性,显著提升对有害提示的拒绝率和对安全提示的合规性。

Comments ICLR 2026. Code available at https://github.com/Ksartik/sysformer

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 8 篇

2603.06333 2026-03-09 cs.AI cs.CL cs.LG 85%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05839 2026-03-09 cs.MA cs.AI 79%

Evaluating LLM Alignment With Human Trust Models

评估大语言模型与人类信任模型的对齐性

Anushka Debnath, Stephen Cranefield, Bastin Tony Roy Savarimuthu, Emiliano Lorini

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院,新西兰) IRIT, CNRS, Toulouse University, France(IRIT,法国国家科学研究中心,图卢兹大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文通过对比提示生成嵌入向量,评估了EleutherAI/gpt-j-6B对信任的内部表示,发现其最接近Castelfranchi社会认知模型。

Comments This paper will appear in the post-proceedings of ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04897 2026-03-09 cs.CL 79%

Can LLMs Capture Expert Uncertainty? A Comparative Analysis of Value Alignment in Ethnographic Qualitative Research

LLMs能否捕捉专家不确定性?对人类学质性研究中价值对齐的比较分析

Arina Kostina, Marios Dikaiakos, Alejandro Porcel, Tassos Stassopoulos

机构 * University of Cyprus(塞浦路斯大学) University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 本文研究LLMs在人类学质性研究中捕捉专家不确定性的能力,发现Qwen在价值对齐上表现最佳,但需进一步探讨模型偏差问题。

Comments Accepted for a poster session at BIG.AI at MIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05909 2026-03-09 cs.CL 57%

InfoGatherer: Principled Information Seeking via Evidence Retrieval and Strategic Questioning

InfoGatherer: 通过证据检索和策略性提问进行原理化的信息获取

Maksym Taranukhin, Shuyue Stella Li, Evangelos Milios, Geoff Pleiss, Yulia Tsvetkov, Vered Shwartz

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) CIFAR AI Chair(CIFAR人工智能主席) University of Washington(华盛顿大学) Dalhousie University(达尔豪斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 InfoGatherer通过证据检索和策略性提问,结合结构化证据网络和Dempster-Shafer理论,实现原理化的信息获取,提升医疗和法律任务中的可靠性与可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05828 2026-03-09 cs.CL 57%

HART: Data-Driven Hallucination Attribution and Evidence-Based Tracing for Large Language Models

HART: 基于数据的幻觉归因与证据导向追踪用于大语言模型

Shize Liang, Hongzhi Wang

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 HART通过结构化建模方法提升大语言模型幻觉归因与证据追踪的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08445 2026-03-09 cs.CV cs.LG 57%

Uncertainty-Aware Subset Selection for Robust Visual Explainability under Distribution Shifts

考虑不确定性的子集选择以在分布偏移下实现稳健的视觉可解释性

Madhav Gupta, Vishak Prasad C, Ganesh Ramakrishnan

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出一种结合子模子集选择与层间梯度不确定性估计的方法,以提高在分布偏移下的视觉可解释性鲁棒性和保真度。

Comments Accepted to the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05725 2026-03-09 cs.CR 50%

Challenges and Design Considerations for Finding CUDA Bugs Through GPU-Native Fuzzing

通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑

Mingkai Li, Joseph Devietti, Suman Jana, Tanvir Ahmed Khan

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文研究了通过GPU原生模糊测试寻找CUDA漏洞的挑战与设计考虑,强调程序行为的忠实性对异构系统安全的重要性。

Comments Accepted to appear in HotEthics 2026; 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25034 2026-03-09 cs.MA cs.SY eess.SY 50%

MARLIN: Multi-Agent Reinforcement Learning with Murmuration Intelligence and LLM Guidance for Reservoir Management

MARLIN: 基于星群智能与大语言模型引导的多智能体强化学习在水库管理中的应用

Heming Fu, Shan Lin, Guojun Xiong

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 MARLIN通过结合生物启发规则与大语言模型,实现多智能体强化学习在水库管理中的去中心化协调,提升不确定性处理能力并加快洪水响应。

Comments AAMAS'26

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 隐私与版权 1 篇

2504.17703 2026-03-09 cs.LG cs.AI 62%

Federated Learning: A Survey on Privacy-Preserving Collaborative Intelligence

联邦学习:关于隐私保护协作智能的综述

Ratun Rahman

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了联邦学习的隐私保护协作智能,探讨了其核心架构、技术挑战、新兴趋势及实际应用,旨在推动可扩展、高效和可信的联邦学习系统发展。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 安全评测 16 篇

2603.06485 2026-03-09 cs.CL cs.AI 84%

PONTE: Personalized Orchestration for Natural Language Trustworthy Explanations

PONTE:面向自然语言可信解释的个性化编排

Vittoria Vineis, Matteo Silvestri, Lorenzo Antonelli, Filippo Betello, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学萨皮恩扎) Syllotips TellmewAI s.r.l.(TellmewAI公司)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 PONTE通过闭环验证和适应过程,实现自然语言可信解释的个性化生成,提升XAI的完整性和风格对齐性。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04992 2026-03-09 cs.CL 84%

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

机构 * SCB DataX(SCB数据X) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) SCBX R&D(SCBX研发部) SCB 10X

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL;trustworthy(comments)

AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06130 2026-03-09 cs.RO cs.AI 83%

A Hazard-Informed Data Pipeline for Robotics Physical Safety

面向机器人物理安全的危险信息数据管道

Alexei Odinokov, Rostislav Yavorskiy

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于危险信息的数据管道,整合传统安全工程与机器学习,实现机器人物理安全的系统性保障。

Comments 4th International Conference on Automation and Mechatronics Engineering (ICAME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05936 2026-03-09 cs.CV 78%

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

基于本体的风险评估与安全增强:面向自动驾驶

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue

机构 * Chubu University(楚鸟大学) Elith Inc.(Elith公司) Honda R&D Co., Ltd.(本田研发公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。

Comments Accepted ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 78%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13531 2026-03-09 cs.CY cs.AI cs.CL 75%

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法

Jing Yao, Shitong Duan, Xiaoyuan Yi, Dongkuan Xu, Peng Zhang, Tun Lu, Ning Gu, Zhicheng Dou, Xing Xie

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。

Comments This paper is accepted by ICLR 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08105 2026-03-09 cs.CL 74%

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani

机构 * University of Toronto(多伦多大学) Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) OntarioTech University(安大略技术大学) Saarland University(萨尔兰州立大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。

Comments Accepted to EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03294 2026-03-09 cs.CL cs.AI cs.LG 67%

Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory

对话式农业建议的微调与评估

Sanyam Singh, Naga Ganesh, Vineet Singh, Lakshmi Pedapudi, Ritesh Kumar, SSP Jyothi, Archana Karanam, Waseem Pasha, Ekta Kumari, C. Yashoda, Mettu Vijaya Rekha Reddy, Shesha Phani Debbesa, Chandan Dash

机构 * Digital Green

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种混合LLM架构,通过微调和拼接层提升农业建议的准确性与安全性,释放了farmerchat-prompts库以促进领域特定农业AI的发展。

Comments 22 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 62%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04413 2026-03-09 cs.CL cs.AI 62%

Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries

模拟意义,永不再来!引入ICR:一种用于评估LLM文本摘要中意义的象征-解释学度量标准

Natalie Perez, Sreyoshi Bhaduri, Aman Chadha

机构 * University of Hawai‘i(夏威夷大学) Private Corporation(私营公司) Amazon GenAI(亚马逊生成人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICR度量标准,用于评估LLM生成文本摘要中的意义,通过归纳内容分析和反思主题分析,超越词法相似性度量,评估语义准确性和意义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏