arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2603.06485 2026-03-09 cs.CL cs.AI 84%

PONTE: Personalized Orchestration for Natural Language Trustworthy Explanations

PONTE:面向自然语言可信解释的个性化编排

Vittoria Vineis, Matteo Silvestri, Lorenzo Antonelli, Filippo Betello, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学萨皮恩扎) Syllotips TellmewAI s.r.l.(TellmewAI公司)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 PONTE通过闭环验证和适应过程,实现自然语言可信解释的个性化生成,提升XAI的完整性和风格对齐性。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04992 2026-03-09 cs.CL 84%

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

机构 * SCB DataX(SCB数据X) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) SCBX R&D(SCBX研发部) SCB 10X

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL;trustworthy(comments)

AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06130 2026-03-09 cs.RO cs.AI 83%

A Hazard-Informed Data Pipeline for Robotics Physical Safety

面向机器人物理安全的危险信息数据管道

Alexei Odinokov, Rostislav Yavorskiy

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于危险信息的数据管道,整合传统安全工程与机器学习,实现机器人物理安全的系统性保障。

Comments 4th International Conference on Automation and Mechatronics Engineering (ICAME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05936 2026-03-09 cs.CV 78%

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

基于本体的风险评估与安全增强:面向自动驾驶

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue

机构 * Chubu University(楚鸟大学) Elith Inc.(Elith公司) Honda R&D Co., Ltd.(本田研发公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 OD-RASE通过本体驱动的数据过滤和视觉语言模型生成,提升自动驾驶系统对事故诱因道路结构的预测和改进能力,增强交通环境的安全性。

Comments Accepted ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 78%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13531 2026-03-09 cs.CY cs.AI cs.CL 75%

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法

Jing Yao, Shitong Duan, Xiaoyuan Yi, Dongkuan Xu, Peng Zhang, Tun Lu, Ning Gu, Zhicheng Dou, Xing Xie

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。

Comments This paper is accepted by ICLR 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08105 2026-03-09 cs.CL 74%

MERLIN: Multi-Stage Curriculum Alignment for Multilingual Encoder-LLM Integration in Cross-Lingual Reasoning

MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理

Kosei Uemura, David Guzmán, Quang Phuoc Nguyen, Jesujoba Oluwadara Alabi, En-shiun Annie Lee, David Ifeoluwa Adelani

机构 * University of Toronto(多伦多大学) Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) OntarioTech University(安大略技术大学) Saarland University(萨尔兰州立大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。

Comments Accepted to EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03294 2026-03-09 cs.CL cs.AI cs.LG 67%

Fine-Tuning and Evaluating Conversational AI for Agricultural Advisory

对话式农业建议的微调与评估

Sanyam Singh, Naga Ganesh, Vineet Singh, Lakshmi Pedapudi, Ritesh Kumar, SSP Jyothi, Archana Karanam, Waseem Pasha, Ekta Kumari, C. Yashoda, Mettu Vijaya Rekha Reddy, Shesha Phani Debbesa, Chandan Dash

机构 * Digital Green

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种混合LLM架构,通过微调和拼接层提升农业建议的准确性与安全性,释放了farmerchat-prompts库以促进领域特定农业AI的发展。

Comments 22 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 62%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04413 2026-03-09 cs.CL cs.AI 62%

Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries

模拟意义,永不再来!引入ICR:一种用于评估LLM文本摘要中意义的象征-解释学度量标准

Natalie Perez, Sreyoshi Bhaduri, Aman Chadha

机构 * University of Hawai‘i(夏威夷大学) Private Corporation(私营公司) Amazon GenAI(亚马逊生成人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICR度量标准,用于评估LLM生成文本摘要中的意义,通过归纳内容分析和反思主题分析,超越词法相似性度量,评估语义准确性和意义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06570 2026-03-09 cs.CV cs.AI 57%

SUREON: A Benchmark and Vision-Language-Model for Surgical Reasoning

SUREON:一个手术推理的基准和视觉-语言模型

Alejandra Perez, Anita Rau, Lee White, Busisiwe Mlambo, Chinedu Nwoye, Muhammad Abdullah Jamal, Omid Mohareri

机构 * Intuitive Surgical Inc.

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SUREON通过大规模视频问答数据集和两种模型提升手术推理能力,准确率超过84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 57%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06222 2026-03-09 cs.CL 57%

SPOT: Span-level Pause-of-Thought for Efficient and Interpretable Latent Reasoning in Large Language Models

SPOT:基于跨度的思考暂停,用于大语言模型中高效且可解释的潜在推理

Yunlong Chu, Minglai Shao, Yuhang Liu, Bing Hao, Yumeng Lin, Jialu Wang, Ruijie Wang

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SPOT通过压缩显式推理步骤为紧凑的潜在暂停token,提升大语言模型的推理效率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05832 2026-03-09 cs.HC cs.AI 57%

Lexara: A User-Centered Toolkit for Evaluating Large Language Models for Conversational Visual Analytics

Lexara: 一种以用户为中心的评估工具包,用于评估用于对话式可视化分析的大型语言模型

Srishti Palani, Vidya Setlur

机构 * Tableau Research, Salesforce(Tableau研究机构,Salesforce)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Lexara是一种以用户为中心的评估工具包,用于评估对话式可视化分析中的大型语言模型,通过多格式输出的可解释指标和交互式工具帮助用户进行模型和提示选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01474 2026-03-09 cs.RO 50%

ROSER: Few-Shot Robotic Sequence Retrieval for Scalable Robot Learning

ROSER:用于可扩展机器人学习的少样本机器人序列检索

Zillur Rahman, Eddison Pham, Alejandro Daniel Noel, Cristian Meo

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) University of Toronto(多伦多大学) LatentWorlds AI

专题命中 安全评测 :alignment(abstract)

AI总结 ROSER通过少样本检索框架有效解决机器人序列数据稀缺问题,提升机器人学习的数据可用性。

Comments 2026 ICLR DATA-FM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06038 2026-03-09 cs.CV cs.GR 50%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 安全评测 :alignment(abstract)

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏