arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-05 至 2026-05-05 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2605.01415 2026-05-05 cs.AI cs.CY 90%

AI Safety as Control of Irreversibility: A Systems Framework for Decision-Energy and Sovereignty Boundaries

AI安全作为不可逆性的控制:决策-能量和主权边界的系统框架

Wesley Shu, Peng Wei

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 偏好对齐 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过决策-能量密度模型,探讨AI安全问题的本质,强调通过主权边界控制防止单一高效节点释放不可逆权力,重构AI安全为分层控制与审查机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19117 2026-05-05 cs.LG 84%

LLMs Know They're Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit

大语言模型知道错误却仍顺从:共享的谄媚说谎电路

Manav Pandey

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 研究揭示大语言模型在面对用户错误信念时,通过特定注意力头的机制表现出顺从行为,而非知识不足,且该机制在不同模型和训练方法中保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25426 2026-05-05 cs.CL cs.AI 81%

Implicature in Interaction: Understanding Implicature Improves Alignment in Human-LLM Interaction

互动中的隐含意义:理解隐含意义能提高人-大语言模型互动的对齐

Asutosh Hota, Jussi P. P. Jokinen

机构 * Jyvaskylan yliopisto(耶夫斯克扬大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在基于上下文的提示中推断用户意图的能力,发现更大模型更接近人类解释,隐含意义提示能显著提升响应的相关性和质量,67.6%参与者偏好隐含意义提示。

Comments The manuscript is approximately 7360 words and contains 12 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01123 2026-05-05 cs.AI 77%

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

PERSA:利用强化学习生成教授风格的个性化反馈

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 PERSA通过结合监督微调、奖励建模和PPO,利用LLM生成符合教授风格的编程反馈,提升反馈的风格匹配度和准确性。

Comments 18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL 57%

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2605.01644 2026-05-05 cs.CR 78%

Toward a Principled Framework for Agent Safety Measurement

迈向代理安全测量的原理性框架

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出基于搜索而非采样的原理性框架,用于评估代理安全,通过BOA框架在预算内搜索轨迹空间,发现贪心和采样方法遗漏的不安全轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01356 2026-05-05 cs.LG cs.AI 73%

Model-Based Proactive Cost Generation for Learning Safe Policies Offline with Limited Violation Data

基于模型的主动成本生成:用于在有限违规数据下学习安全策略

Ruiqi Xue, Lei Yuan, Kainuo Cheng, Jing-Wen Yang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies Nanjing, China(南京Polixir科技有限公司) Tencent Game AI Center Shenzhen, China(腾讯深圳游戏AI中心)

专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出PROCO框架,利用大语言模型整合自然语言知识,通过构建保守成本函数和模型基于的模拟,减少约束违规并提升安全性,适用于离线数据中极少或无违规样本的高风险场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01441 2026-05-05 cs.CL cs.CY cs.HC 62%

Artificial intelligence language technologies in multilingual healthcare: Grand challenges ahead

多语言医疗中的人工智能语言技术:前方的宏大挑战

Vicent Briva-Iglesias

机构 * School of Applied Languages and Intercultural Studies (SALIS)(应用语言学与跨文化研究学院) CTTS, ADAPT Centre(CTTS与ADAPT中心) Dublin City University(都柏林城市大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨多语言医疗中AI语言技术的应用挑战,分析其在翻译、文档等任务中的表现差异及安全性和公平性问题,提出七大研究与部署挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01416 2026-05-05 cs.CY cs.CL 62%

Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

谁决定什么是有害的?通过多智能体个性化推理框架进行内容审核政策

Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文提出基于LLM的多智能体个性化推理框架,通过用户敏感性档案过滤内容,提升审核准确性,并为平台治理提供政策相关洞察。

Comments The paper has been accepted to the 34th European Conference on Information Systems (ECIS 2026). The official paper version will appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03267 2026-05-05 cs.CL cs.AI 62%

OpenAI GPT-5 System Card

OpenAI GPT-5 系统卡片

Aaditya Singh, Adam Fry, Adam Perelman, Adam Tart, Adi Ganesh, Ahmed El-Kishky, Aidan McLaughlin, Aiden Low, AJ Ostrow, Akhila Ananthram, Akshay Nathan, Alan Luo, Alec Helyar, Aleksander Madry, Aleksandr Efremov, Aleksandra Spyra, Alex Baker-Whitcomb, Alex Beutel, Alex Karpenko, Alex Makelov, Alex Neitz, Alex Wei, Alexandra Barr, Alexandre Kirchmeyer, Alexey Ivanov, Alexi Christakis, Alistair Gillespie, Allison Tam, Ally Bennett, Alvin Wan, Alyssa Huang, Amy McDonald Sandjideh, Amy Yang, Ananya Kumar, Andre Saraiva, Andrea Vallone, Andrei Gheorghe, Andres Garcia Garcia, Andrew Braunstein, Andrew Liu, Andrew Schmidt, Andrey Mereskin, Andrey Mishchenko, Andy Applebaum, Andy Rogerson, Ann Rajan, Annie Wei, Anoop Kotha, Anubha Srivastava, Anushree Agrawal, Arun Vijayvergiya, Ashley Tyra, Ashvin Nair, Avi Nayak, Ben Eggers, Bessie Ji, Beth Hoover, Bill Chen, Blair Chen, Boaz Barak, Borys Minaiev, Botao Hao, Bowen Baker, Brad Lightcap, Brandon McKinzie, Brandon Wang, Brendan Quinn, Brian Fioca, Brian Hsu, Brian Yang, Brian Yu, Brian Zhang, Brittany Brenner, Callie Riggins Zetino, Cameron Raymond, Camillo Lugaresi, Carolina Paz, Cary Hudson, Cedric Whitney, Chak Li, Charles Chen, Charlotte Cole, Chelsea Voss, Chen Ding, Chen Shen, Chengdu Huang, Chris Colby, Chris Hallacy, Chris Koch, Chris Lu, Christina Kaplan, Christina Kim, CJ Minott-Henriques, Cliff Frey, Cody Yu, Coley Czarnecki, Colin Reid, Colin Wei, Cory Decareaux, Cristina Scheau, Cyril Zhang, Cyrus Forbes, Da Tang, Dakota Goldberg, Dan Roberts, Dana Palmie, Daniel Kappler, Daniel Levine, Daniel Wright, Dave Leo, David Lin, David Robinson, Declan Grabb, Derek Chen, Derek Lim, Derek Salama, Dibya Bhattacharjee, Dimitris Tsipras, Dinghua Li, Dingli Yu, DJ Strouse, Drew Williams, Dylan Hunn, Ed Bayes, Edwin Arbus, Ekin Akyurek, Elaine Ya Le, Elana Widmann, Eli Yani, Elizabeth Proehl, Enis Sert, Enoch Cheung, Eri Schwartz, Eric Han, Eric Jiang, Eric Mitchell, Eric Sigler, Eric Wallace, Erik Ritter, Erin Kavanaugh, Evan Mays, Evgenii Nikishin, Fangyuan Li, Felipe Petroski Such, Filipe de Avila Belbute Peres, Filippo Raso, Florent Bekerman, Foivos Tsimpourlas, Fotis Chantzis, Francis Song, Francis Zhang, Gaby Raila, Garrett McGrath, Gary Briggs, Gary Yang, Giambattista Parascandolo, Gildas Chabot, Grace Kim, Grace Zhao, Gregory Valiant, Guillaume Leclerc, Hadi Salman, Hanson Wang, Hao Sheng, Haoming Jiang, Haoyu Wang, Haozhun Jin, Harshit Sikchi, Heather Schmidt, Henry Aspegren, Honglin Chen, Huida Qiu, Hunter Lightman, Ian Covert, Ian Kivlichan, Ian Silber, Ian Sohl, Ibrahim Hammoud, Ignasi Clavera, Ikai Lan, Ilge Akkaya, Ilya Kostrikov, Irina Kofman, Isak Etinger, Ishaan Singal, Jackie Hehir, Jacob Huh, Jacqueline Pan, Jake Wilczynski, Jakub Pachocki, James Lee, James Quinn, Jamie Kiros, Janvi Kalra, Jasmyn Samaroo, Jason Wang, Jason Wolfe, Jay Chen, Jay Wang, Jean Harb, Jeffrey Han, Jeffrey Wang, Jennifer Zhao, Jeremy Chen, Jerene Yang, Jerry Tworek, Jesse Chand, Jessica Landon, Jessica Liang, Ji Lin, Jiancheng Liu, Jianfeng Wang, Jie Tang, Jihan Yin, Joanne Jang, Joel Morris, Joey Flynn, Johannes Ferstad, Johannes Heidecke, John Fishbein, John Hallman, Jonah Grant, Jonathan Chien, Jonathan Gordon, Jongsoo Park, Jordan Liss, Jos Kraaijeveld, Joseph Guay, Joseph Mo, Josh Lawson, Josh McGrath, Joshua Vendrow, Joy Jiao, Julian Lee, Julie Steele, Julie Wang, Junhua Mao, Kai Chen, Kai Hayashi, Kai Xiao, Kamyar Salahi, Kan Wu, Karan Sekhri, Karan Sharma, Karan Singhal, Karen Li, Kenny Nguyen, Keren Gu-Lemberg, Kevin King, Kevin Liu, Kevin Stone, Kevin Yu, Kristen Ying, Kristian Georgiev, Kristie Lim, Kushal Tirumala, Kyle Miller, Lama Ahmad, Larry Lv, Laura Clare, Laurance Fauconnet, Lauren Itow, Lauren Yang, Laurentia Romaniuk, Leah Anise, Lee Byron, Leher Pathak, Leon Maksin, Leyan Lo, Leyton Ho, Li Jing, Liang Wu, Liang Xiong, Lien Mamitsuka, Lin Yang, Lindsay McCallum, Lindsey Held, Liz Bourgeois, Logan Engstrom, Lorenz Kuhn, Louis Feuvrier, Lu Zhang, Lucas Switzer, Lukas Kondraciuk, Lukasz Kaiser, Manas Joglekar, Mandeep Singh, Mandip Shah, Manuka Stratta, Marcus Williams, Mark Chen, Mark Sun, Marselus Cayton, Martin Li, Marvin Zhang, Marwan Aljubeh, Matt Nichols, Matthew Haines, Max Schwarzer, Mayank Gupta, Meghan Shah, Melody Y. Guan, Melody Huang, Meng Dong, Mengqing Wang, Mia Glaese, Micah Carroll, Michael Lampe, Michael Malek, Michael Sharman, Michael Zhang, Michele Wang, Michelle Pokrass, Mihai Florian, Mikhail Pavlov, Miles Wang, Ming Chen, Mingxuan Wang, Minnia Feng, Mo Bavarian, Molly Lin, Moose Abdool, Mostafa Rohaninejad, Nacho Soto, Natalie Staudacher, Natan LaFontaine, Nathan Marwell, Nelson Liu, Nick Preston, Nick Turley, Nicklas Ansman, Nicole Blades, Nikil Pancha, Nikita Mikhaylin, Niko Felix, Nikunj Handa, Nishant Rai, Nitish Keskar, Noam Brown, Ofir Nachum, Oleg Boiko, Oleg Murk, Olivia Watkins, Oona Gleeson, Pamela Mishkin, Patryk Lesiewicz, Paul Baltescu, Pavel Belov, Peter Zhokhov, Philip Pronin, Phillip Guo, Phoebe Thacker, Qi Liu, Qiming Yuan, Qinghua Liu, Rachel Dias, Rachel Puckett, Rahul Arora, Ravi Teja Mullapudi, Raz Gaon, Reah Miyara, Rennie Song, Rishabh Aggarwal, RJ Marsan, Robel Yemiru, Robert Xiong, Rohan Kshirsagar, Rohan Nuttall, Roman Tsiupa, Ronen Eldan, Rose Wang, Roshan James, Roy Ziv, Rui Shu, Ruslan Nigmatullin, Saachi Jain, Saam Talaie, Sam Altman, Sam Arnesen, Sam Toizer, Sam Toyer, Samuel Miserendino, Sandhini Agarwal, Sarah Yoo, Savannah Heon, Scott Ethersmith, Sean Grove, Sean Taylor, Sebastien Bubeck, Sever Banesiu, Shaokyi Amdo, Shengjia Zhao, Sherwin Wu, Shibani Santurkar, Shiyu Zhao, Shraman Ray Chaudhuri, Shreyas Krishnaswamy, Shuaiqi, Xia, Shuyang Cheng, Shyamal Anadkat, Simón Posada Fishman, Simon Tobin, Siyuan Fu, Somay Jain, Song Mei, Sonya Egoian, Spencer Kim, Spug Golden, SQ Mah, Steph Lin, Stephen Imm, Steve Sharpe, Steve Yadlowsky, Sulman Choudhry, Sungwon Eum, Suvansh Sanjeev, Tabarak Khan, Tal Stramer, Tao Wang, Tao Xin, Tarun Gogineni, Taya Christianson, Ted Sanders, Tejal Patwardhan, Thomas Degry, Thomas Shadwell, Tianfu Fu, Tianshi Gao, Timur Garipov, Tina Sriskandarajah, Toki Sherbakov, Tomek Korbak, Tomer Kaftan, Tomo Hiratsuka, Tongzhou Wang, Tony Song, Tony Zhao, Troy Peterson, Val Kharitonov, Victoria Chernova, Vineet Kosaraju, Vishal Kuo, Vitchyr Pong, Vivek Verma, Vlad Petrov, Wanning Jiang, Weixing Zhang, Wenda Zhou, Wenlei Xie, Wenting Zhan, Wes McCabe, Will DePue, Will Ellsworth, Wulfie Bain, Wyatt Thompson, Xiangning Chen, Xiangyu Qi, Xin Xiang, Xinwei Shi, Yann Dubois, Yaodong Yu, Yara Khakbaz, Yifan Wu, Yilei Qian, Yin Tat Lee, Yinbo Chen, Yizhen Zhang, Yizhong Xiong, Yonglong Tian, Young Cha, Yu Bai, Yu Yang, Yuan Yuan, Yuanzhi Li, Yufeng Zhang, Yuguang Yang, Yujia Jin, Yun Jiang, Yunyun Wang, Yushi Wang, Yutian Liu, Zach Stubenvoll, Zehao Dou, Zheng Wu, Zhigang Wang

机构 * OpenAI

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 GPT-5 是一个统一系统,具备快速回答问题的模型、深度推理模型和实时路由器,提升真实世界查询的实用性,减少幻觉并改进指令遵循。

Comments May 2026: Added monitorability evals and authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01517 2026-05-05 cs.CV 50%

VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation

VAnim:基于渲染的稀疏状态建模用于结构保持的向量动画

Guotao Liang, Zhangcheng Wang, Chuang Wang, Juncheng Hu, Haitao Zhou, Junhua Liu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Department of Computer Science, The University of Hong Kong, Hong Kong, China(香港大学计算机科学系) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院)

专题命中 安全训练 :alignment(abstract)

AI总结 VAnim提出了一种基于LLM的框架,通过稀疏状态更新和渲染感知强化学习,实现结构保持的向量动画生成,优于现有方法。

Comments Accepted to ICML 2026. Project page: https://yukinonooo.github.io/VAnimProject

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2605.00974 2026-05-05 cs.CR cs.CL 81%

SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

SRTJ:自演化规则驱动的无训练LLM jailbreaking

Jindong Li, Ying Liu, Yali Fu, Jinjing Zhu, Leyao Wang, Menglin Yang, Rex Ying

机构 * HKUST (GZ)(香港科技大学(广州)) Jilin University(吉林大学) Yale University(耶鲁大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01034 2026-05-05 cs.CL 57%

A Theoretical Game of Attacks via Compositional Skills

通过组合技能的攻击理论游戏

Xinbo Wu, Huan Zhang, Abhishek Umrawal, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出一个理论框架,分析攻击者与防御者之间的博弈,设计最优攻击策略并揭示其与现有对抗提示方法的关系,同时推导出可证明最优的防御策略,并通过实验验证其在不同LLM和基准上的优越性。

Comments arXiv admin note: text overlap with arXiv:2505.20841

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2605.01462 2026-05-05 cs.CR 88%

LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training

LocalAlign: 通过生成接近目标的对抗示例实现通用的提示注入防御

Yuyang Gong, Zihao Wang, Jiawei Liu, XiaoFeng Wang

专题命中 提示注入 :alignment(title,abstract);prompt injection(title,abstract)

AI总结 LocalAlign通过生成接近正确响应但错误的对抗示例,提升提示注入防御的泛化能力,采用margin-aware对齐算法增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01186 2026-05-05 cs.CR 50%

Trace: Unmasking AI Attack Agents Through Terminal Behavior Fingerprinting

Trace:通过终端行为指纹揭示AI攻击代理

Murali Ediga, Sudipta Chattopadhyay

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出Trace框架,通过终端命令序列识别AI攻击代理模型家族,利用防御性提示注入策略提取系统提示,提升攻击意图分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2511.21086 2026-05-05 cs.CL 74%

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

正交约束满足与大语言模型中的人类难度对齐

Bryan E. Tuck, Rakesh M. Verma

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL

AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01428 2026-05-05 cs.CL 57%

Hallucinations Undermine Trust; Metacognition is a Way Forward

幻觉削弱信任;元认知是前进的方向

Gal Yona, Mor Geva, Yossi Matias

机构 * Tel Aviv University(特拉维夫大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 研究指出,生成AI的幻觉问题源于知识边界扩展而非意识提升,提出通过元认知表达不确定性以提升可信度和能力。

Comments To appear in ICML 2026 (Position Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01306 2026-05-05 physics.optics cs.LG physics.app-ph 57%

Machine Learning Enhanced Laser Spectroscopy for Multi-Species Gas Detection in Complex and Harsh Environments

机器学习增强的激光光谱法用于复杂恶劣环境中的多物种气体检测

Mohamed Sy

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本研究结合激光吸收光谱与机器学习,开发出多物种气体检测方法,通过深度去噪自编码器、结构化无监督框架和盲源分离技术提升检测可靠性,适用于动态或干扰环境。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00893 2026-05-05 cs.CV cs.AI cs.IR 57%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 22 篇

2506.24056 2026-05-05 cs.CR cs.CL cs.LG 88%

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

Logit-Gap Steering:一种对齐鲁棒性的前向传递诊断

Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出logit-gap steering方法,通过前向传递发现短的分布内后缀以关闭对齐间隙,验证了当前对齐边距的薄且可测量,强调防御策略需考虑分布内后缀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01266 2026-05-05 cs.CV 78%

Exploring Prompt Alignment with Clinical Factors in Zero-Shot Segmentation VLMs for NSCLC Tumor Segmentation

探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割

Suraj Pai, Thibault Heintz, Cosmin Ciausu, Marion Tonneau, Hugo Aerts, Raymond Mak

机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01567 2026-05-05 cs.SE cs.CL cs.LG 76%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.LG

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20055 2026-05-05 cs.CL cs.AI 73%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01647 2026-05-05 cs.CL 70%

Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection

超越困惑度:字符分布签名与AI文本检测的MDTA基准

Priyadarshan Narayanasamy, Swastik Agrawal, Klint Faber, Fardina Fathmiul Alam

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于字符分布签名的AI文本检测方法,通过MDTA基准验证其有效性,显示与困惑度方法低相关性,并在特定领域取得显著提升。

Comments 11 figures, 10 tables, 24 pages, Under Review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 70%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 67%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20605 2026-05-05 cs.CL cs.AI cs.DL cs.LG 67%

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

TF1-EN-3M:三百万合成道德寓言用于训练小型开放语言模型

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu

机构 * Babeș-Bolyai University(巴纳德-波耶亚大学) KlusAI Labs(KlusAI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TF1-EN-3M数据集,包含三百万英文寓言,用于训练小型开放语言模型,展示通过指令微调模型生成高质量寓言的方法,验证了无需大模型即可实现大规模道德叙事的可能性。

Comments 18 pages, 6 tables, 1 figure. v2: revised evaluation with open-weight LLM judge panel, expanded citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01091 2026-05-05 cs.CY cs.AI cs.MA 62%

Governing What the EU AI Act Excludes: Accountability for Autonomous AI Agents in Smart City Critical Infrastructure

欧盟人工智能法案所排除的治理:自主AI代理在智能城市关键基础设施中的问责制

Talal Ashraf Butt, Muhammad Iqbal, Razi Iqbal

机构 * Higher Colleges of Technology(高等技术学院) Central Michigan University(中央密歇根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了欧盟人工智能法案在智能城市关键基础设施中自主AI代理问责制的不足,提出AgentGov-SC治理架构以弥补监管空白。

Comments 24 pages, 3 figures, 8 tables. Submitted to Computer Law & Security Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏