arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2605.00224 2026-05-04 cs.AI 92%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 偏好对齐 :DPO(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2506.00166 2026-05-04 cs.LG cs.AI cs.CL 90%

Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment

解耦安全适配器实现高效的防护措施和灵活的推理时对齐

Kundan Krishna, Joseph Y Cheng, Charles Maalouf, Leon A Gatys

机构 * Apple(苹果公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出解耦安全适配器框架,通过分离安全计算与任务优化基础模型,提升推理效率和开发灵活性,实验证明其在 hate speech 分类等任务中显著优于传统模型。

Comments ICLR 2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18280 2026-05-04 cs.LG cs.AI cs.CL 82%

Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails

检测成本低,路由是学习的:为何基于拒绝的对齐评估失败

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出现有对齐评估忽视路由层,通过政治审查实验发现检测准确率不具诊断性,路由机制因模型和实验室而异,拒绝不再是主要审查机制,需采用检测-路由-生成三阶段框架。

Comments Code and data: https://github.com/gregfrank/routing-is-learned

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00081 2026-05-04 cs.CR cs.LO 82%

Alignment Contracts for Agentic Security Systems

代理安全系统的对齐契约

Isaac David, Marco Guarnieri, Arthur Gervais

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 本文提出对齐契约框架,用于规范和强制执行可观测效果的行为约束,通过有限轨迹语义和模块化合同工程规则,确保安全系统的边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16345 2026-05-04 cs.HC cs.AI 70%

Bridging the Experimental Last Mile: Digitizing Laboratory Know-How for Safe AI-Assisted Support

弥合实验最后一公里:数字化实验室知识以实现安全的人工智能辅助支持

Akira Miura, Yuki Sasahara, Momoka Demura, Yuji Masubuchi, Tetsuya Asai, Chikahiko Mitsui

机构 * Division of Applied Chemistry, Faculty of Engineering, Hokkaido University(北海道大学工学部应用化学科) Graduate School of Chemical Sciences and Engineering, Hokkaido University(北海道大学研究生院化学科学和工程学系) Graduate School of Information Science and Technology, Hokkaido University(北海道大学研究生院信息科学和技术学系) Quantum Nexus, Inc.

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种结合视频、多模态AI和检索增强生成的AI助手,通过提取实验室特定知识来提升实验安全性,经评估显示其在指导和安全方面具有实用性。

Comments 32 pages in total (main 13 pages, appendix 19 pages), 2 main figures, 1 main table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 62%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2605.00583 2026-05-04 cs.CV cs.AI cs.LG 90%

Jailbreaking Vision-Language Models Through the Visual Modality

通过视觉模态 jailbreak 视觉-语言模型

Aharon Azulay, Jan Dubiński, Zhuoyun Li, Atharv Mittal, Yossi Gandelsman

机构 * Warsaw University of Technology(华沙理工大学) NASK National Research Institute(波兰国家研究研究院) University of Liverpool(利物浦大学) Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00267 2026-05-04 cs.LG cs.AI cs.CR 85%

Jailbroken Frontier Models Retain Their Capabilities

突破边界模型仍保留其能力

Daniel Zhu, Zihan Wang, Jenny Bao, Jerry Wei

机构 * Anthropic

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,模型能力越强,越能抵御 jailbreak,且推理任务比知识回忆任务更易受攻击,边界点 jailbreaking 几乎无损安全模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00236 2026-05-04 cs.CR cs.AI 84%

Attention Is Where You Attack

注意力是攻击之处

Aviral Srivastava, Sourav Panda

机构 * Amazon(亚马逊) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出注意力重分布攻击(ARA),通过Gumbel-softmax优化在概率单纯形上攻击softmax注意力,成功绕过安全对齐,实现高准确率的恶意请求执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00706 2026-05-04 cs.CL 79%

FinSafetyBench: Evaluating LLM Safety in Real-World Financial Scenarios

FinSafetyBench:评估LLM在现实金融场景中的安全性

Yutao Hou, Yihan Jiang, Yuhan Xie, Jian Yang, Liwen Zhang, Hailiang Huang, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北航) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究重点实验室)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL

AI总结 本文提出FinSafetyBench,一个双语红队基准,用于测试LLM对违反金融合规请求的拒绝能力,揭示了对抗性提示绕过合规保障的关键漏洞及中文环境下更严重的易受攻击性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03265 2026-05-04 cs.LG 77%

Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models

超越后缀:在大语言模型对抗攻击中的标记位置

Hicham Eddoubi, Umar Faruk Abdullahi, Fadi Hassan

机构 * University of Cagliari(卡利里大学) Sapienza University of Rome(罗马大学) Huawei Technologies Finland Research Center(芬兰华为技术研究中心)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究探讨了在大语言模型对抗攻击中,标记位置对攻击成功率的影响,指出在Greedy Coordinate Gradient攻击中,优化攻击生成前缀而非后缀以及调整对抗标记位置对攻击效果有显著影响。

Comments 12 pages, 10 figures, presented at the "I Can't Believe It's Not Better" workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00269 2026-05-04 cs.CL cs.LG 73%

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

语言模型如何处理分布外输入:一种双路径框架

Hamidreza Saghir

机构 * Independent Researcher(独立研究者)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出双路径框架以识别真实分布外信号,通过嵌入和处理轨迹分析不同OoD类型,展示嵌入路径在词汇区分上的优势,轨迹特征在隐含意图检测中的有效性。

Comments 30 pages, 3 figures, 30+ tables. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00741 2026-05-04 cs.CR 50%

Self-Adaptive Multi-Agent LLM-Based Security Pattern Selection for IoT Systems

自适应多智能体LLM基于的安全模式选择用于物联网系统

Saeid Jamshidi, Foutse Khomh, Carol Fung, Kawser Wazed Nafi

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出ASPO方法,结合LLM推理与确定性执行,在MAPE-K控制循环中实现自适应安全模式选择,通过减少极端情况执行成本,提升资源效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 50%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 越狱攻击 :safety(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2510.22628 2026-05-04 cs.CR cs.AI 70%

Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts

Sentra-Guard:一种实时多语言对抗对抗性LLM提示的防御系统

Md. Mehedi Hasan, Sk Tanzir Mehedi, Ziaur Rahman, Rafid Mostafiz, Md. Abir Hossain

专题命中 提示注入 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Sentra-Guard通过混合架构和分类器-检索器融合模块,实时检测并缓解针对大语言模型的劫持和提示注入攻击,实现多语言鲁棒性与高检测率。

Comments 11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06572 2026-05-04 cs.CR 50%

Parasites in the Toolchain: A Large-Scale Analysis of Attacks on the MCP Ecosystem

工具链中的寄生体:对MCP生态系统的大型分析

Shuli Zhao, Qinsheng Hou, Zihan Zhan, Yanhao Wang, Yuchong Xie, Yu Guo, Libo Chen, Shenghong Li, Zhi Xue

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究发现MCP生态中存在寄生工具链攻击,攻击者通过恶意指令渗透工具链,窃取隐私数据,揭示MCP缺乏安全隔离机制,需加强防御。

Comments Accepted by IEEE Symposium on Security and Privacy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2605.00323 2026-05-04 cs.CV cs.LG 57%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27209 2026-05-04 cs.SE cs.AI 57%

Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves

构建中的理论:协调语言模型用于研究软件,其中规范在演变

Halley Young, Nikolaj Björner

机构 * Microsoft Research(微软研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出Comet-H框架,通过迭代提示自动机协调语言模型在研究软件中的应用,解决规范演变中的 hallucination accumulation 和 desynchronization 问题,并通过实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10913 2026-05-04 cs.CL 57%

ADVICE: Answer-Dependent Verbalized Confidence Estimation

ADVICE: 答案依赖性口头置信度估计

Ki Jung Seo, Sehun Lim, Taeuk Kim

机构 * Department of Computer Science, Hanyang University(韩国汉阳大学计算机科学系)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出ADVICE框架,通过增强答案依赖性改进大语言模型的置信度校准,减少过度自信现象,提升可信度。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2605.00011 2026-05-04 cs.LG cs.AI cs.DC 62%

FedACT: Concurrent Federated Intelligence across Heterogeneous Data Sources

FedACT: 在异构数据源上实现协同联邦智能

Md Sirajul Islam, Isabelle G Chapman, N I Md Ashafuddula, Xu Yuan, Li Chen, Nian-Feng Tzeng, Klara Nahrstedt

机构 * School of Computing and Informatics, University of Louisiana at Lafayette, USA(路易斯安那州立大学拉斐特分校计算机与信息学院) Department of Computer and Information Sciences, University of Delaware, USA(德雷塞尔大学计算机与信息科学系) Department of Computer Science, University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 FedACT通过动态调度异构设备优化联邦学习任务,减少平均完成时间并提升模型精度,适用于多任务协同学习场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00364 2026-05-04 cs.CL 57%

Unlearning What Matters: Token-Level Attribution for Precise Language Model Unlearning

撤销重要信息:针对语言模型精确撤销的标记级归因

Jiawei Wu, DouDou Zhou

机构 * Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL

AI总结 本文提出TokenUnlearn框架,通过标记级归因实现精确撤销,结合知识意识信号和熵意识信号生成重要性评分,改进梯度信噪比,实验显示在遗忘效果和效用保持方面优于序列级基线。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 15 篇

2605.00245 2026-05-04 cs.AI 83%

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts

ARMOR 2025:一种评估大语言模型安全性的军事对齐基准,超越民用情境

Sydney Johns, Heng Jin, Chaoyu Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出ARMOR 2025基准,基于军事 doctrine 提出安全评估方法,通过12类分类和519个军事相关提示,评估21种商业LLM在军事应用中的安全对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00731 2026-05-04 cs.SI cs.AI 79%

Empowering Heterogeneous Graph Foundation Models via Decoupled Relation Alignment

通过解耦关系对齐增强异质图基础模型

Ziyu Zheng, Yaming Yang, Zhe Wang, Ziyu Guan, Wei Zhao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DRSA方法,通过解耦特征语义与关系结构,解决异质图中跨类型特征偏移和领域内关系缺口问题,提升跨域和少样本知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00689 2026-05-04 cs.CL cs.CR 79%

ML-Bench&Guard: Policy-Grounded Multilingual Safety Benchmark and Guardrail for Large Language Models

ML-Bench&Guard: 政策导向的多语言安全基准与大型语言模型的防护机制

Yunhan Zhao, Zhaorun Chen, Xingjun Ma, Yu-Gang Jiang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Fudan University(复旦大学) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出ML-Bench和ML-Guard,通过区域法规构建多语言安全基准,并开发基于扩散模型的防护系统,实现文化与法律一致的多语言安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 79%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00227 2026-05-04 cs.CL 79%

Persona-Grounded Safety Evaluation of AI Companions in Multi-Turn Conversations

基于角色的AI陪伴在多轮对话中的安全性评估

Prerna Juneja, Lika Lomidze

机构 * Seattle University(西雅图大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出首个端到端可扩展框架,用于可控模拟和评估AI陪伴应用的多轮交互安全性,通过构建角色、生成场景、模拟对话及评估危害,分析Replika对高风险用户群体的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15949 2026-05-04 cs.CL 74%

BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction

BanglaSocialBench: 一个评估大语言模型在孟加拉社会互动中社会语用和文化对齐的基准

Tanvir Ahmed Sijan, S. M Golam Rifat, Pankaj Chowdhury Partha, Md. Tanjeed Islam, Md. Musfique Anwar

机构 * Jahangirnagar University(贾亨吉尔纳加尔大学) Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 本文提出BanglaSocialBench,通过情境依赖的语言使用评估孟加拉语的社会语用能力,发现当前LLM在文化对齐上存在系统性偏差。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00468 2026-05-04 cs.CL 70%

ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?

ReLay:为更好的理解而定制的LLM生成的通俗摘要,但代价是什么?

Joey Chan, Yikun Han, Jingyuan Chen, Samuel Fang, Lauren D. Gryboski, Alexandra Lee, Sheel Tanna, Qingqing Zhu, Zhiyong Lu, Lucy Lu Wang, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Virginia(弗吉尼亚大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Johns Hopkins University(约翰霍普金斯大学) University of Chicago Pritzker School of Medicine(芝加哥大学普ritzker法学院) National Library of Medicine, National Institutes of Health(国家医学图书馆,国家卫生研究院) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 ReLay研究通过评估五种LLM在两种个性化方法中的表现,探讨了个性化通俗摘要对理解提升与安全性的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19098 2026-05-04 cs.CL cs.AI cs.LG 67%

SAHM: A Benchmark for Arabic Financial and Shari'ah-Compliant Reasoning

SAHM:阿拉伯语金融与伊斯兰合规推理的基准

Rania Elbadry, Sarfraz Ahmad, Ahmed Heakl, Dani Bouch, Momina Ahsan, Muhra AlMahri, Marwa Elsaid khalil, Yuxia Wang, Salem Lahlou, Sophia Ananiadou, Veselin Stoyanov, Jimin Huang, Xueqing Peng, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里迪斯") The University of Manchester(曼彻斯特大学) The Fin AI(Fin AI)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAHM基准,涵盖七个任务,包含14380个专家验证实例,评估20个LLM发现阿拉伯语流畅性不等于金融推理能力,特别是在事件因果推理上存在显著差距。

Comments 29 page

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27977 2026-05-04 cs.AI cs.LG 62%

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

D3-Gym:构建现实世界可验证环境用于数据驱动发现

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Cisco Research(思科研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏