arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 59 篇

2508.06046 2026-03-17 cs.CL cs.AI 86%

EvolvR: Self-Evolving Pairwise Reasoning for Story Evaluation to Enhance Generation

EvolvR:自进化成对推理用于故事评估以增强生成

Xinda Wang, Zhengxu Hou, Yangshijie Zhang, Bingren Yan, Jialin Liu, Chenzhuo Zhao, Zhibo Yang, Bin-Bin Yang, Feng Xiao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 EvolvR通过自进化成对推理框架提升故事评估准确性,解决传统方法在开放任务中的局限性,实现生成质量的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 83%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 82%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14468 2026-03-17 cs.CV cs.IR 82%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 推理评测 :planning(title,abstract);reasoning(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14326 2026-03-17 cs.LG cs.AI cs.CL 82%

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

ECG-Reasoning-Benchmark: 一个用于评估心电图解读中临床推理能力的基准

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ECG-Reasoning-Benchmark,通过6400个样本系统评估17种核心心电图诊断的逐步推理能力,发现现有多模态大语言模型在多步逻辑推理中存在严重缺陷,无法有效将心电图发现与实际信号证据关联。

Comments Preprint. 9 pages for main text, 2 pages for references, 19 pages for supplementary materials (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06955 2026-03-17 cs.CL cs.AI 81%

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

BIS推理1.0:首个大规模日语信念不一致三段论基准数据集

Ha-Thanh Nguyen, Hideyuki Tachibana, Chaoran Liu, Qianying Liu, Su Myat Noe, Koichi Takeda, Sadao Kurohashi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BIS推理1.0,首个针对大语言模型信念不一致推理评估的日语三段论数据集,通过系统引入逻辑有效但信念不一致的三段论,揭示信念偏差问题,并评估多种模型在零样本下的表现。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14486 2026-03-17 cs.CL cs.AI 81%

Infinite Problem Generator: Verifiably Scaling Physics Reasoning Data with Agentic Workflows

无限问题生成器:通过代理工作流可验证地扩展物理推理数据

Aditya Sharan, Sriram Hebbale, Dhruv Kumar

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPG框架,通过公式-as-代码方法生成可解物理问题,解决大语言模型训练中高质量数据稀缺的问题,发布包含1335个经典力学问题的ClassicalMechanicsV1数据集,展示高结构多样性及复杂度与代码长度的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24711 2026-03-17 cs.AI cs.CL 81%

Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models

在失败前停止:为减轻大推理模型中低效推理而设定的操作能力边界

Qingjie Zhang, Yujia Fu, Yang Wang, Liu Yan, Tao Wei, Ke Xu, Minlie Huang, Han Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大推理模型在面对超出其操作能力边界的问题时,是否能通过早期信号预测并减少无效推理,提出两种监控策略提升效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15542 2026-03-17 cs.CY cs.AI 79%

InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems

InterveneBench:用于干预推理和真实社会系统因果研究设计的LLM基准测试

Shaojie Shi, Zhengyu Shi, Lingran Zheng, Xinyu Su, Anna Xie, Bohao Lv, Rui Xu, Zijian Chen, Zhichao Chen, Guolei Liu, Naifu Zhang, Mingjian Dong, Zhuo Quan, Bohao Chen, Teqi Hao, Yuan Qi, Yinghui Xu, Libo Wu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 InterveneBench通过真实社会科学研究评估LLM在干预推理和因果研究设计中的能力,发现现有模型表现不足,并提出STRIDES多智能体框架提升性能。

Comments 35pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04779 2026-03-17 cs.CL cs.SD eess.AS 79%

MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark

MMSU:一个大规模多任务语音语言理解与推理基准

Dingdong Wang, Junan Li, Jincenzi Wu, Dongchao Yang, Xueyuan Chen, Tianhua Zhang, Helen Meng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MMSU基准通过整合语音的语义、语调和语音学特征,评估语音语言理解与推理能力,发现现有模型存在改进空间,为开发更高级的人机语音交互系统提供新标准。

Comments ICLR 2026. MMSU benchmark is available at https://huggingface.co/datasets/ddwang2000/MMSU. Project page https://github.com/dingdongwang/MMSU

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 79%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13628 2026-03-17 cs.CV cs.AI 79%

Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models

基于可定位性的自适应推理图像地理定位方法

Bo Yu, Fengze Yang, Yiming Liu, Chao Wang, Xuewen Luo, Taozhe Li, Ruimin Ke, Xiaofan Zhou, Chenxi Liu

机构 * The University of Utah(犹他大学) The University of Oklahoma(俄克拉荷马大学) Worcester Polytechnic Institute(沃斯特理工学院) Rensselaer Polytechnic Institute(雷士利理工学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 78%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03667 2026-03-17 cs.CV 78%

Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning

Colon-X:推动智能结肠镜向临床推理迈进

Ge-Peng Ji, Jingyi Liu, Deng-Ping Fan, Huazhu Fu, Nick Barnes

机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。

Comments Technical report (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07610 2026-03-17 cs.CV cs.CL cs.HC 77%

SpatialViz-Bench: A Cognitively-Grounded Benchmark for Diagnosing Spatial Visualization in MLLMs

SpatialViz-Bench:一种基于认知的多模态基准,用于诊断大语言模型中的空间可视化能力

Siting Wang, Minnan Pei, Luoyang Sun, Cheng Deng, Yuchen Li, Kun Shao, Zheng Tian, Haifeng Zhang, Jun Wang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出SpatialViz-Bench,一个包含12个任务和4种子能力的多模态基准,通过1180个程序生成问题评估大语言模型的空间可视化能力,揭示了模型在空间任务中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 77%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 71%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 推理评测 :reasoning(title)

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15039 2026-03-17 cs.CV 67%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14944 2026-03-17 cs.CV 67%

PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs

PuzzleCraft: 为基于谜题的RLVR在VLMs中的探索感知课程学习

Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto(多伦多AI中心) Samsung Electronics(三星电子) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 PuzzleCraft通过轻量级谜题环境和探索信号优化课程学习,提升VLMs的视觉RLVR能力,增强推理一致性与下游表现。

Comments Project page: https://puzzlecraftgrpo.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15615 2026-03-17 cs.CL cs.AI 62%

Mechanistic Origin of Moral Indifference in Language Models

语言模型中道德冷漠的机制起源

Lingyu Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型存在内在道德冷漠,通过构建道德向量并重构其拓扑关系,提升道德推理能力,实现75%的对抗性基准测试胜率。

Comments 24 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14525 2026-03-17 cs.CL cs.AI 62%

MALicious INTent Dataset and Inoculating LLMs for Enhanced Disinformation Detection

恶意意图数据集与增强虚假信息检测的LLM接种

Arkadiusz Modzelewski, Witold Sosnowski, Eleni Papadopulos, Elisa Sartori, Tiziano Labruna, Giovanni Da San Martino, Adam Wierzbicki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MALINT数据集,通过专家事实核查员标注,用于评估12种语言模型在意图分类任务中的表现,并提出基于意图的接种方法,通过整合意图分析来缓解虚假信息的说服力。

Comments Paper accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 62%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 62%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-03-17 cs.CV cs.AI cs.LG 62%

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04421 2026-03-17 cs.CL cs.AI cs.MA 62%

Do Mixed-Vendor Multi-Agent LLMs Improve Clinical Diagnosis?

多供应商多智能体大语言模型是否能改善临床诊断?

Grace Chang Yuan, Xiaoman Zhang, Sung Eun Kim, Pranav Rajpurkar

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多供应商多智能体系统在临床诊断中的表现,发现混合供应商配置在召回率和准确性上优于单一供应商配置,揭示了供应商多样性对诊断系统鲁棒性的重要性。

Comments Accepted as Oral at the EACL 2026 Workshop on Healthcare and Language Learning (HeaLing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 62%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 62%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 57%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14911 2026-03-17 cs.CR cs.CL 57%

Fine-tuning RoBERTa for CVE-to-CWE Classification: A 125M Parameter Model Competitive with LLMs

基于RoBERTa的CVE到CWE分类微调:一个125M参数模型与LLMs竞争

Nikita Mosievskiy

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个125M参数的RoBERTa基分类器,通过AI优化的CWE标签构建大规模训练数据集,在27780个样本上达到87.4%的Top-1准确率和60.7%的Macro F1,优于TF-IDF基线。

Comments 9 pages, 2 figures, 6 tables. Dataset: https://huggingface.co/datasets/xamxte/cve-to-cwe Model: https://huggingface.co/xamxte/cwe-classifier-roberta-base

详情

展开后加载摘要…

URL PDF HTML 收藏