Before You Hand Over the Wheel: Evaluating LLMs for Security Incident Analysis
在交出轮子之前:评估LLMs用于安全事件分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
在交出轮子之前:评估LLMs用于安全事件分析
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。
Spatial4D-Bench: 一种多功能的4D空间智能基准
机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) ; Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) ; Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) ; Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) ; Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) ; Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) ; Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) ; Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) ; Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) ; Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) ; Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) ; Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) ; Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) ; Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) ; Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) ; Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) ; Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) ; Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) ; Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) ; Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) ; Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) ; Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) ; Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) ; Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) ; Yiyi Liao Zhejiang University(廖亿毅 浙江大学) ; Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)
专题命中 推理评测 :reasoning(abstract)
AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。
Comments Technical Report
OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析
机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) ; Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; School of Computer Science, Peking University(北京大学计算机学院) ; Shanghai Jiao Tong University(上海交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。
Comments 34 pages, 24 figures, conference
Journal ref CVPR 2026
ChatShopBuddy:通过强化学习实现可靠的对话购物代理
专题命中 推理评测 :reasoning(abstract)
AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。
在函数式编程课程背景下评估LLM:一项全面研究
专题命中 推理评测 :reasoning(abstract)
AI总结 本文评估了LLM在函数式编程课程中的有效性,通过构建三个基准测试,发现LLM在纠正语法和类型错误及回答基础概念问题方面表现良好,但解决低资源环境下家庭作业问题的能力较弱。
Journal ref The Art, Science, and Engineering of Programming, 2026, Vol. 11, Issue 1, Article 5
通过国际工具调用数据集增强大语言模型的工具调用能力
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。
FunnyNodules: 一种可定制的医学数据集,用于评估可解释AI
机构 * Ulm University Medical Center(乌尔姆大学医学中心) ; XAIRAD - Cooperation for Artificial Intelligence in Experimental Radiology(XAIRAD——实验放射学人工智能合作) ; Department of Diagnostic and Interventional Radiology(诊断与介入放射学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 FunnyNodules是一种可定制的医学数据集,用于评估可解释AI模型的属性推理能力。
Comments accepted at Medical Imaging with Deep Learning (MIDL) 2026
EarthScape:一种用于地表地质制图和地表分析的多模态数据集
机构 * Kentucky Geological Survey(肯塔基地质调查局) ; University of Kentucky(肯塔基大学) ; Department of Computer Science(计算机科学系)
专题命中 推理评测 :planning(abstract)
AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。
Think-as-You-See: 为大视觉-语言模型设计的流式推理链式思维
机构 * Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东技术学院) ; Ocean University of China(中国海洋大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心,慕尼黑大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)
AI总结 TaYS为大视觉-语言模型设计了流式推理链式思维框架,通过并行化生成、流约束训练和解耦的KV缓存,提升视频理解的效率和响应性。
DianJin-OCR-R1: 通过推理与工具交替的视觉语言模型增强OCR能力
机构 * Qwen DianJin Team, Alibaba Cloud Computing(文心一言团队,阿里云计算)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 DianJin-OCR-R1通过推理与工具交替的视觉语言模型框架,提升OCR识别的准确性和上下文理解能力。
基于进化大语言模型推理的自主算法发现用于ptychography
机构 * Advanced Photon Source, Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室先进光子源) ; Department of Materials Science and NanoEngineering, Rice University, Houston, TX, USA(材料科学与纳米工程系,德克萨斯大学里士满分校)
专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.AI
AI总结 Ptychi-Evolve通过进化大语言模型推理,自主发现并优化正则化算法,提升ptychography图像重建质量。
扩散语言模型天生具有长度感知能力
机构 * Department of Computing Sciences, Bocconi University, Milan, Italy(计算机科学系,博科尼大学,米兰,意大利)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出通过动态裁剪上下文窗口减少扩散语言模型生成步骤,从而提升效率并减少计算消耗,在多个基准测试中实现显著的性能提升。
路径作为策略:基于日志提炼的门控行为树作为可验证的外部化策略,用于安全、鲁棒且高效的智能体
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Worcester Polytechnic Institute(沃斯特理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 通过日志提炼生成门控行为树作为外部化策略,提升智能体在安全、鲁棒性和效率方面的表现。
Comments 30 pages, 1 figurres, 23 tables
揭开KAN在视觉任务中的神秘面纱:RepKAN方法
机构 * Sejong University(世宗大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 RepKAN通过结合CNN和KAN的优势,实现遥感图像分类的可解释性提升,优于现有模型。
辅导动作分类:一种与理论一致的框架,用于分析辅导中的教学动作
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出了一种辅导动作分类法,用于系统分析辅导中的教学动作,通过混合演绎归纳方法构建分类框架,涵盖四个类别并支持AI标注和学习成果分析。
辨别重要之物:对大语言模型道德能力的多维评估
机构 * Machine Intelligence and Normative Theory Lab, Australian National University, Acton, ACT 2601, Australia(澳大利亚国立大学机器智能与规范理论实验室) ; Digital Media Research Centre GenAI Lab, Queensland University of Technology, Kelvin Grove, QLD 4012, Australia(昆士兰科技大学数字媒体研究中心GenAI实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种多维评估方法,用于评估大语言模型的道德能力,发现现有评估方法存在不足,通过实验揭示LLMs在特定情境下的表现差异。
量子代理:自动化量子模拟
专题命中 其他推理 :reasoning(abstract)
AI总结 El Agente Cuántico通过自然语言接口自动化量子模拟,整合多种模拟范式,提升量子模拟的可扩展性和自主性。