AI Security Leaderboard: Methodology, Results and Minimal Standard
AI安全排行榜:方法、结果与最低标准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AI安全排行榜:方法、结果与最低标准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。
OSReward:为跨平台计算机使用奖励模型建立标准化评估
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考
Comments Work in progress
低频陷阱:视频语言模型在简单事件记录上的失败
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。
LangChoiceBench:测量与解释大语言模型中的编程语言选择
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究推出LangChoiceBench基准,评估25种LLMs的代码语言选择,发现其普遍过度选择Python、一致性低,小开放模型偏好更强,还揭示了模型的虚假证据等失败模式。
Comments 19 pages, 9 tables, 2 figures
EpiBench:大型语言模型能否为抗体药物发现表位?
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。
ECG-LENS:导联感知且融入临床上下文的心电图报告生成与评估
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ECG-LENS框架,结合多导联信号建模等技术实现心电图报告生成,还提出F1-ECGBERT指标评估报告,实验显示其在PTB-XL和MIMIC-IV-ECG上性能优于现有最优方法。
M$^3$R-Bench:一个用于基于证据的多模态隐喻理解的统一基准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文提出多模态隐喻理解基准M$^3$R-Bench,针对现有模型的跨模态证据-映射不匹配问题,构建M$^3$R-Reasoner方法,在多指标上超越GPT-5.5等现有模型。
Comments 6 figures and 5 tables. Hong Jiang, Junnan Zhu, and Jingwang Huang contributed equally. Jiang Zhong and Kaiwen Wei are corresponding authors. Code and data are available at https://github.com/hongshi4/M3R-Bench
从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试
机构 * School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。
Comments Preprints
无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图
机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Hewlett Packard Enterprise(惠普企业)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。
Comments 16 pages, 5 figures, 10 tables
提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试
机构 * PointFive
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。
提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。
Compliance2LoRA:通过超网络生成的LoRA适配器对任意策略子集进行按需安全对齐
机构 * University of Maryland College Park(马里兰大学帕克分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 Compliance2LoRA是一种自适应超网络框架,可通过生成LoRA适配器,在单个大型推理模型上实现对任意安全策略子集的按需对齐,且不牺牲任务性能。
HoloCount:用于多模态大语言模型的整体视觉计数基准
机构 * Meituan(美团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型定量精度瓶颈及现有计数基准局限,引入HoloCount基准,从语义、分析计数和鲁棒性测试三方面评估模型,经对20多个模型详尽评估,揭示其性能差距,为多模态系统发展提供路线图。
Comments Technical report
BioAgent Bench: 一个用于生物信息学的AI代理评估套件
机构 * Entropic
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。
Comments ICML 2026 camera ready
文本生成:关于任务、评估与挑战的系统文献综述
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该系统综述梳理2017-2025年257篇论文,划分文本生成五大任务,评估三类方法,指出任务特有与共有的9项挑战,为NLP领域不同阶段研究者提供领域概览与研究方向参考。
Comments Published in the Journal of Artificial Intelligence Research (JAIR)
基于CT合成数据生成框架的患者姿态评估
机构 * Institute for Neuro- and Bioinformatics, University of Lübeck(吕贝克大学神经与生物信息学研究所) ; University Medical Center Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医学中心) ; IMAGE Information Systems Europe GmbH(IMAGE信息系统欧洲有限公司) ; Pattern Recognition Company GmbH(模式识别有限公司)
专题命中 推理评测 :planning(abstract)
AI总结 该研究提出基于CT的合成数据生成框架,用于解决放射图像患者姿态评估中真实训练数据获取难的问题,经3077对踝关节图像预训练后,真实踝关节姿态评估性能提升最多11个百分点。
Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:027
Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)
TAU-Bench:从异常实例跟踪到细粒度视频异常理解
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。
使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。
Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026
SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络
机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) ; College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。
SOVABench:多模态大语言模型的车辆监控动作检索基准
机构 * Milestone Systems A/S(Milestone Systems公司) ; Universitat de Barcelona(巴塞罗那大学) ; Computer Vision Center(计算机视觉中心) ; Aalborg Universitet(奥胡斯大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 SOVABench为多模态大语言模型提供车辆监控动作检索基准,通过定义两种评估协议评估跨动作区分和时间方向理解,展示了模型在复杂监控任务中的性能。
Comments This work has been accepted at Real World Surveillance: Applications and Challenges, 6th (in WACV Workshops)
面向第一人称视角助手的视觉意图定位
机构 * National University of Singapore(新加坡国立大学) ; Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。
上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。
判断-结果差距:医疗决策中的大语言模型道德推理
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究发现LLMs在医疗决策中存在判断-结果差距,即虽认同患者对危害健康行为负有责任,但拒绝将该判断用于稀缺医疗资源分配,且随推理能力提升会放大与人类的道德分歧。
Comments Accepted at AIES 2026
关于大语言模型中条件PAC有效推理不可能性的注记
机构 * Department of Statistics and Data Science(统计与数据科学系)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究证明了在无分布设定下,大语言模型无法实现条件PAC有效推理,指出任何满足此条件的算法必须依赖专家模型。
世界到手腕:面向精细机器人操作的任务条件未来手腕建模
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学) ; Sun Yat-sen University(中山大学) ; Xidian University(西安电子科技大学) ; Southeast University(东南大学)
专题命中 其他推理 :CoT(summary_cn,abstract)
AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。
从痕迹中推理:分歧引导的智能体修复WebAssembly差异
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出WasmMend系统,通过差分痕迹分析定位Wasm与原生执行的分歧函数,引导LLM智能体生成补丁,在真实C/C++项目上修复率达70.0%,优于基线方法。
SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。
Comments Code: https://github.com/GaryStack/Parallel-RL
面向INT2 KV缓存量化的输出感知旋转
机构 * University of Southern California(南加州大学) ; Seoul National University(首尔大学) ; Inha University(仁荷大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对长上下文大模型KV缓存的INT2量化瓶颈,提出OptR输出感知旋转方法,通过分解误差、学习正交修正等,提升QuaRot等性能并增强长上下文检索能力,且开销可忽略。
通过混合利益相关者协商确定警务AI的风险边界
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究通过包含社区代表、警察和学者的混合利益相关者协商研讨会,评估13个警务AI用例的种族偏见风险,发现多数参与者支持AI采用,仅拒绝3个用例,强调种族公平可优化AI风险-收益分析。
Comments Accepted to AIES 2026
仅追踪所需:面向长文档问答的结构感知按需超图记忆
机构 * University of New South Wales(新南威尔士大学) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; University of Wollongong(伍伦贡大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。