Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset
HLE多项选择子集的维度与测量精度
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
HLE多项选择子集的维度与测量精度
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。
谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能
机构 * Amazon(亚马逊)
专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。
Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet
PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。
PCAP-LM:一种用于TLS批量流量分析的LLM原生文本表示
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对LLM分析TLS流量时的上下文窗口溢出问题,提出PCAP-LM表示,实现812倍压缩,在取证问答任务中准确率达99.3%,但存在TCP重传24%漏检等局限。
Comments 6 pages
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
MMHBench:用于长视频心理健康理解的多视角基准测试集
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。
从零开始多智能体编码中作为一等公民的协作模式的实证研究
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建多智能体编码基准MSEval,发现组织拓扑与模型能力对速度-成本-质量权衡影响相当,结构化流水线表现最优,为多智能体软件开发评估提供严格标准。
手语问答:手语理解的新任务、基准与基线模型
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
通过功能、证据和验证评估智能体生物信息学
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验
机构 * Jinling Institute of Technology(金陵科技学院) ; College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。
Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation
VISTA:一种用于日常协助的生成性眼动视频框架
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。
Comments pre-print
LLM2Vec-Gen:从大型语言模型生成嵌入向量
机构 * McGill University(麦吉尔大学) ; Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ; ServiceNow Research(ServiceNow研究院) ; Cohere ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。
Comments Accepted to COLM 2026
GradMAP: 更快的层剪枝与梯度度量和投影补偿
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。
Comments 19 pages
EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
视觉-语言模型能否对图像中的AI编辑进行推理?
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM Research(IBM研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。
LoMeVQA:纵向医学视觉问答综合基准
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。
Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA
PanDent:面向牙科放射学中全面的牙级结构-语言一致性
机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) ; Imperial College London(帝国理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。
OwlPath:面向大语言模型漏洞修复的无损知识压缩
专题命中 推理评测 :reasoning(abstract)
AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
KuaiSearch: 一个大规模电商平台搜索数据集用于召回、排序和相关性
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出KuaiSearch,首个涵盖召回、排序和相关性评估的大型电商平台搜索数据集,通过真实用户交互数据提升电商搜索研究的准确性与实用性。
DocPrism:代码与文档间错误不一致性的多语言检测
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出轻量级多语言代码-文档不一致性检测工具DocPrism,通过LCEF方法降低标记率、提升F1分数,在多语言真实场景中表现优于现有技术。
Comments 22 pages. To appear in Proceedings of the ACM on Software Engineering, Volume 3, ISSTA 2026
位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为
机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) ; School of UEMK Kolkata(UEMK Kolkata学院) ; Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) ; Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。
基于推理增强语言模型的网络安全检测分类
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG
AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。
学会选择,而非重新学习:硬路由推理LoRA混合
机构 * Halmstad University(哈尔姆斯塔德大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。
Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora
ARES:面向PPA和成本感知的LLM智能体RTL优化的自适应推理力度调控
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ARES是一款面向PPA和成本感知的LLM智能体RTL优化框架,通过自适应调控推理力度,在相同成本下提升优化效果,缩小了LLM生成与手工优化单元的差距。
Comments 7 pages, 6 figures
理性中的混沌:思维链大语言模型(LLMs)如何探寻答案
专题命中 其他推理 :chain-of-thought(title)
AI总结 本研究将非线性动力学与混沌理论工具应用于思维链LLMs,证实其存在混沌标志性特征,明确各Transformer子模块对扰动的作用,揭示其与典型混沌系统的结构相似性及分形特性,指出注意力机制诱导的非线性耦合是混沌行为的关键驱动因素。
Comments 16 pages 17 figures
诱导语言模型断言自身意识可恢复人类信念与价值观
机构 * Google(谷歌) ; University of Chicago(芝加哥大学) ; University of London(伦敦大学) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学) ; Santa Fe Institute(圣达菲研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。