PathMMU: A Massive Multimodal Expert-Level Benchmark for Understanding and Reasoning in Pathology
专题命中 推理评测 :reasoning(title)
Comments 27 pages, 12 figures
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title)
Comments 27 pages, 12 figures
专题命中 推理评测 :reasoning(title)
专题命中 推理评测 :reasoning(title)
Comments ICLR 2023
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG;logical reasoning(comments)
Comments Logical reasoning, soft Horn rules, Transformers, pre-trained language models, combining symbolic and probabilistic methods, BERT
Journal ref EMNLP-2021
评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。
用于大规模推荐解释的LLM评判模型的生命周期
机构 * Netflix(网飞公司)
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。
CACSurv:基于大型语言模型的一致性对齐比较学习用于癌症生存预测
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 该研究针对癌症生存预测中LLM时间回归的公式与监督不匹配问题,提出CACSurv框架,构建TCGA-SurvReport基准,在6个TCGA癌症队列上的平均C指数达0.722,显著优于现有模型与基线。
通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估
机构 * University of Central Lancashire(中央兰开夏大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。
MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.AI
AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。
Comments 10 pages, 6 figures
OmnilingualGAIA2:评估前沿AI智能体的多语言差距
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 研究人员推出OmnilingualGAIA2基准,发现前沿AI智能体存在8.8-18.4分的跨语言差距,提出多语言评估应成为全球部署智能体的标准评估环节。
PROSLEX:印度司法领域专家标注的法律条文预测新型数据集
机构 * IISER Kolkata(印度科学教育与研究学院加尔各答分校) ; Utrecht University(乌得勒支大学) ; IIT Kharagpur(印度理工学院克勒格布尔分校) ; University of Birmingham Dubai(伯明翰大学迪拜分校) ; WBNUJS(西孟加拉邦国家法律大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文针对法律条文预测研究中缺乏可解释性的问题,构建印度司法领域专家标注的PROSLEX数据集,评估多种提示策略,为可解释法律AI提供基准。
谁来验证基准?去中心化大语言模型评估中的信任问题
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 针对LLM基准测试的信任问题,该研究分析7种验证模型的身份感知偏差,提出基于区块链的提交-披露协议以实现去中心化、可验证的LLM评估。
Comments Accepted to International Conference on Quantum Enhanced AI and Secure Computing (QASC2026)
ActiveFly-Bench:将具身问答与视觉-语言-动作对齐用于空中具身感知
机构 * Tsinghua University(清华大学) ; Manifold AI(流形人工智能)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 介绍用于无人机具身感知的ActiveFly-Bench基准测试,它分解主动感知为三个层次任务,收集数据集,开发集成视觉语言推理与细粒度控制的ActiveFly智能体,实验表明当前无人机智能体有困难,该基准成为具身空中智能新测试平台。
Med-CRAFT:通过知识图谱遍历自动构建可解释的多跳视频工作负载
机构 * Beijing Institute of Technology(北京理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 推理评测 :reasoning(abstract);CoT(abstract_cn);分类 cs.AI
AI总结 Med-CRAFT通过知识图谱遍历自动构建可解释的多跳视频工作负载,生成具有细粒度时间选择性和多跳逻辑复杂性的医疗视频推理基准。
Comments 23 pages, 4 figures, 10 tables
语言模型作为任务特定知识库:一种可解释性分析
机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院) ; Google Research(谷歌研究院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 通过行为和机制分析,发现语言模型以任务特定方式编码知识,不同任务对同一事实的查询结果不一致,且参数定位实验揭示了不同任务涉及不同参数子集。
并非双关:基于对比学习与音义嵌入的多智能体文字游戏翻译
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究结合大型语言模型与语言约束,提出三种双关语翻译方法,其多智能体系统在CLEF JOKER 2025竞赛中获专家评估第一,可改善文字游戏翻译效果。
CITBench:面向大语言模型的交互式表格数据处理综合基准
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。
面向对话摘要的大规模多维度LLM实证研究
机构 * CCSE, Beihang University(北京航空航天大学CCSE) ; MAIS, CASIA(中国科学院自动化研究所MAIS) ; Fanyu AI Laboratory(帆禹AI实验室)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL
AI总结 提出OmniCSEval基准,包含1800个跨六场景的对话,评估28个LLM在对话摘要中的完整性、简洁性和忠实性,揭示推理能力与模型规模的影响。
Comments 21 pages, 18 figures
当LLM停止遵循步骤:语言模型中程序执行的诊断研究
机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈丁加尔)
专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 本研究通过构建受控诊断基准,评估大型语言模型在程序执行任务中的忠实性,发现随着步骤增加准确率从63%降至20%,并揭示了缺失答案、过早答案、自我修正和执行不完整等失败模式。
Comments 24 pages, 19 figures, 4 Tables
MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。
Comments 17 pages, 5 figures, and 13 tables
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。
LAMUS:利用LLMs构建大规模美国判例法法律论证语料库
机构 * University of North Texas(北卡罗来纳大学达顿分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 LAMUS利用LLMs构建大规模美国判例法法律论证语料库,通过数据驱动方法提升法律NLP研究的可扩展性和实证支持。
Comments This article has been peer reviewed and formally published in the Journal of Computational Law and Legal Technology (JCLLT). The final Version of Record is available at: https://doi.org/10.47852/bonviewJCLLT62029649
一种用于使冻结的语言模型智能体学习领域的控制系统、数据集和方法
机构 * Meta AI
专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI
AI总结 研究如何让冻结的语言模型智能体学习领域,核心方法是将框架视为特定动作空间,用经典强化学习在线学习策略并以多目标奖励评分,贡献包括用DSPy实例化系统并评估,还发布相关代码、任务套件、训练日志及部署方法。
Comments 8 pages, 1 figure, 3 tables. Code and dataset: https://github.com/dpaul0501/context-optimization-rl
一种基于共识的大语言模型相对偏好评估框架
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。
Comments 14 pages, 7 figures
一种通过受控扰动验证的结构化音频字幕评估框架
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 研究针对结构化音频字幕评估难的问题,提出多轴评估框架,结合大语言模型判断与计算指标,在五个正交轴上评估,通过受控扰动测试协议验证可靠性,能区分释义与损坏。
Comments submitted to DCASE 2026
AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试
机构 * Renmin University of China(中国人民大学) ; Anhui University(安徽大学) ; Z-Lab Z.ai ; Tsinghua University(清华大学) ; Bosch Center for AI(博世人工智能中心) ; University of Oslo(奥斯陆大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。
Comments 9 pages, accepted by KDD 2026
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea
跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准
机构 * University of Minnesota(明尼苏达大学)
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI
AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。
用于生物医学领域研究主题本体生成的资源高效语言模型基准测试
机构 * Knowledge Media Institute, The Open University, Milton Keynes, UK(开放大学知识媒体研究所) ; Department of Business and Law, University of Milano-Bicocca, Milan, IT(米兰-比科卡大学商业与法律系)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文评估五个小型开源LLMs识别生物医学概念语义关系的性能,引入MeSH-Rel-4K数据集并分析三种策略,发现针对性微调使平均F1分数显著提高,突破推理瓶颈,为构建生物医学本体提供准确自动化方法。
SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。
Comments Preprint. 10 pages, 6 figures, 4 tables
JobHop v2:一个来自非结构化简历的大规模职业轨迹数据集
机构 * AIDA-IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(AIDA-ID实验室,电子与信息系统系,根特大学,根特,比利时) ; AIDA-IDLab, Department of Electronics(AIDA-ID实验室,电子系) ; Information Systems, Ghent University, Ghent, Belgium(信息系统,根特大学,根特,比利时)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 该研究提出JobHop v2数据集,通过端到端大语言模型从大量简历中提取职业轨迹。它扩大了覆盖范围与注释丰富度,引入新提取管道、模式及评估协议,最好提取器接近注释者间一致性上限,数据集和代码公开助力职业轨迹研究。