Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?
多模态大语言模型是否需要推理来从语音中分类痴呆症?
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
多模态大语言模型是否需要推理来从语音中分类痴呆症?
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文评估了多模态大语言模型在自动痴呆症分类中的推理能力,发现基于文本理由的策略会导致幻觉和不一致,并提出DeTAiL框架,通过非线性适配器和强化学习利用内部表示,在两个数据集上优于基线方法。
PixelEyes: 解耦感知与推理以实现精准视觉证据查找
机构 * Wuhan University(武汉大学) ; UC Merced(加州大学默塞德分校) ; UTS(UTS大学) ; NUS(新加坡国立大学) ; NTU(南洋理工大学) ; CASIA(中国科学院自动化所)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对多轮视觉推理中目标定位失败导致轨迹冗余的问题,提出PixelEyes,通过解耦推理与感知(推理器决定查找目标,专用感知工具定位),引入掩码引导视觉搜索和语义区域广度优先搜索,构建PixelEyes-6K数据集和Pinpoint-Bench基准,显著提升定位准确性。
Comments 22pages, 10 figures
文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。
Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io
CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; Khalifa University(哈利法大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。
TimeProVe: 先提出后验证,实现日常活动中的高效长视频时间推理
机构 * University of North Carolina, Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出TimeProVe框架,先通过轻量模块生成基于动作的候选假设,再调用昂贵VLM验证,在长视频问答中降低75%VLM调用和93%推理成本,性能提升7.3%。
ERQA-Plus:具身AI推理的诊断基准
机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出ERQA-Plus基准,包含1766个基于机器人中心图像的问答实例,覆盖感知、动作、社交、导航和常识推理,用于诊断具身AI的推理能力。
Comments under review at NeurIPS
面向手术室视频的推理式文本-视频检索:基于动作驱动数字孪生
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出OR3方法,通过动作驱动数字孪生(ActDT)将视频片段转化为结构化表示,并利用大语言模型生成假设ActDT进行检索,结合证据修正实现隐式查询推理,在手术室视频检索中显著优于基线。
基于数字孪生表示的强化学习训练LLMs用于推理密集型手术视频问答
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出强化学习框架,通过手术基础模型构建数字孪生表示,解耦视觉感知与推理,并引入分层表示与新型奖励,在三个基准上取得最优性能。
时间盲:使用CHRONOSIGHT基准测试视觉语言模型的时间推理能力
机构 * Department of Computer Science, University of Missouri(密苏里大学计算机科学系) ; SAP
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出CHRONOSIGHT基准,从五个维度评估视觉语言模型的时间推理能力,发现模型与人类存在巨大差距(人类平均0.89,最佳模型0.40),并通过微调显著提升性能。
铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。
Comments 45 pages. https://icml.cc/virtual/2026/poster/63682
Journal ref ICML 2026
面向鲁棒上下文推理的博弈论多智能体控制方法在LLMs中的应用
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对LLMs在多轮交互中易受提示注入和上下文投毒攻击的问题,提出GT-MCP方法,通过博弈论多智能体控制和自愈机制,将上下文漂移限制在99.6%的轮次内,且控制器级注入攻击零成功。
用于诊断推理模型中未知未知的结构化无知证书的校准
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出结构化无知证书(SICs)输出格式,通过GRPO微调14B模型,使模型在无法回答时明确承认知识缺失并生成检索查询,在未知未知问题上实现99.46%的JSON有效性和0.967的证书特异性分数。
Comments Accepted in ICML 2026 Workshop: Epistemic Intelligence in Machine Learning
超越预测:EHR集成临床AI中的纵向推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文分析当代临床AI系统如何集成电子健康记录数据及其支持纵向临床推理的程度,提出编码框架,发现系统主要基于单次就诊或聚合表示,缺乏跨时间推理,并建议未来系统应更符合临床实践的时间与解释结构。
WorldBench: 一个具有挑战性且视觉多样的多模态推理基准
机构 * Princeton University(普林斯顿大学) ; NYU(纽约大学) ; University of Waterloo(滑铁卢大学) ; Meta, FAIR(Meta和FAIR)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。
Comments Project page: https://worldbench-vl.github.io/
人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行
专题命中 推理评测 :reasoning(title,comments);分类 cs.CL、cs.AI
AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。
Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution
Gaokerena:一个小型波斯语医疗语言模型家族
机构 * University of Isfahan(伊斯法罕大学) ; University of Tehran(德黑兰大学) ; University of Windsor(温莎大学) ; Alzahra University(阿勒扎哈拉大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 针对波斯语医疗语言模型研究不足的问题,该研究推出Gaokerena家族,包含Gaokerena-V和Gaokerena-R两款模型,在医疗问答基准上取得性能提升,还配备不确定性头,为本地化数字医疗提供基础但仍需完善。
Comments 29 pages, 9 figures
比较还是不比较:论评估社会偏见的方法论实践
机构 * Tsinghua University(清华大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。
ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI
AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。
Comments 10pages,4figures
用大型语言模型模拟学生的Java编程错误
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 探索用LLM模拟学生编程错误,评估五种模型在多样性和对齐性上的表现,发现Claude Sonnet 4平衡最佳,且合成错误与真实错误难以区分。
OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。
HALO:语言模型的混合自适应潜在推理
机构 * Lockheed Martin(洛克希德·马丁公司)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 研究如何用少量自适应计算改进预训练语言模型,提出HALO混合自适应潜在细化方法,结合粗略与选择性第二阶段细化。在基准比较中,HALO成绩最佳,使用细化步骤少,兼具更好的细化分配,计算量也少。
Comments 15 pages, 4 figures, preprint
基于评分量表的专家级临床推理任务中前沿语言模型的受控比较
机构 * Prime Analytics Consulting Limited(普林特分析咨询有限公司) ; Talbert House(塔尔伯特大楼;托马斯·莫尔大学) ; Thomas More University(MAKZ) ; MAKZ
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 通过5个专家编写的临床场景和加权评分量表,评估GPT、Claude和Gemini三个前沿模型,发现关键标准通过率低(32-42%),而低权重标准通过率高(80-90%),52%的关键标准无模型通过。
Comments 13 pages, 4 tables
MacroLens:宏观经济情景下的多任务上下文金融推理基准
机构 * KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。
Comments 25 pages, 3 figures
SmellCC:一种用于自动修复代码异味的工具
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。
JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。
LeAct:从专家行动中学习推理
机构 * Princeton University(普林斯顿大学)
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。
Comments 27 pages, 3 figures, 11 tables
使用确定性真实数据评估长文本生成中语言模型的不确定性
机构 * Technion(技术学院) ; Nvidia(英伟达)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT
通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差
机构 * York University(约克大学) ; University of Guelph(圭尔夫大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。
Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)
超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。
Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026
超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计
机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。
Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author