VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments EMNLP 2024 Main
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments NAACL Findings 2024
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
Comments ACL 2024 Workshop
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.LG
Comments Accepted to ICLR2024
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Findings of EMNLP 2023
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
Comments arXiv admin note: text overlap with arXiv:2303.17780
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted as a Tiny Paper at ICLR 2023 (10 pages, 5 figures)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
Comments A benchmark for Video Spatio-Temporal Reasoning
MAVL:面向动画歌曲翻译的多语言音视频歌词数据集
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 提出首个多语言多模态歌词翻译基准MAVL,并设计音节约束的音视频大语言模型SylAVL-CoT,利用音视频线索和音节约束提升歌词可唱性和翻译准确性。
Comments Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。
ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架
机构 * Shenzhen University(深圳大学) ; Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn)
AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。
Comments Accepted by ACM MM 2026, 21 pages, 12 figures
鲁棒推理基准
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出鲁棒推理基准(RRB),通过13种确定性文本扰动评估8种前沿模型,发现Claude在面对变换提示时表现出异常拒绝行为,而开放权重模型在结构噪声下出现多种失败模式,如认知冲刷、分词崩溃和推理崩溃,导致平均准确率下降高达54%。研究进一步发现由模型自身推理链引起的注意力稀释问题,并提出Intra-Query Attention Dilution概念,表明中间推理步骤会污染标准密集注意力机制,未来架构需整合显式上下文重置以实现可靠推理。
大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试
机构 * George Mason University(乔治梅森大学) ; Florida Atlantic University(佛罗里达大西洋大学)
专题命中 推理评测 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。
超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理
机构 * Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。
M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试
机构 * Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; East China Normal University(华东师范大学) ; Zhejiang Provincial People’s Hospital(浙江省人民医院) ; National University of Singapore(新加坡国立大学)
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)
AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。
Comments 39 pages, 8 figures; accepted by ICLR 2026
SciIR:面向科学图像推理生成的大规模训练数据集与基准
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) ; School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) ; Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract)
AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。
Comments Accepted to ECCV 2026
RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测
机构 * Peking University(北京大学) ; Enhans ; University of North Texas(北得克萨斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。
Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation
Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages
通过 HCM-GRPO 实现物理合理性推理:赋能紧凑模型以获得卓越性能
机构 * Tsinghua University(清华大学) ; Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn)
AI总结 针对多模态大语言模型在物理合理性推理中数据缺乏和推理能力弱的问题,提出包含大规模数据集和 HCM-GRPO 方法的完整解决方案,以紧凑模型超越大规模开源和闭源模型。
Skyra:通过 grounded artifact reasoning 实现 AI 生成视频检测
机构 * Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 推理评测 :reasoning(title,title_cn);CoT(abstract)
AI总结 本文提出 Skyra,一种专门用于识别 AI 生成视频中人类可感知的视觉瑕疵的多模态大语言模型,通过这些瑕疵作为基础证据进行检测和解释,同时构建了首个大规模 AI 生成视频瑕疵数据集并提出两阶段训练策略。
Comments Camera Ready Version. Project Page: https://github.com/JoeLeelyf/Skyra
DeepSketcher:内化视觉操作以实现多模态推理
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Meituan Inc(美团) ; Independent Researcher, China(独立研究者)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 DeepSketcher通过构建图像-文本交织数据集和自包含模型,实现了无需外部工具的视觉思考,提升了多模态推理能力。
Comments CVPR2026 FINDINGS
Unreal Thinking: 通过两阶段后门实现链式思维劫持
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)
AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。
Comments 18 pages, 4 figures
AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。
Comments 9 pages
Journal ref LREC 2026
SPR-128K:一种多模态大语言模型空间合理性推理的新基准
机构 * Tsinghua University(清华大学) ; Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。
EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式
机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。
MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。
Comments 14 pages, 10figures