arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10379 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10379 篇

2506.04141 2026-07-21 cs.CV cs.CL 版本更新 87%

MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos

MMR-V:未言明的是什么?视频中多模态深度推理的基准测试

Kejian Zhu, Zhuoran Jin, Hongbang Yuan, Jiachun Li, Shangqing Tu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 针对视频多模态推理挑战,提出MMR-V基准测试,具有长程多帧推理等特点。该基准测试含317个视频和1257个任务,实验发现当前模型多模态推理困难,最佳模型准确率低,现有增强策略收益有限,旨在推动多模态推理能力研究。

Comments Accepted at ICLR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11266 2026-07-14 cs.AI 新提交 87%

Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought

有效≠必要:诊断思维链中的潜在低效率

Daeyeop Lee, Hwanjo Yu

机构 * KT Corporation(KT公司) Pohang University of Science and Technology(浦项科技大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 研究思维链提示中存在的有效但低效推理问题,提出基于信息论的CAID度量,应用于PACE策略,能在保持准确率时减少令牌消耗,成功从推理链中去除冗余信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18610 2026-07-14 cs.CL 版本更新 87%

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化

Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Columbia University(哥伦比亚大学) OPPO AI Center(OPPO人工智能中心) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。

Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新 87%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09033 2026-06-09 cs.CV cs.CL 新提交 87%

CRANE: Knowledge Editing for Reasoning MLLMs

CRANE:面向推理多模态大语言模型的知识编辑

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化研究所模式识别国家重点实验室) Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 针对推理多模态大语言模型在知识编辑中出现的结构崩溃、认知失调和浅层内化三种失败模式,提出检索增强框架CRANE,无需逐编辑参数修改,通过模态感知双库检索系统和两阶段训练策略实现高成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00507 2026-06-02 cs.CL 87%

LaSR: Context-Aware Speech Recognition via Latent Reasoning

LaSR:通过潜在推理实现上下文感知的语音识别

Heyang Liu, Ziyang Cheng, Jiayi Huang, Wenyang Xiao, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出LaSR训练范式,利用潜在推理轨迹增强语音大语言模型的上下文感知能力,在学术术语识别上显著提升性能且不增加延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23085 2026-05-29 cs.AI 87%

When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision-Language Models

当模型学会问为什么:面向可信医疗视觉语言模型的自适应因果推理

Jianxin Lin, Chunzheng Zhu, Peter J. Kneuertz, Yunfei Bai, Yuan Xue

机构 * The Ohio State University(俄亥俄州立大学) Hunan University(湖南大学) Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MedCausalX框架,通过因果推理链、自适应反射架构和轨迹级因果校正,解决医疗VLM中的虚假相关和推理不一致问题,显著提升诊断一致性和减少幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04906 2026-05-26 cs.AI 87%

Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games

Strat-Reasoner:在多智能体游戏中增强大语言模型的战略推理能力

Yidong He, Yutao Lai, Pengxu Yang, Jiarui Gan, Jiexin Wang, Yi Cai, Mengchen Zhao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出Strat-Reasoner框架,通过递归推理范式和集中式思维链比较模块,结合混合优势与组相对强化学习,提升大语言模型在多智能体游戏中的战略推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22012 2026-05-22 cs.CL cs.CV 87%

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解

Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) HKUST(香港科技大学) CASIA(中国科学院自动化研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18827 2026-05-20 cs.IR cs.LG cs.PL 87%

Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds

为小型语言模型引导的推理:评估可执行的多项选择题问答框架

Prateek Biswas, Dhaval Patel, Vedant Khandelwal, Shuxin Lin, Amit Sheth

机构 * IBM New York City,NY(IBM纽约市) University of South Carolina(南卡罗来纳大学) Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院)

专题命中 推理评测 :reasoning(title,summary_cn);分类 cs.LG

AI总结 本文提出Code-Guided Reasoning(CGR)评估协议和生成程序资源,用于衡量可执行推理框架如何提升小型语言模型在多项选择题问答任务中的表现,通过实验展示了使用可执行框架带来的性能提升。

Comments 28 Pages, 18 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14457 2026-05-19 cs.AI 87%

Stateful Reasoning via Insight Replay

通过洞察回放实现状态化推理

Bin Lei, Caiwen Ding, Jiachen Yang, Ang Li, Xin Eric Wang

机构 * University of Minnesota(明尼苏达大学) Simular AI

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出InsightReplay方法,通过回放关键洞察保持推理过程中的重要信息可访问性,提升大语言模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06165 2026-05-08 cs.AI 87%

Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost

事后推理:在不增加成本的情况下提升非思考模型的性能

Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,summary_cn);分类 cs.AI

AI总结 本文提出Post-Reasoning方法,通过在生成最终回答后让模型解释答案,提升指令微调模型的性能,且不增加延迟或token成本,在117种模型-基准设置中提升了88.19%的性能,平均相对提升17.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07830 2026-05-08 cs.AI 87%

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

通过过程可验证的思维数据合成与调度实现时间序列推理

Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出VeriTime框架,通过数据合成、调度和强化学习训练,提升LLM在时间序列推理任务中的性能,使小模型达到或超越大模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17295 2026-04-21 cs.AI 87%

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

LLaTiSA:从视觉感知到语义的难度分层时间序列推理

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) Amap(高德)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07993 2026-04-21 cs.AI 87%

SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models

SkipKV: 为大推理模型高效推理选择性跳过KV生成与存储

Jiayi Tian, Seyedarmin Azizi, Yequan Zhao, Erfan Baghaei Potraghloo, Sean McPherson, Sharath Nittur Sridhar, Zhengyang Wang, Zheng Zhang, Massoud Pedram, Souvik Kundu

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SkipKV方法,通过选择性跳过KV生成与存储,减少缓存大小,提升推理效率。方法引入句子评分指标,动态调整引导向量,实现高效推理,实验显示准确率提升26.7%,生成长度缩短1.6倍,吞吐量提升1.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02733 2026-04-06 cs.AI 87%

DeltaLogic: Minimal Premise Edits Reveal Belief-Revision Failures in Logical Reasoning Models

DeltaLogic: 最小前提编辑揭示逻辑推理模型中的信念修正失败

Amit Dhanda

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,comments);分类 cs.AI

AI总结 DeltaLogic通过最小证据变化评估逻辑推理模型的信念修正能力,发现初始推理能力强并不等于修正行为强,Qwen3-4B在修正任务中仍存在惯性失败,Phi-4-mini-instruct表现更优但仍有非 trivial 抽象问题。

Comments ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03979 2026-02-05 cs.CL 87%

Likelihood-Based Reward Designs for General LLM Reasoning

基于似然的奖励设计用于通用大语言模型推理

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier

机构 * Meta FAIR University of Amsterdam(阿姆斯特丹大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出基于对数概率的奖励设计,用于提升大语言模型在推理任务中的表现,尤其在可验证和不可验证场景中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10118 2025-08-19 cs.LG cs.CV 87%

From Intent to Execution: Multimodal Chain-of-Thought Reinforcement Learning for Precise CAD Code Generation

Ke Niu, Haiyang Yu, Zhuofan Chen, Mengyang Zhao, Teng Fu, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学) ByteDance Inc(字节跳动公司)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09790 2025-06-12 cs.CL cs.CV cs.SE 87%

ComfyUI-R1: Exploring Reasoning Models for Workflow Generation

Zhenran Xu, Yiyu Wang, Xue Yang, Longyue Wang, Weihua Luo, Kaifu Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Alibaba International Digital Commerce(阿里巴巴国际数字商务)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

Comments Work in progress. Try it out in ComfyUI-Copilot https://github.com/AIDC-AI/ComfyUI-Copilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27378 2025-12-02 cs.LG cs.AI cs.CL 87%

Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity

通过忠实性与详尽性衡量推理链的可监控性

Austin Meek, Eitan Sprejer, Iván Arcuschin, Austin J. Brockmeier, Steven Basart

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,comments);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过结合忠实性与详尽性提出新的可监控性评分,评估模型推理链的透明度和可监控性,发现不同模型家族的可监控性差异显著。

Comments Project page at https://ajmeek.github.io/cot_monitorability_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16896 2023-05-29 cs.CL cs.AI cs.LG 87%

MultiTool-CoT: GPT-3 Can Use Multiple External Tools with Chain of Thought Prompting

Tatsuro Inaba, Hirokazu Kiyomaru, Fei Cheng, Sadao Kurohashi

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL2023. Our code is available at https://github.com/InabaTatsuro/MultiTool-CoT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03745 2026-08-05 cs.AI cs.CL 新提交 87%

Risky Business: Measuring The Faithfulness-Safety Tension

危险的业务:测量忠实度与安全性之间的张力

Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 推理评测 :reasoning(abstract,abstract_cn);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07160 2026-04-20 cs.AI cs.LG 87%

AscendKernelGen: A Systematic Study of LLM-Based Kernel Generation for Neural Processing Units

AscendKernelGen: 一种针对神经处理单元的LLM基内核生成系统研究

Xinzi Cao, Jianyang Zhai, Pengfei Li, Zhiheng Hu, Cen Yan, Bingxu Mu, Guanghuan Fang, Bin She, Jiayu Li, Yihan Su, Dongyang Tao, Xiansong Huang, Fan Xu, Feidiao Yang, Yao Lu, Chang-Dong Wang, Yutong Lu, Weicheng Xue, Bin Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Huawei(华为) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AscendKernelGen框架,通过引入Ascend-CoT数据集和KernelGen-LM模型,提升NPU内核生成效率与正确性,实验显示复杂内核编译成功率从0%提升至95.5%。

Comments 33 pages,7 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09088 2026-01-15 cs.LG cs.CL 87%

Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning

面向优越长链推理的分布对齐序列蒸馏

Shaotian Yan, Kaiyuan Liu, Chen Shen, Bing Wang, Sinan Fan, Jun Zhang, Yue Wu, Zheng Wang, Jieping Ye

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 推理评测 :reasoning(title,abstract);CoT(title);分类 cs.CL、cs.LG

AI总结 本文提出DASD-4B-Thinking模型,通过改进序列蒸馏方法,实现高效推理性能,仅用448K样本达到SOTA效果。

Comments Project Page: https://github.com/D2I-ai/dasd-thinking

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01236 2025-10-03 cs.CL cs.LG 87%

GRPO++: Enhancing Dermatological Reasoning under Low Resource Settings

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque

机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.CL、cs.LG

Comments Will be submitted at IEEE JBHI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05221 2025-08-08 cs.CV cs.AI cs.LG 87%

ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking

Xiao Wang, Liye Jin, Xufeng Lou, Shiao Wang, Lan Chen, Bo Jiang, Zhipeng Zhang

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22992 2025-07-01 cs.AI cs.CL cs.CV 87%

MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning

Yulun Jiang, Yekun Chai, Maria Brbić, Michael Moor

机构 * EPFL(苏黎世联邦理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);planning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11819 2024-02-05 cs.CL cs.AI 87%

SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese

Liang Xu, Hang Xue, Lei Zhu, Kangkang Zhao

专题命中 推理评测 :reasoning(title,abstract);math reasoning(title);分类 cs.CL、cs.AI

Comments Dataset revised and finalized, results updated with new model; 8 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12527 2026-07-07 eess.AS 版本更新 87%

Audio-Cogito: Towards Deep Audio Reasoning in Large Audio Language Models

Audio-Cogito:迈向大型音频语言模型中的深度音频推理

Longhao Li, Hongjie Chen, Zehan Li, Qihan Hu, Jian Kang, Jie Li, Lei Xie, Yongxiang Li

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出Audio-Cogito,通过开发Cogito-pipe数据集和自蒸馏策略,提升音频推理能力,在MMAR基准和Interspeech 2026挑战中表现优异。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12628 2026-05-26 cs.CV 87%

Creative4U: MLLMs-based Advertising Creative Image Selector with Comparative Reasoning

Creative4U: 基于MLLMs的广告创意图像选择器与比较推理

Yukang Lin, Xiang Zhang, Shichang Jia, Bowen Wan, Chenghan Fu, Xudong Ren, Yueran Liu, Wanxian Guan, Pengji Wang, Jian Xu, Bo Zheng, Baolin Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出基于多模态大语言模型的创意图像评估与选择范式,通过构建比较推理数据集CreativePair和强化学习方法Creative4U,实现可解释的创意选择。

详情

展开后加载摘要…

URL PDF HTML 收藏