arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2503.01064 2025-03-04 cs.CL cs.AI cs.CV 76%

Scientific Reasoning: Assessment of Multimodal Generative LLMs

Florian Dreyer, Ekaterina Kolos, Daria Matiash

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11014 2024-07-17 cs.CL cs.AI cs.MA 76%

Geode: A Zero-shot Geospatial Question-Answering Agent with Explicit Reasoning and Precise Spatio-Temporal Retrieval

Devashish Vikas Gupta, Azeez Syed Ali Ishaqui, Divya Kiran Kadiyala

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15269 2024-06-19 cs.CL cs.AI cs.IR 76%

Improving Medical Reasoning through Retrieval and Self-Reflection with Retrieval-Augmented Large Language Models

Minbyul Jeong, Jiwoong Sohn, Mujeen Sung, Jaewoo Kang

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

Comments ISMB 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18369 2023-10-31 cs.CL cs.AI cs.CV 76%

Apollo: Zero-shot MultiModal Reasoning with Multiple Experts

Daniela Ben-David, Tzuf Paz-Argaman, Reut Tsarfaty

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI

Comments GitHub: https://github.com/danielabd/Apollo-Cap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05428 2026-07-08 cs.DL cs.AI 新提交 76%

CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science

CHARLIE:用于法医学证据推理的本地多智能体检索增强生成系统

Leandro D. Carneiro, Andre L. S. Meirelles, Juliano de A. Gomes, Rafael C. A. Cabral

机构 * Forensic Institute, Civil Police of Federal District, Brazil(巴西联邦区刑事研究所) University of Brasília, Brazil(巴西巴西利亚大学)

专题命中 复杂问题求解 :reasoning(title,comments);分类 cs.AI

AI总结 介绍用于法医学证据推理的本地多智能体检索增强生成系统CHARLIE,通过结合多种机制应对取证挑战,在机构内运行维护数据主权等,经案例研究验证其能支持证据工作流程,为高风险取证环境部署AI系统提供蓝图。

Comments 10 pages, 1 figure. Archival version of a paper presented at RELAF 2026: 1st Workshop on Reasoning with Evidence in Law Enforcement and Forensics, co-located with ICAIL 2026, Singapore, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交 75%

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19236 2026-06-18 cs.LG cs.AI cs.CL 新提交 75%

STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability

STARE: 基于惊讶度的令牌级优势重加权以实现策略熵稳定性

Haipeng Luo, Qingfeng Sun, Songli Wu, Can Xu, Wenfeng Deng, Han Hu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Hunyuan(腾讯 Hunyuan)

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对GRPO等RL算法中策略熵崩溃问题,提出STARE方法,通过惊讶度分位数识别熵关键令牌并重加权其优势,结合目标熵闭环门控稳定熵,在1.5B-32B模型和多种任务上实现稳定训练,AIME24/25准确率提升4%-8%。

Comments LLM, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25719 2026-06-02 eess.AS 75%

Step-Audio-R1.5 Technical Report

Step-Audio-R1.5 技术报告

Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun Chen, Qingjian Lin, Haoyang Zhang, Yuxin Li, Jinglan Gong, Yechang Huang, Liang Zhao, Chengyuan Yao, Hexin Liu, Eng Siong Chng, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV 75%

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21676 2026-03-24 cs.LG cs.AI cs.CL 75%

Thinking Deeper, Not Longer: Depth-Recurrent Transformers for Compositional Generalization

深入而非冗长:用于组合泛化的深度递归变压器

Hung-Hsuan Chen

机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家中央大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度递归变压器,通过在潜在空间中迭代应用共享权重的Transformer块,使模型在推理时能通过增加推理步骤来实现更深层次的推理。在三个组合推理领域中,该方法展示了计算前沿和不同泛化行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15726 2026-03-18 cs.CL cs.AI cs.IR cs.LG 75%

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

MiroThinker-1.7 与 H1:通过验证实现重型研究代理

MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, L. Wang, L. Wang, S. Wang, X. Wang, Y. Zhang, Z. Zhang, G. Chen, L. Chen, Z. Cheng, Y. Deng, Z. Huang, D. Ng, J. Ni, Q. Ren, X. Tang, B. L. Wang, H. Wang, N. Wang, C. Wei, Q. Wu, J. Xia, Y. Xiao, H. Xu, X. Xu, C. Xue, Z. Yang, Z. Yang, F. Ye, H. Ye, J. Yu, C. Zhang, W. Zhang, H. Zhao, P. Zhu

机构 * MiroMind Team(MiroMind团队)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MiroThinker-1.7和H1,通过结构化规划和验证机制提升多步推理能力,在复杂任务中实现高效可靠的研究代理。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21900 2026-03-10 cs.SD eess.AS 75%

EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs

EmoOmni:弥合情感理解与表达在多模态大语言模型中的鸿沟

Wenjie Tian, Zhixian Zhao, Jingbin Hu, Huakang Chen, Haohe Liu, Binshen Mu, Lei Xie

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) University of Surrey, Guildford, United Kingdom(萨里大学,Guildford,英国)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 EmoOmni通过引入情感链式思维机制,提升多模态情感对话中的理解与表达能力,构建了评估基准并验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 75%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01004 2026-02-03 cs.CV 75%

SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning

SRVAU-R1: 通过反射感知学习增强视频异常理解

Zihao Zhao, Shengting Cao, Muchao Ye

机构 * The University of Iowa(艾奥瓦大学) Knox College(克诺克斯学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10228 2026-01-16 cs.CV cs.MM eess.IV 75%

Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge

优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案

Sicheng Yang, Yukai Huang, Shitong Sun, Weitong Cai, Jiankang Deng, Jifei Song, Zhensong Zhang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。

Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23568 2025-12-30 cs.CV 75%

ThinkGen: Generalized Thinking for Visual Generation

ThinkGen: 用于视觉生成的通用思考

Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Bytedance Home(字节跳动)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21481 2025-12-29 cs.MA 75%

The AI Committee: A Multi-Agent Framework for Automated Validation and Remediation of Web-Sourced Data

AI委员会:一种多智能体框架,用于自动验证和修复网络来源的数据

Sunith Vallabhaneni, Thomas Berkane, Maimuna Majumder

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 AI委员会是一种多智能体框架,通过自动化验证和修复网络数据集,提升数据质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16970 2025-12-22 cs.AI cs.CL cs.LG cs.MA 75%

PAACE: A Plan-Aware Automated Agent Context Engineering Framework

PAACE:一种计划感知的自动代理上下文工程框架

Kamer Ali Yuksel

机构 * Kamer Ali Yuksel(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PAACE通过计划感知的上下文工程框架提升LLM代理的准确性并减少上下文负载,实现高效多步骤任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08645 2025-12-10 cs.CV 75%

Chain-of-Image Generation: Toward Monitorable and Controllable Image Generation

图像生成链:迈向可监控和可控的图像生成

Young Kyung Kim, Oded Schlesinger, Yuzhou Zhao, J. Matias Di Martino, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Universidad Católica del Uruguay(乌拉圭天主教大学) Apple(苹果公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04195 2025-12-01 cs.CR 75%

AutoPatch: Multi-Agent Framework for Patching Real-World CVE Vulnerabilities

AutoPatch:多智能体框架用于修补现实世界中的CVE漏洞

Minjae Seo, Wonwoo Choi, Myoungsung You, Seungwon Shin

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 AutoPatch通过多智能体框架高效修补LLM生成代码中的CVE漏洞,实现高准确率和低成本的漏洞修复

Comments 19 pages, double column, 9 figures. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14222 2025-12-01 cs.AI cs.CL cs.LG stat.OT 75%

A Survey on Large Language Model-based Agents for Statistics and Data Science

关于基于大型语言模型的统计与数据科学代理的综述

Maojun Sun, Ruijian Han, Binyan Jiang, Houduo Qi, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。

Journal ref Am. Statist. (2025) 1-14

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21323 2025-11-18 cs.CR 75%

LLM-driven Provenance Forensics for Threat Investigation and Detection

Kunal Mukherjee, Murat Kantarcioglu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16366 2025-10-08 cs.CL cs.AI cs.CR cs.LG 75%

A Generative Approach to LLM Harmfulness Mitigation with Red Flag Tokens

David Dobre, Mehrnaz Mofakhami, Sophie Xhonneux, Leo Schwinn, Gauthier Gidel

机构 * Université de Montréal(蒙特利尔大学) Mila(Mila研究所) Technical University of Munich(慕尼黑技术大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15809 2025-09-26 cs.CV 75%

MMaDA: Multimodal Large Diffusion Language Models

Ling Yang, Ye Tian, Bowen Li, Xinchen Zhang, Ke Shen, Yunhai Tong, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Peking University(北京大学) Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments NeurIPS 2025. Project: https://github.com/Gen-Verse/MMaDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11737 2025-08-19 cs.CV cs.AI cs.CL cs.LG 75%

Ovis2.5 Technical Report

Shiyin Lu, Yang Li, Yu Xia, Yuwei Hu, Shanshan Zhao, Yanqing Ma, Zhichao Wei, Yinglun Li, Lunhao Duan, Jianshan Zhao, Yuxuan Han, Haijun Li, Wanying Chen, Junke Tang, Chengkun Hou, Zhixing Du, Tianli Zhou, Wenjie Zhang, Huping Ding, Jiahe Li, Wen Li, Gui Hu, Yiliang Gu, Siran Yang, Jiamang Wang, Hailong Sun, Yibo Wang, Hui Sun, Jinlong Huang, Yuping He, Shengze Shi, Weihong Zhang, Guodong Zheng, Junpeng Jiang, Sensen Gao, Yi-Feng Wu, Sijia Chen, Yuhui Chen, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12678 2025-05-27 cs.LG cs.AI cs.CL 75%

Multi-Step Alignment as Markov Games: An Optimistic Online Gradient Descent Approach with Convergence Guarantees

Yongtao Wu, Luca Viano, Yihang Chen, Zhenyu Zhu, Kimon Antonakopoulos, Quanquan Gu, Volkan Cevher

专题命中 复杂问题求解 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15612 2025-05-22 cs.CL cs.AI cs.LG 75%

Learn to Reason Efficiently with Adaptive Length-based Reward Shaping

Wei Liu, Ruochen Zhou, Yiyun Deng, Yuzhen Huang, Junteng Liu, Yuntian Deng, Yizhe Zhang, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Waterloo(多伦多大学) Apple(苹果公司)

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18945 2025-04-29 cs.RO 75%

Generative AI in Embodied Systems: System-Level Analysis of Performance, Efficiency and Scalability

Zishen Wan, Jiayi Qian, Yuhang Du, Jason Jabbour, Yilun Du, Yang Katie Zhao, Arijit Raychowdhury, Tushar Krishna, Vijay Janapa Reddi

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);self-correction(abstract)

Comments 2025 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00294 2025-04-02 cs.LG cs.AI cs.CL 75%

Inference-Time Scaling for Complex Tasks: Where We Stand and What Lies Ahead

Vidhisha Balachandran, Jingya Chen, Lingjiao Chen, Shivam Garg, Neel Joshi, Yash Lara, John Langford, Besmira Nushi, Vibhav Vineet, Yue Wu, Safoora Yousefi

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13402 2025-03-18 cs.NI 75%

Toward Generative 6G Simulation: An Experimental Multi-Agent LLM and ns-3 Integration

Farhad Rezazadeh, Amir Ashtari Gargari, Sandra Lagen, Houbing Song, Dusit Niyato, Lingjia Liu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 6 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏