arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-03 至 2026-03-03 共收录 259 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 34 篇

2602.11909 2026-03-03 cs.SD cs.LG 79%

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Echo:通过音频交错推理实现高级音频理解

Daiqing Wu, Xuan Zhang, Dongbao Yang, Jiashu Yao, Longfei Chen, Qingsong Liu, Sicheng Zhao, Can Ma, Yangyang Kang, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Zhejiang University(浙江大学) ByteDance China(字节跳动中国) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16448 2026-03-03 cs.AI 79%

The First Impression Problem: Internal Bias Triggers Overthinking in Reasoning Models

首次印象问题:内部偏见触发推理模型中的过度思考

Renfei Dang, Zhening Li, Shujian Huang, Jiajun Chen

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了推理模型中过度思考的根源,发现内部偏见是导致过度思考的关键因素,并通过实验验证了偏见对推理过程的影响。

Comments ICLR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01545 2026-03-03 cs.CV 78%

Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory

无需训练的时空解耦推理视频分割与自适应对象记忆

Zhengtong Zhu, Jiaqing Fan, Zhixuan Liu, Fanzhang Li

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出无需训练的时空解耦推理视频分割方法SDAM,通过自适应对象记忆模块和时空解耦技术实现稳定的时间传播,优于现有微调方法。

Comments Accept by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00437 2026-03-03 cs.CV 78%

Self-Correction Inside the Model: Leveraging Layer Attention to Mitigate Hallucinations in Large Vision Language Models

模型内部的自我校正:利用层注意力缓解大视觉语言模型中的幻觉

April Fu

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :self-correction(title,abstract)

AI总结 本文提出了一种利用层注意力的内部自我校正机制,通过自我细化提高大视觉语言模型的视觉接地性,有效缓解幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04355 2026-03-03 cs.CL cs.AI 73%

LLM-ProS: Analyzing Large Language Models' Performance in Competitive Problem Solving

LLM-ProS: 分析大语言模型在竞争性问题解决中的性能

Md Sifat Hossain, Anika Tabassum, Md. Fahim Arefin, Tarannum Shaila Zaman

机构 * Department of Information Systems, University of Maryland, Baltimore County, Maryland, USA(信息系统系,马里兰大学巴尔的摩县分校,马里兰州,美国)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 LLM-ProS评估了多种大语言模型在ICPC问题中的性能,揭示了模型在泛化、适应和解决新问题方面的差异,并探讨了训练方法和数据集对性能的影响。

Comments To be published in LLM4Code 2025 workshop proceedings

Journal ref 2025 IEEE/ACM International Workshop on Large Language Models for Code (LLM4Code)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10760 2026-03-03 q-bio.BM cs.AI 70%

FROGENT: An End-to-End Full-process Drug Design Multi-Agent System

FROGENT:一种端到端的全流程药物设计多智能体系统

Qihua Pan, Dong Xu, Qianwei Yang, Jenna Xinyi Yao, Sisi Yuan, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FROGENT通过多智能体系统整合药物发现全流程,利用LLM能力提升效率与准确性,减少人工干预。

Comments 37 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00846 2026-03-03 cs.IR cs.LG 70%

Tiny-Critic RAG: Empowering Agentic Fallback with Parameter-Efficient Small Language Models

Tiny-Critic RAG:赋能代理回退的参数高效小型语言模型

Yichao Wu, Penghao Liang, Yafei Xiang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan

机构 * Northeastern University(东北大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 Tiny-Critic RAG通过参数高效的Small Language Model实现低延迟的二进制路由,有效降低代理部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00532 2026-03-03 cs.AI 70%

DenoiseFlow: Uncertainty-Aware Denoising for Reliable LLM Agentic Workflows

DenoiseFlow:面向可靠LLM代理工作流的不确定性感知去噪

Yandong Yan, Junwei Peng, Shijie Li, Chenxi Li, Yifei Shang, Can Deng, Ruiting Dai, Yongqiang Zhao, Jiaqi Zhu, Yu Huang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) SKLCCSE, School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Key Laboratory of High Confidence Software Technologies(PKU), MOE(北京大学高可信软件技术重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心)

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 DenoiseFlow通过闭环框架实现多步推理的不确定性感知去噪,提升LLM代理工作流的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00123 2026-03-03 cs.CV cs.AI 70%

CT-Flow: Orchestrating CT Interpretation Workflow with Model Context Protocol Servers

CT-Flow: 通过模型上下文协议服务器协调CT解释工作流

Yannian Gu, Xizhuo Zhang, Linjie Mu, Yongrui Yu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University, Shanghai, China(清元研究院,上海交通大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Sensetime Research, Shanghai, China(senseTime研究院,上海,中国)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 CT-Flow通过模型上下文协议实现3D CT解释工作流的动态协调,提升诊断准确性和工具调用效率。

Comments submitting to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20278 2026-03-03 cs.LG cs.AI cs.CL 67%

Characterizing Pattern Matching and Its Limits on Compositional Task Structures

刻画模式匹配及其在组合任务结构中的限制

Hoyeon Chang, Jinho Park, Hanseul Cho, Sohee Yang, Miyoung Ko, Hyeonbin Hwang, Seungpil Won, Dohaeng Lee, Youbin Ahn, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究中心) UCL(伦敦大学学院) LG AI Research(LG人工智能研究)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过形式化模式匹配为函数等价性,分析LLMs在组合任务中的泛化能力及其限制,揭示路径模糊性对模型性能的影响,并提出链式思维的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23040 2026-03-03 cs.CL cs.AI 62%

Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents

回望以推导前行:用于长上下文LLM代理的可回溯记忆

Yaorui Shi, Yuxin Chen, Siyuan Wang, Sihang Li, Hengxing Cai, Qi Gu, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) DP Technology(DP科技) Meituan(美团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ReMemR1通过整合记忆检索机制和多级奖励设计,提升长上下文问答任务的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00055 2026-03-03 cs.LG cs.AI 62%

M3-AD: Reflection-aware Multi-modal, Multi-category, and Multi-dimensional Benchmark and Framework for Industrial Anomaly Detection

M3-AD:面向工业异常检测的反思-aware 多模态、多类别和多维基准与框架

Chao Huang, Yanhui Li, Yunkang Cao, Wei Wang, Hongxi Huang, Jie Wen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hunan University(湖南大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 M3-AD提出了一种反思-aware 的多模态框架,通过RA-Monitor提升工业异常检测的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06502 2026-03-03 cs.AI 57%

DRAGON: LLM-Driven Decomposition and Reconstruction Agents for Large-Scale Combinatorial Optimization

DRAGON:基于大语言模型的分解与重建代理用于大规模组合优化

Shengkai Chen, Zhiguang Cao, Jianan Zhou, Yaoxin Wu, Senthilnath Jayavelu, Zhuoyi Lin, Xiaoli Li, Shili Xiang

机构 * Institute for Infocomm Research A STAR Singapore Singapore Management University Singapore Nanyang Technological University Singapore Eindhoven University of Technology Eindhoven Netherlands National University of Singapore \& Institute for Infocomm Research A STAR Singapore Singapore University of Technology Institute for Infocomm Research Singapore Management University Nanyang Technological University Eindhoven University of Technology National University of Singapore \& Institute for Infocomm Research

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DRAGON是一种结合元启发式设计和LLM推理的新型框架,通过分解与重建代理实现大规模组合优化问题的高效求解。

Comments This paper has been accepted for presentation and publication at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), source code: https://github.com/skychan/DARGON

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06005 2026-03-03 cs.CL 57%

MASA: Rethinking the Representational Bottleneck in LoRA with Multi-A Shared Adaptation

MASA:重新思考LoRA中的表示瓶颈问题:多A共享适应

Qin Dong, Yuntian Tang, Heming Jia, Yunhang Shen, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Shaohui Lin, Rongrong Ji

机构 * East China Normal University(华东师范大学) Sanming University(三明大学) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing of Ministry of Education of China, Xiamen University, China(中国教育部高效计算实验室,厦门大学,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MASA通过多A共享适应架构提升LoRA在多领域泛化和多任务推理中的表现,实现更高准确率

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23166 2026-03-03 cs.CL 57%

Test-Time Policy Adaptation for Enhanced Multi-Turn Interactions with LLMs

测试时策略适应用于增强基于LLM的多轮交互

Chenxing Wei, Hong Wang, Ying He, Fei Yu, Yao Shu

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) University of Science(科学技术大学) Carleton University(卡尔顿大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 本研究提出测试时策略适应方法,通过用户反馈优化多轮交互策略,提升LLM在长时间对话中的表现。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22050 2026-03-03 cs.CL 57%

DeepSieve: Information Sieving via LLM-as-a-Knowledge-Router

DeepSieve: 通过LLM作为知识路由器实现信息筛分

Minghao Guo, Qingcheng Zeng, Xujiang Zhao, Yanchi Liu, Wenchao Yu, Mengnan Du, Haifeng Chen, Wei Cheng

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) NEC Laboratories America(NEC美国实验室) NJIT(新泽西理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DeepSieve通过LLM作为知识路由器实现信息筛分,提升多跳问答任务的推理深度、检索精度和可解释性。

Comments Accepted by EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00923 2026-03-03 cs.CL 57%

Hybrid Neural-LLM Pipeline for Morphological Glossing in Endangered Language Documentation: A Case Study of Jungar Tuvan

混合神经-大语言模型管道在濒危语言文档中的形态学 glossing:朱加尔图瓦语案例研究

Siyu Liang, Talant Mawkanuli, Gina-Anne Levow

机构 * Department of Linguistics, University of Washington(语言学系,华盛顿大学) Department of Middle Eastern Languages and Cultures, University of Washington(中东语言与文化系,华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种混合神经-大语言模型管道,用于朱加尔图瓦语的形态学 glossing,通过结合神经序列标注和 LLM 后修正,显著减少标注工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL 57%

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15852 2026-03-03 cs.CV cs.AI 57%

Advancing Complex Video Object Segmentation via Progressive Concept Construction

通过渐进式概念构建推进复杂视频对象分割

Zhixiong Zhang, Shuangrui Ding, Xiaoyi Dong, Songxin He, Jianfan Lin, Junsong Tang, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) CPII under InnoHK(InnoHK下的CPII)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SeC通过渐进式概念构建方法,在复杂视频对象分割任务中实现了显著性能提升,特别是在语义复杂场景下的表现优于现有方法。

Comments project page: https://rookiexiong7.github.io/projects/SeC/ ; code: https://github.com/OpenIXCLab/SeC ; dataset: https://huggingface.co/datasets/OpenIXCLab/SeCVOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00126 2026-03-03 cs.CV cs.AI cs.IR cs.MM cs.PF cs.SY eess.SY 57%

QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference

QuickGrasp: 通过加速分词和边缘增强推理实现响应式视频-语言查询服务

Miao Zhang, Ruixiao Zhang, Jianxin Shi, Hengzhi Wang, Hao Fang, Jiangchuan Liu

机构 * School of Computing Science, Simon Fraser University(计算科学学院,西蒙弗雷泽大学) Computer Science Department, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校) College of Cryptology and Cyber Science, Nankai University(密码学与网络科学学院,南开大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 QuickGrasp通过加速分词和边缘增强推理,实现响应式视频-语言查询服务,兼顾准确性和响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00120 2026-03-03 cs.MA cs.AI 57%

SIGMAS: Second-Order Interaction-based Grouping for Overlapping Multi-Agent Swarms

SIGMAS:基于二次交互的多智能体群集分组

Minah Lee, Saibal Mukhopadhyay

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 SIGMAS通过二次交互建模实现多智能体群集的自监督分组,准确恢复潜在群体结构并平衡个体与集体动态。

Comments Accepted at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04366 2026-03-03 cs.HC cs.MM 50%

Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction

向人类专家对齐多模态大语言模型:聚焦亲子互动

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。

Comments Accepted at CHI 2026 Full Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 50%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 61 篇

2510.04040 2026-03-03 cs.AI 89%

FaithCoT-Bench: Benchmarking Instance-Level Faithfulness of Chain-of-Thought Reasoning

FaithCoT-Bench: 对链式推理实例级忠实度的基准测试

Xu Shen, Song Wang, Zhen Tan, Laura Yao, Xinyu Zhao, Kaidi Xu, Xin Wang, Tianlong Chen

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 FaithCoT-Bench提出了一种统一的基准,用于评估链式推理在实例级的忠实度,通过专家标注的轨迹和系统评估揭示了现有方法的优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01783 2026-03-03 cs.CV 89%

Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing

在多模态大语言模型中利用链式推理进行人脸反伪装

Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He

机构 * Didi Chuxing(滴滴出行) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

AI总结 本文提出FaceCoT数据集和CEPL策略,通过链式推理提升多模态大语言模型在人脸反伪装中的鲁棒性和性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06749 2026-03-03 cs.CV cs.AI cs.CL cs.LG 87%

Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models

Vision-R1: 促进多模态大语言模型推理能力的激励方法

Wenxuan Huang, Bohan Jia, Zijie Zhai, Shaosheng Cao, Zheyu Ye, Fei Zhao, Zhe Xu, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Vision-R1通过构建高质量多模态CoT数据集和渐进性思维抑制训练策略,提升多模态推理能力,在数学推理基准中取得显著成绩。

Comments Accepted to ICLR 2026. Code is available at https://github.com/Osilly/Vision-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00889 2026-03-03 cs.CL cs.AI 86%

CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning

CHIMERA:紧凑的合成数据用于通用的LLM推理

Xinyu Zhu, Yihao Feng, Yanchao Sun, Xianzhi Du, Pingzhi Li, Olli Saarikivi, Yun Zhu, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Apple(苹果公司) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 CHIMERA通过紧凑的合成数据集提升LLM跨领域推理能力,提供丰富推理轨迹和结构化覆盖,实现高效训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24119 2026-03-03 cs.AI cs.CL cs.LG 85%

SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning

SPIRAL:通过多智能体多轮强化学习进行零和游戏的自我对战以促进推理

Bo Liu, Leon Guertler, Simon Yu, Zichen Liu, Penghui Qi, Daniel Balcells, Mickel Liu, Cheston Tan, Weiyan Shi, Min Lin, Wee Sun Lee, Natasha Jaques

机构 * National University of Singapore(新加坡国立大学) Northeastern University(东北大学) Sea AI Lab(Sea AI 实验室) Centre for Frontier AI Research (CFAR), A*STAR(前沿人工智能研究中心(CFAR),A*STAR) Plastic Labs University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPIRAL通过多智能体多轮强化学习在零和游戏中促进推理,展示了模型在多个基准测试中的显著性能提升。

Comments Accepted at ICLR 2026. Code: https://github.com/spiral-rl/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01353 2026-03-03 cs.LG cs.AI cs.CL 85%

Constructing Synthetic Instruction Datasets for Improving Reasoning in Domain-Specific LLMs: A Case Study in the Japanese Financial Domain

构建合成指令数据集以提升领域特定大语言模型的推理能力:以日本金融领域为例

Yuma Okochi, Fabio Milentiansen Sim, Tomoyasu Okada

机构 * Nomura Research Institute, Ltd.(摩根士丹利研究机构)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种通用方法,通过构建合成指令数据集提升领域特定大语言模型的推理能力,并在金融领域进行了验证。

Comments 8 pages, 2 figures. Japanese version published in NLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03135 2026-03-03 cs.CV cs.AI cs.CL 84%

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏