arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-12 至 2026-03-12 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 6 篇

2603.07181 2026-03-12 cs.CV 86%

FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation

自由飞行-思考:将链式推理对齐连续无人机导航

Jiaxu Zhou, Shaobo Wang, Zhiyuan Yang, Zhenjun Yu, Tao Li

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title)

AI总结 FreeFly-thinking是一种端到端的无人机视觉-语言导航框架,通过链式推理提升导航性能,实现了在复杂户外环境中的高效导航。

Comments 10 pages, 5 figures, ECCV review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14482 2026-03-12 cs.CV cs.AI 79%

TikArt: Stabilizing Aperture-Guided Fine-Grained Visual Reasoning with Reinforcement Learning

TikArt: 通过强化学习稳定引导孔细粒度视觉推理

Hao Ding, Zhichuan Yang, Weijie Ge, Ziqin Gao, Chaoyi Lu, Lei Zhao

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TikArt通过强化学习引导孔机制提升细粒度视觉推理,结合语言推理与Zoom、Segment操作,实现多模态证据获取与持久记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10370 2026-03-12 cs.CV 78%

GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning

GeoSense: 内化几何必要性感知以实现多模态推理

Ruiheng Liu, Haihong Hao, Mingfei Han, Xin Gu, Kecheng Zhang, Changlin Li, Xiaojun Chang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GeoSense通过内化几何必要性感知,提升多模态推理的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV 78%

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10052 2026-03-12 cs.RO cs.LG 57%

OmniGuide: Universal Guidance Fields for Enhancing Generalist Robot Policies

OmniGuide: 通用引导场用于增强通用机器人策略

Yunzhou Song, Long Le, Yong-Hyun Park, Jie Wang, Junyao Shi, Lingjie Liu, Jiatao Gu, Eric Eaton, Dinesh Jayaraman, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 OMNIGUIDE通过整合多种引导源提升通用机器人策略在复杂任务中的性能

Comments Project Page: $\href{https://omniguide.github.io/}{this\; url}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 50%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 4 篇

2603.10887 2026-03-12 cs.LG cs.AI 84%

Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models

动态预测采样用于主动强化学习微调大推理模型

Yixiu Mao, Yun Qu, Qi Wang, Heming Zou, Xiangyang Ji

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 DPS通过动态预测方法减少回放成本,提升大推理模型的强化学习微调效率与性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10359 2026-03-12 cs.AI cs.LG 81%

HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation

HEAL: 通过回顾熵辅助学习进行推理蒸馏

Wenjing Zhang, Jiangze Yan, Jieyun Huang, Yi Shen, Shuming Shi, Ping Chen, Ning Wang, Zhaoxiang Liu, Kai Wang, Shiguo Lian

机构 * Data Science & AI Research Institute, China Unicom(中国unicom数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国unicom数据智能)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 HEAL通过引入熵辅助学习和三阶段蒸馏策略,有效提升推理蒸馏效果,优于传统方法。

Comments 11 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10195 2026-03-12 cs.CL cs.AI cs.LG 67%

Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Models

适应性激活取消:用于大语言模型幻觉抑制的适应性激活取消

Eric Yocam, Varghese Vaidyan, Gurcan Comert, Paris Kalathas, Yong Wang, Judith L. Mwakalonge

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出适应性激活取消方法,通过实时干预减少大语言模型的幻觉问题,同时保持模型性能和生成质量。

Comments 19 pages, 8 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10299 2026-03-12 cs.LG 57%

Regime-aware financial volatility forecasting via in-context learning

基于情境学习的领域感知金融波动预测

Saba Asaad, Shayan Mohajer Hamidi, Ali Bereyhi

机构 * Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种基于情境学习的领域感知金融波动预测方法,通过条件采样策略提升非平稳市场下的预测性能。

Comments 11 pages, 1 figure, Published as a conference paper at ICLR 2026 Workshop on Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 5 篇

2603.10294 2026-03-12 eess.SY cs.AI cs.SY 85%

Simulation-in-the-Reasoning (SiR): A Conceptual Framework for Empirically Grounded AI in Autonomous Transportation

推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架

Wuping Xin

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10877 2026-03-12 cs.CL 57%

From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers

从图像到词语:高效的跨模态知识蒸馏用于从黑盒教师模型向语言模型转移

Ayan Sengupta, Shantanu Dixit, Md Shad Akhtar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, India(印度德里印度理工学院) Indraprastha Institute of Information Technology Delhi, India(印度德里印度信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ARMADA框架,通过高效的跨模态知识蒸馏方法,从黑盒视觉-语言模型向语言模型转移知识,实现性能提升且无需昂贵预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10210 2026-03-12 cs.CV cs.AI 57%

Delta-K: Boosting Multi-Instance Generation via Cross-Attention Augmentation

Delta-K: 通过交叉注意力增强提升多实例生成

Zitong Wang, Zijun Shen, Haohao Xu, Zhengjie Luo, Weibin Wu

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Nanjing University(南京大学) College of Management and Economics, Tianjin University(天津大学管理学院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 Delta-K通过在交叉注意力键空间中直接操作,解决扩散模型在多实例生成中的概念遗漏问题,提升生成质量且无需额外训练或架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10091 2026-03-12 cs.CR cs.AI 57%

Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference

多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐

Fan Yang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10343 2026-03-12 eess.SP 50%

Multi-Modal Intelligent Channel Modeling: From Fine-tuned LLMs to Pre-trained Foundation Models

多模态智能信道建模:从微调大语言模型到预训练基础模型

Lu Bai, Zengrui Han, Mingran Sun, Xiang Cheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 30 篇

2603.09993 2026-03-12 cs.CL cs.AI 81%

CEI: A Benchmark for Evaluating Pragmatic Reasoning in Language Models

CEI:一种评估语言模型隐含推理能力的基准

Jon Chun, Hannah Sussman, Adrian Mangine, Murathan Kocaman, Kirill Sidorko, Abhigya Koirala, Andre McCloud, Gwen Eisenbeis, Wisdom Akanwe, Moustapha Gassama, Eliezer Gonzalez Chirinos, Anne-Duncan Enright, Peter Dunson, Tiffanie Ng, Anna von Rosenstiel, Godwin Idowu

机构 * Kenyon College(肯尼恩学院) US NIST AI Consortium(美国NIST人工智能联合体) Schmidt Science HAVI(施密特科学HAVI)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CEI基准通过300个经人类验证的场景评估语言模型在处理隐含意义复杂语句时的歧义消除能力,涵盖讽刺、混合信号等五种隐含子类型,采用三种权力配置进行测试。

Comments 38 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25426 2026-03-12 cs.AI cs.LG 81%

RADAR: Reasoning-Ability and Difficulty-Aware Routing for Reasoning LLMs

RADAR: 为推理LLM进行推理能力与难度感知的路由

Nigel Fernandez, Branislav Kveton, Ryan A. Rossi, Andrew S. Lan, Zichao Wang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RADAR通过推理能力与难度感知路由,实现对不同查询的高效模型选择,提升推理性能与可扩展性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10814 2026-03-12 cs.CV 80%

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

HanMoVLM:用于专业艺术绘画评估的大型视觉-语言模型

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学) CSE, Shandong University(山东大学计算机科学与工程学院) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 HanMoVLM通过引入HanMo-Bench数据集和链式推理机制,实现专业艺术绘画评估,提升中国绘画生成质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 79%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10793 2026-03-12 cs.CL 79%

Multilingual Reasoning Gym: Multilingual Scaling of Procedural Reasoning Environments

多语言推理健身房:多语言的程序化推理环境扩展

Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali

机构 * Apple(苹果公司) Hasso Plattner Institute & ELLIS Unit Potsdam(霍普夫研究所与波茨坦ELLIS单元)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Multilingual Reasoning Gym通过多语言程序化生成可验证推理问题,支持跨语言大规模数据生成和强化学习研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10175 2026-03-12 eess.AS cs.CL 79%

Calibration-Reasoning Framework for Descriptive Speech Quality Assessment

描述性语音质量评估的校准-推理框架

Elizaveta Kostenok, Mathieu Salzmann, Milos Cernak

机构 * EPFL(苏黎世联邦理工学院) Logitech(洛吉科技)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出校准-推理框架,通过强化学习优化提升语音质量评估的多维描述和缺陷定位精度。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10852 2026-03-12 cs.CV 78%

UltrasoundAgents: Hierarchical Multi-Agent Evidence-Chain Reasoning for Breast Ultrasound Diagnosis

超声波智能体:用于乳腺超声诊断的层次多智能体证据链推理

Yali Zhu, Kang Zhou, Dingbang Wu, Gaofeng Meng

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学(大学层面)交叉学科学院,北京,中国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong(人工智能与机器人中心,香港创新科学研究院,中国科学院,香港)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UltrasoundAgents通过层次多智能体框架实现乳腺超声诊断中的证据链推理,提升诊断准确性和证据可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 74%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10101 2026-03-12 cs.LG cs.AI cs.CL 67%

CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVR

CLIPO: 在策略优化中通过对比学习推广RLVR

Sijia Cui, Pengyu Cheng, Jiajun Song, Yongbo Gai, Guojun Zhang, Zhechao Yu, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba Institute of Automation, Chinese Academy of Sciences(文勤大模型应用团队,阿里巴巴自动化研究所,中国科学院) Qwen Large Model Application Team, Alibaba(文勤大模型应用团队,阿里巴巴)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CLIPO通过对比学习机制改进RLVR,提升大语言模型的策略优化泛化与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 67%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08935 2026-03-12 cs.CV cs.AI cs.CL cs.DL cs.IR 62%

PathoScribe: Transforming Pathology Data into a Living Library with a Unified LLM-Driven Framework for Semantic Retrieval and Clinical Integration

PathoScribe: 将病理数据转化为一个活的图书馆:一种统一的LLM驱动框架,用于语义检索和临床整合

Abdul Rehman Akbar, Samuel Wales-McGrath, Alejadro Levya, Lina Gokhale, Rajendra Singh, Wei Chen, Anil Parwani, Muhammad Khalid Khan Niazi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PathoScribe通过统一的LLM框架实现病理数据的语义检索与临床整合,提升病理档案的活用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10303 2026-03-12 cs.CL cs.AI 62%

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

这个想法是否新颖?一种自动化的判断研究想法新颖性的基准

Tim Schopf, Michael Färber

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RINoBench基准,用于评估研究想法新颖性判断,发现LLM生成的推理与人类相似但判断不准确。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01313 2026-03-12 cs.CL cs.AI 62%

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

评估多方协作对话的长周期记忆

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafeng Deng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EverMemBench,首个评估多方协作对话长周期记忆的基准,揭示当前系统在多跳推理、时间推理和记忆意识方面的局限性。

Comments 25 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23499 2026-03-12 cs.CV cs.CL cs.LG 62%

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

多模态数据光谱:多模态数据集是多维的

Divyam Madaan, Varshan Muhunthan, Kyunghyun Cho, Sumit Chopra

机构 * New York University(纽约大学) GenentechCIFAR(基因泰克CIFAR) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。

Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum

详情

展开后加载摘要…

URL PDF HTML 收藏