arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-07 至 2026-04-07 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 39 篇

2604.04871 2026-04-07 cs.SE 50%

StatsClaw: An AI-Collaborative Workflow for Statistical Software Development

StatsClaw:统计软件开发的AI协作工作流

Tianzhu Qin, Yiqing Xu

专题命中 规划推理 :planning(abstract)

AI总结 StatsClaw通过多智能体架构实现统计软件开发的可靠自动化,通过信息隔离机制确保代码生成与验证的独立性,提升软件生命周期的工程效率并保持研究人员对方法学的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04722 2026-04-07 cs.CV 50%

Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs

不要浪费比特!面向轻量级设备LLM的自适应KV缓存量化

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Patrick Woods, Gabriel Hillesheim, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出自适应KV缓存量化方法,通过动态调整token重要性分配比特数,减少内存和延迟并提升准确性。

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20669 2026-04-07 physics.app-ph cond-mat.mtrl-sci 50%

Integrating Domain-Specialized Language Models with AI Measurement Tools for Deterministic Atomic-Resolution Experimentation

将领域专用语言模型与AI测量工具整合用于确定性原子分辨率实验

Zhuo Diao, Kouma Matsumoto, Linfeng Hou, Masahiro Ohara, Hayato Yamashita, Masayuki Abe

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种框架,通过专门的小语言模型实现扫描探针显微镜的自主控制,结合AI驱动的测量工具,实现室温下的原子分辨率SPM实验,提升实验可靠性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03790 2026-04-07 cs.CR 50%

Systematic Integration of Digital Twins and Constrained LLMs for Interpretable Cyber-Physical Anomaly Detection

数字孪生与约束性大语言模型的系统整合用于可解释的网络物理异常检测

Konstantinos E. Kampourakis, Vasileios Gkioulos, Sokratis Katsikas

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种结合确定性启发法与约束性大语言模型的混合检测方法,用于实时检测工业控制系统中的异常,通过数字孪生保持过程同步并生成行为描述,验证了该方法在四个典型攻击场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03505 2026-04-07 cs.CV 50%

Multimodal Urban Tree Detection from Satellite and Street-Level Imagery via Annotation-Efficient Deep Learning Strategies

通过高效深度学习策略实现多模态城市树木检测:结合卫星和街景图像

In Seon Kim, Ali Moghimi

机构 * Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) Department of Biological and Agricultural Engineering, University of California, Davis(加州大学戴维斯分校生物与农业工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出多模态框架,结合高分辨率卫星图像与地面Google街景图像,实现低标注条件下城市树木的高效检测。通过领域自适应和三种学习策略(半监督、主动学习、混合策略),提升检测精度,混合策略F1-score达0.90,显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13095 2026-04-07 cs.RO 50%

Empowering Multi-Robot Cooperation via Sequential World Models

通过序列世界模型增强多机器人协作

Zijie Zhao, Honglei Guo, Shengqian Chen, Kaixuan Xu, Bo Jiang, Yuanheng Zhu, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出SeqWM框架,通过引入序列范式提升多机器人MBRL的协作能力,实验表明其在性能和样本效率上优于现有方法,并展示了预测适应、时间对齐和角色分配等先进协作行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 15 篇

2508.13998 2026-04-07 cs.RO cs.AI cs.LG 81%

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

Embodied-R1:强化的具身推理用于通用机器人操作

Yifu Yuan, Haiqin Cui, Yaoting Huang, Yibin Chen, Fei Ni, Zibin Dong, Pengyi Li, Yan Zheng, Hongyao Tang, Jianye Hao

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Embodied-R1,通过引入指向作为统一的中间表示,结合强化微调方法,实现通用机器人操作中的具身推理,展示了在多个基准测试中的卓越性能和零样本泛化能力。

Comments Embodied-R1 technical report v2; Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 78%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03696 2026-04-07 cs.CV 71%

FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

FunFact:通过因子图推理构建概率性功能3D场景图

Zhengyu Fu, René Zurbrügg, Kaixian Qu, Marc Pollefeys, Marco Hutter, Hermann Blum, Zuria Bauer

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)

专题命中 视觉空间推理 :reasoning(title)

AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04299 2026-04-07 cs.CV cs.AI 70%

A Persistent Homology Design Space for 3D Point Cloud Deep Learning

3D点云深度学习中的持久同调设计空间

Prachi Kudeshia, Jiju Poovvancheri, Amr Ghoneim, Dong Chen

机构 * Saint Mary's University, Halifax, Canada(圣玛丽大学(哈利法克斯,加拿大)) Nanjing Forestry University, China(南京林业大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出一个统一的设计空间,将持久同调用于3D点云学习,通过六个注入点将拓扑学作为结构诱导偏差,提升分类和分割的准确性与鲁棒性。

Comments 27 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04908 2026-04-07 cs.LG 57%

HI-MoE: Hierarchical Instance-Conditioned Mixture-of-Experts for Object Detection

HI-MoE:基于实例的混合专家架构用于目标检测

Vadim Vashkelis, Natalia Trukhina

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 HI-MoE提出一种分层实例条件混合专家架构,通过两级路由机制提升目标检测效率,尤其在小目标检测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 57%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 57%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28733 2026-04-07 cs.LG 57%

See it to Place it: Evolving Macro Placements with Vision-Language Models

看清它,放置它:利用视觉-语言模型进行宏放置

Ikechukwu Uchendu, Swati Goel, Karly Hou, Ebrahim Songhori, Kuang-Huei Lee, Joe Wenjie Jiang, Vijay Janapa Reddi, Vincent Zhuang

机构 * Harvard University(哈佛大学) Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用视觉-语言模型进行芯片布局中的宏放置优化,通过进化搜索策略提升放置质量,在9/10基准上优于现有方法,且能泛化至分析型布局器。

Comments 31 pages, 12 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00851 2026-04-07 cs.SE 50%

Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding

大语言模型在设计综合中的可靠性:方差、提示敏感性和方法框架的实证研究

Rabia Iftikhar, Andreas Rausch

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究探讨大语言模型在设计综合中的可靠性,通过方差、提示敏感性和方法框架的实证分析,评估三种LLM在不同提示策略下的表现,发现偏好对齐虽提升设计意图符合度,但无法消除非确定性,模型行为影响设计可靠性。

Journal ref International Conference on Software Architecture 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04009 2026-04-07 cs.SE 50%

Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding

对软件架构图理解的VLMs基准测试与评估

Shuyin Ouyang, Jie M. Zhang, Jingzhi Gong, Gunel Jahangirova, Mohammad Reza Mousavi, Jack Johns, Beum Seuk Lee, Adam Ziolkowski, Botond Virginas, Joost Noppen

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 50%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03334 2026-04-07 cs.CV 50%

Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis

弥合维度差距:2D视觉模型适应3D分析的分类与综述

Akshat Pandya, Bhavuk Jain

机构 * Independent Researcher(独立研究员)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述了将2D视觉模型适应3D分析的策略,分类为数据导向、架构导向和混合方法,探讨了计算复杂度、预训练依赖性和几何归纳偏置的权衡。

Comments VISAPP 2026

Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications - Volume 3: VISAPP 2026; ISBN 978-989-758-804-4; ISSN 2184-4321, SciTePress, pages 353-364

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09573 2026-04-07 cs.CV 50%

More than the Sum: Panorama-Language Models for Adverse Omni-Scenes

全景语言模型:超越拼接的全景场景理解

Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) Shenzhen University(深圳大学) UCL(伦敦大学学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。

Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14336 2026-04-07 cs.CV 50%

ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding

ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型

Bohan Zhang, Yiyi Miao, Taoyu Wu, Tong Chen, Ji Jiang, Zhuoxiao Li, Zhe Tang, Limin Yu, Jionglong Su

机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。

Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 7 篇

2604.02007 2026-04-07 cs.LG 83%

Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning

阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理

Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin

机构 * ServiceNow

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。

Comments 20 pages, 4 tables, 6 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08659 2026-04-07 cs.CL 79%

CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning

CODA:面向自适应推理的难度感知计算分配

Siye Wu, Jian Xie, Yikai Zhang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04373 2026-04-07 cs.AI cs.LG 79%

Decocted Experience Improves Test-Time Inference in LLM Agents

解毒经验提升LLM代理的测试时间推理

Maohao Shen, Kaiwen Zha, Zexue He, Zhang-Wei Hong, Siru Ouyang, J. Jon Ryu, Prasanna Sattigeri, Suhas Diggavi, Gregory Wornell

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23850 2026-04-07 cs.AI cs.CL cs.LG 67%

The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models

向下钻探与伪造测试(DDFT):一种衡量语言模型认知鲁棒性的协议

Rahul Baxi

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DDFT协议,用于评估语言模型在语义压缩和对抗性伪造下的认知鲁棒性,发现鲁棒性与传统设计无关,且错误检测能力是关键瓶颈。

Comments This version strengthens the theoretical and empirical grounding of the CI metric, including explicit analysis of structural dependencies and ranking stability under ablations (e.g., excluding Turn 4). Claims regarding scale and robustness are revised to avoid overgeneralization. The evaluation protocol, jury methodology, and limitations are expanded to clarify assumptions and boundary conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01895 2026-04-07 cs.CV 67%

Automated Wildfire Damage Assessment from Multi view Ground level Imagery Via Vision Language Models

基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型

Miguel Esparza, Archit Gupta, Kai Yin, Yiming Xiao, Ali Mostafavi

机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 62%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 18 篇

2604.04325 2026-04-07 cs.CL 83%

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

多轮医学诊断基准测试:Hold、Lure 和 Self-Correction

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai, Ying Ding, Yuji Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03679 2026-04-07 cs.CL cs.AI cs.IR cs.LG cs.MM 82%

LightThinker++: From Reasoning Compression to Memory Management

LightThinker++:从推理压缩到内存管理

Yuqi Zhu, Jintian Zhang, Zhenjie Wan, Yujie Luo, Shuofei Qiao, Zhengke Gui, Da Zheng, Lei Liang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LightThinker++,通过引入显式自适应内存管理,有效压缩LLM推理过程中的中间思维,减少内存占用并提升推理效率,尤其在长周期智能任务中表现突出。

Comments Work in progress. This is an extended version of LightThinker

详情

展开后加载摘要…

URL PDF HTML 收藏