arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-17 至 2026-04-17 共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 25 篇

2604.15236 2026-04-17 cs.CY cs.AI 57%

Agentic Microphysics: A Manifesto for Generative AI Safety

代理微物理:生成AI安全的宣言

Federico Pierucci, Matteo Prandi, Marcantonio Bracale Syrnikov, Marcello Galisai, Piercosma Bisconti

机构 * DEXAI – Icaro Lab Sant’Anna School of Advanced Studies(DEXAI–伊卡洛实验室圣安娜高级研究学院) DEXAI – Icaro Lab Sapienza University of Rome(DEXAI–伊卡洛实验室罗马萨皮恩扎大学) DEXAI – Icaro Lab VU Amsterdam(DEXAI–伊卡洛实验室阿姆斯特丹伏里克大学) Lucidi DEXAI – Icaro Lab Sapienza University of Rome(Lucidi DEXAI–伊卡洛实验室罗马萨皮恩扎大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出代理安全研究的新方法,强调交互层面机制对集体风险的影响,通过生成安全方法识别足够机制和设计干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24448 2026-04-17 cs.HC cs.AI 57%

Integrating Causal Machine Learning into Clinical Decision Support Systems: Insights from Literature and Practice

将因果机器学习整合到临床决策支持系统中:文献与实践的见解

Domenique Zipperling, Lukas Schmidt, Benedikt Hahn, Niklas Kühl, Steven Kimbrough

机构 * University of Bayreuth and Fraunhofer FIT(拜罗伊特大学和弗劳恩霍夫 FIT 研究所) Technical University of Munich(慕尼黑技术大学) Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了如何设计基于因果机器学习的临床决策支持系统,提出八个设计需求、七个设计原则和九个实用特征,以提升临床决策协作的可信度和实用性。

Comments Accepted at the Thirty-Fourth European Conference on Information Systems (ECIS 2026), Milan, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14687 2026-04-17 cs.AI 57%

M2-PALE: A Framework for Explaining Multi-Agent MCTS--Minimax Hybrids via Process Mining and LLMs

M2-PALE:一种通过过程挖掘和大语言模型解释多智能体MCTS-最小化混合策略的框架

Yiyu Qian, Liyuan Zhao, Tim Miller

机构 * RMIT University(皇家墨尔本理工大学) University of California(加州大学) University of Queensland(昆士兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出M2-PALE框架,通过过程挖掘和大语言模型解释多智能体MCTS-最小化混合策略的决策过程,验证了其在跳棋环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14672 2026-04-17 cs.CL 57%

SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models

SPAGBias:揭示和追踪大型语言模型中的结构化空间性别偏见

Binxian Su, Haoye Lou, Shucheng Zhu, Weikang Wang, Ying Liu, Dong Yu, Pengyuan Liu

机构 * School of Information Science, Beijing Language and Culture University(北京语言大学信息科学学院) Libraries, Renmin University of China(中国人民大学图书馆) School of Humanities, Tsinghua University(清华大学人文学院) Shanghai University of Finance and Economics(上海财经大学) National Print Media Language Resources Monitoring & Research Center(国家印刷媒体语言资源监测与研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出SPAGBias框架,系统评估LLM中的空间性别偏见,通过62种城市微空间分类、提示库和三层诊断方法,揭示性别空间关联及偏见来源,扩展了偏见研究到空间领域。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14166 2026-04-17 cs.CL 57%

Hierarchical Retrieval Augmented Generation for Adversarial Technique Annotation in Cyber Threat Intelligence Text

层级检索增强生成用于网络威胁情报文本中的对抗技术标注

Filippo Morbiato, Markus Keller, Priya Nair, Luca Romano

机构 * University of Padua(帕多瓦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出H-TechniqueRAG框架,通过层级检索机制和结构约束策略提升网络威胁情报文本中对抗技术标注的效率与准确性,实验表明其在F1得分、推理延迟和API调用次数上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 57%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14637 2026-04-17 cs.HC 50%

Touching Space: Accessible Map Exploration Through Conversational Audio-Haptic Interaction

触碰空间:通过对话式音频-触觉交互实现可访问的地图探索

Li Liu, Jiaming Qu, Marc Jowell Bagaoisan, David T. Lee, Leilani H. Gilpin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出Touching Space系统,通过触觉和音频反馈帮助视障人士构建环境认知地图,支持在普通硬件上实现空间探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13671 2026-04-17 cs.CV 50%

AgentIAD: Agentic Industrial Anomaly Detection via Adaptive Memory Augmentation

AgentIAD: 通过自适应记忆增强的代理工业异常检测

Junwen Miao, Penghui Du, Yingying Fan, Yi Liu, Yu Wang, Runze He, Lida Huang, Yan Wang

机构 * AIR, Tsinghua University(清华大学AIR) Etude AI Stony Brook University(石溪大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出AgentIAD框架,通过统一的动作空间实现迭代工业检测,利用视觉记忆和检索记忆进行多轮感知-行动推理,提升异常检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18935 2026-04-17 cs.CV 50%

Feature Extraction in the Remote Sensing Data Value Chain: A Systematic Review of Methods and Applications

遥感数据价值链中的特征提取:一种系统综述方法与应用

Nathan Mankovich, Kai-Hendrik Cohrs, Homer Durand, Vasileios Sitokonstantinou, Tristan Williams, Gustau Camps-Valls

机构 * organization= Image Processing Lab, Universitat de Val\`encia , addressline= C/ Cat. Agustín Escardino Benlloch, 9 , city= Paterna , postcode= 46980 , state= Val\`encia , country= Spain organization= Artificial Intelligence Group, Wageningen University , addressline= P.O. Box 16 , postcode= 6700 AA , city= Wageningen , country= The Netherlands

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了遥感数据价值链中特征提取方法与应用,分析了高维数据带来的冗余与计算挑战,并提出框架以指导特征提取的发展趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 8 篇

2604.14568 2026-04-17 cs.CV cs.CL 83%

Learning Adaptive Reasoning Paths for Efficient Visual Reasoning

学习高效的视觉推理路径

Yixu Huang, Tinghui Zhu, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14641 2026-04-17 cs.AI 79%

Learning to Draw ASCII Improves Spatial Reasoning in Language Models

学习绘制ASCII图提高语言模型的空间推理能力

Shiyuan Huang, Li Liu, Jincheng He, Leilani H. Gilpin

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过Text2Space数据集研究语言模型通过构造视觉布局提升空间推理能力,发现构造与理解训练结合可显著增强空间推理,并在外部基准上验证了其泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14806 2026-04-17 cs.SD cs.MM 78%

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

倾听、暂停与推理:迈向基于感知的混合推理以实现音频理解

Jieyi Wang, Yazhe Niu, Dexuan Xu, Zhongyu Wei

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) CUHK MMLab(香港中文大学多媒体实验室) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出HyPeR框架,通过感知-推理混合方法提升音频理解能力,通过PAQA数据集训练模型并引入PAUSE标记和一致性奖励,实验表明其在复杂音频场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 57%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15225 2026-04-17 cs.HC 50%

UrbanClipAtlas: A Visual Analytics Framework for Event and Scene Retrieval in Urban Videos

UrbanClipAtlas:面向城市视频中事件和场景检索的视觉分析框架

Joel Perca, Luis Sante, Juanpablo Heredia, Joao Rulff, Claudio Silva, Jorge Poco

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出UrbanClipAtlas框架,结合RAG、实体提取和视频定位技术,实现城市视频中事件和场景的高效检索与解释,通过知识图谱和增强聊天界面提升分析效率。

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22185 2026-04-17 cs.CV 50%

Beyond Augmentation: Cross-Modal Transformer Fusion with Bi-directional Attention for Low-Data Aneurysm Screening

超越增强:基于双向注意力的跨模态Transformer融合用于低数据动脉瘤筛查

Antara Titikhsha, Divyanshu Tak

机构 * Carnegie Mellon University(卡内基梅隆大学) Artificial Intelligence in Medicine (AIM) Program(医学人工智能(AIM)项目) Mass General Brigham(马萨诸塞总医院) Harvard Medical School(哈佛医学院) Department of Radiation Oncology(放射肿瘤科) Dana-Farber Cancer Institute(达纳-法伯癌症研究所) Brigham and Women’s Hospital(布里洛妇产科医院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CMTF-Net,通过跨模态目标融合框架实现解剖结构化的动脉瘤筛查,采用14个血管区域独立监督,提升低数据场景下的检测精度与可解释性。

Comments We had major improvements in this second draft. Please refer to this version only

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 50%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 50%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 11 篇

2604.14853 2026-04-17 cs.LG 89%

Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization

通过约束策略优化实现推理大语言模型的自适应推理时间计算分配

Zhiyuan Zhai, Bingcong Li, Bingnan Xiao, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院) Guangming Lab(光明实验室)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(title,abstract);分类 cs.LG

AI总结 本文提出通过约束优化问题解决推理时间计算分配问题,采用两阶段解决-学习流程,在解决阶段利用拉格朗日松弛分解全局约束,学习阶段训练轻量分类器预测 oracle 动作,实验证明方法在 MATH 和 GSM8K 数据集上优于均匀和启发式分配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14528 2026-04-17 cs.AI cs.CL 81%

Dissecting Failure Dynamics in Large Language Model Reasoning

解析大语言模型推理中的故障动态

Wei Zhu, Jian Zhang, Lixing Yu, Kun Yue, Zhiwen Tang

机构 * School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,昆明,中国) Yunnan Key Laboratory of Intelligent Systems and Computing, Kunming, China(云南省智能系统与计算重点实验室,昆明,中国)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型推理错误多源于早期少量转换点,提出GUARD框架通过不确定性信号引导干预,提升推理可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09665 2026-04-17 cs.LG cs.AI 81%

Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model

深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07941 2026-04-17 cs.CL cs.AI cs.LG 75%

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

大语言模型后训练:一种统一的偏置学习与在线学习视角

Shiwan Zhao, Zhihu Wang, Xuyang Zhao, Jiaming Zhou, Caiyue Xu, Chenfei Liu, Liting Zhang, Yuhang Jia, Yanzhe Zhang, Hualong Yu, Zichen Xu, Qicheng Li, Yong Qin

机构 * Nankai University(南开大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大语言模型后训练的统一框架,通过轨迹溯源划分偏置学习与在线学习两种模式,分析了支持扩展、策略重塑和行为固化等核心方法,强调系统设计协调性对进展的重要性。

Comments 38 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15149 2026-04-17 cs.LG cs.AI 73%

LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking

Lukas Helff, Quentin Delfosse, David Steinmann, Ruben Härle, Hikaru Shindo, Patrick Schramowski, Wolfgang Stammer, Kristian Kersting, Felix Friedrich

机构 * TU Darmstadt(图宾根大学) DFKI(德累斯顿人工智能研究所) Intrinsic Lab1141(Lab1141实验室) CERTAIN, Germany(德国CERTAIN) MPI-Inf, SIC(慕尼黑人工智能研究所) Meta

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27844 2026-04-17 cs.CL 70%

Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3

模型能力主导:来自AIMO 3的推理时间优化启示

Natapong Nitarach

机构 * Proton

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 通过AIMO 3竞赛发现,多数投票多模型推理提升数学能力,但相关误差限制样本量。通过分配不同推理策略的Diverse Prompt Mixer方法显示,模型能力主导,优化效果有限。

Comments 18 pages, 6 figures, 10 tables. Kaggle AIMO 3 competition entry. Code and notebooks: https://github.com/nat-nischw/model-capability-dominates-lessons-aimo3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18129 2026-04-17 cs.CV cs.CL 70%

One RL to See Them All: Visual Triple Unified Reinforcement Learning

一个RL看尽一切:视觉三合一强化学习

Yan Ma, Linge Du, Xuyang Shen, Shaoxiang Chen, Pengfei Li, Qibing Ren, Lizhuang Ma, Yuchao Dai, Pengfei Liu, Junjie Yan

机构 * Qwen Team(通义实验室)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出V-Triune方法,通过三个协调抽象提升多模态RL性能,开发Orsta模型在多个任务中表现优异,展示统一RL在视觉语言模型中的优势。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14877 2026-04-17 cs.LG 57%

Does RL Expand the Capability Boundary of LLM Agents? A PASS@(k,T) Analysis

强化学习是否扩展大语言模型代理的能力边界?一种PASS@(k,T)分析

Zhiyuan Zhai, Wenjing Yan, Xiaodan Shao, Xin Wang

机构 * Fudan University(复旦大学) Chinese University of Hong Kong(香港中文大学) University of Waterloo(滑铁卢大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本文通过PASS@(k,T)指标分析强化学习在代理工具使用中的能力扩展,发现其在复杂任务中确实扩大了能力边界,而静态推理中则趋于收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14475 2026-04-17 cs.AI 57%

Evo-MedAgent: Beyond One-Shot Diagnosis with Agents That Remember, Reflect, and Improve

Evo-MedAgent:超越单次诊断的具有记忆、反思和改进能力的代理

Weixiang Shen, Bailiang Jian, Jun Li, Che Liu, Johannes Moll, Xiaobin Hu, Daniel Rueckert, Hongwei Bran Li, Jiazhen Pan

机构 * Technical University of Munich(慕尼黑技术大学) TUM University Hospital(TUM大学医院) LMU Munich(慕尼黑大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 Evo-MedAgent通过引入自我进化记忆模块,使医疗代理在测试时实现跨案例学习,提升多选题准确率,无需额外训练,适用于任何冻结模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14820 2026-04-17 cs.SE 50%

SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling

SWE-TRACE:通过规则过程奖励模型和启发式测试时间缩放优化长 horizon SWE代理

Hao Han, Jin Xie, Xuehao Ma, Weiquan Zhu, Ziyao Zhang, ZhiLiang Long, Hongkai Chen, Qingwen Ye

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出SWE-TRACE框架,通过优化数据收集、强化学习和测试时间推理,提升SWE代理的长horizon推理能力,减少token消耗和推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 50%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 测试时计算 :reasoning(abstract)

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 21 篇

2604.14847 2026-04-17 cs.AI 83%

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14214 2026-04-17 cs.CL cs.AI 82%

CROP: Token-Efficient Reasoning in Large Language Models via Regularized Prompt Optimization

CROP:通过正则化提示优化实现大语言模型的token高效推理

Deep Shah, Sanket Badhe, Nehal Kathrotia, Priyanka Tiwari

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI;logical reasoning(comments)

AI总结 CROP通过正则化提示优化,在保持准确性的同时显著降低token消耗,适用于复杂推理任务。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏