arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-03 至 2026-06-03 共收录 144 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 31 篇

1205.0207 2026-06-03 cs.RO cs.SY eess.SY 71%

Shortest Path Set Induced Vertex Ordering and its Application to Distributed Distance Optimal Multi-agent Formation Path Planning

最短路径集诱导的顶点排序及其在分布式距离最优多智能体编队路径规划中的应用

Jingjin Yu

专题命中 规划推理 :planning(title)

AI总结 针对无向图中不可区分智能体移动到任意目标编队的距离最优路径规划问题,提出一种基于最短路径集诱导顶点排序的集中式算法,并首次实现分布式调度,同时保证相同的收敛时间。

Comments Extended the earlier version to 8 Pages, complete with literature review. One additional section on a distributed scheduling algorithm is added

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12247 2026-06-03 cs.CL cs.AI cs.LG 67%

Plan, Verify and Fill: A Structured Parallel Decoding Approach for Diffusion Language Models

规划、验证与填充:扩散语言模型的结构化并行解码方法

Miao Li, Hanyang Jiang, Sikai Cheng, Hengyu Fu, Yuhang Cai, Baihe Huang, Tinghan Ye, Xuanzhou Chen, Pascal Van Hentenryck

机构 * Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Plan-Verify-Fill (PVF)方法,通过定量验证进行分层骨架规划,并采用验证协议实现结构化停止,在保持准确性的同时将函数评估次数减少高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03762 2026-06-03 cs.LG cs.AI 62%

Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning

基于熵引导的工具感知优化用于高效智能体强化学习

Hongye Cao, Nuo Yan, Haoyuan Deng, Ziwei Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Nanyang Technological University(南洋理工大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse(九章人工智能研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出TAO-RL框架,通过工具感知轨迹过滤和熵引导探索解决智能体强化学习中工具使用导致的训练不稳定问题,在7个推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03685 2026-06-03 cs.LG cs.AI 62%

A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners

监督微调的大语言模型规划器中世界模型恢复的深入探究

Patrick Emami, Nan Qiang, Peter Graf

机构 * National Laboratory of the Rockies(落基山国家实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 通过可解释性实验,研究监督微调如何影响大语言模型在经典规划任务中恢复世界模型的能力,发现微调使模型线性编码动作有效性和状态谓词,且更广泛的状态空间覆盖有助于更准确的世界模型恢复。

Comments 17 pages. Under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02908 2026-06-03 cs.CL cs.AI 62%

WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents

WRIT: 面向多轮用户代理的写密集型轨迹合成

Hengrui Gu, Xiaotian Han, Kaixiong Zhou

机构 * North Carolina State University(北卡罗来纳州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多轮用户代理在信息收集和决策中面临的证据负担挑战,提出WRIT方法,通过合成写密集型和读密集型轨迹,训练代理在信息负载下做出基于证据的决策,仅用2K轨迹即可提升性能并减少推理时token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03239 2026-06-03 cs.CL 57%

ARBOR: Online Process Rewards via a Reusable Rubric Buffer for Search Agents

ARBOR: 通过可复用评分标准缓冲区的在线过程奖励用于搜索智能体

Zheng Liu, Longxiang Zhang, Xintong Wang, Zhiang Xu, Shaoxiong Zhan, Xin Shan, Wen Huang, Tao Dai, Shu-Tao Xia, Chengfu Huo, Liang Ding

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 针对基于LLM的搜索智能体训练中结果奖励缺乏过程监督的问题,提出ARBOR框架,通过维护跨查询共享的评分标准记忆库,利用对比轨迹生成局部草案并整合为通用评分标准,以稀疏成对判断提供过程级梯度,在四个多跳QA基准上优于GRPO和DAPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03197 2026-06-03 cs.CL 57%

MemTrain: Self-Supervised Context Memory Training

MemTrain:自监督上下文记忆训练

Ziheng Li, Xingrun Xing, Haoqing Wang, Zhi-Hong Deng, Yehui Tang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学院,北京大学) Samsung Research, Beijing, China(三星研究院,北京,中国)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出自监督框架MemTrain,通过两个耦合代理任务(端到端掩码重建和中间记忆召回)利用无标签维基百科语料增强LLM代理的上下文记忆能力,显著提升下游长文本推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02983 2026-06-03 cs.CL 57%

A Locally Deployed RAG-Based Academic Advising System for Course Selection

基于本地部署RAG的课程选择学术咨询系统

Feng Li, Yoritaka Iwata

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出一种本地部署的RAG学术咨询系统,利用大语言模型和结构化课程大纲检索,以隐私保护方式支持课程选择、先修课程理解和个性化学习规划。

Comments to be published in Elsevier's Procedia Computer. Sci. (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24008 2026-06-03 cs.AI 57%

SPARK: Search Personalization via Agent-Driven Retrieval and Knowledge-sharing

SPARK:通过智能体驱动的检索和知识共享实现搜索个性化

Gaurab Chhetri, Subasish Das, Tausif Islam Chowdhury

机构 * Texas State University(德克萨斯州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SPARK框架,利用基于角色的多智能体LLM协作实现动态个性化搜索,通过协调器激活相关专家智能体,结合记忆和推理模块,从分布式行为中涌现个性化特性。

Comments This is the author's preprint. Accepted to WEB&GRAPH 2026 (co-located with WSDM 2026), Boise, Idaho, USA, Feb 26, 2026. Final version will appear in WSDM 2026 Companion Proceedings. Conf: https://wsdm-conference.org/2026/ Workshop: https://aiimlab.org/events/WSDM_2026_WEB_and_GRAPH_2026_Workshop_on_Web_and_Graphs_Responsible_Intelligence_and_Social_Media.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17220 2026-06-03 cs.MA cs.AI 57%

Dynamics of Cognitive Heterogeneity: Investigating Behavioral Biases in Multi-Stage Supply Chains with LLM-Based Simulation

认知异质性动力学:基于大语言模型模拟的多阶段供应链中行为偏差研究

Jiuyun Jiang, Yuecheng Hong, Bo Yang, Jin Yang, Guangxin Jiang, Xiaomeng Guo, Guang Xiao

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过引入大语言模型模拟多阶段供应链,基于分层推理框架分析认知异质性对智能体交互的影响,发现信息共享可缓解短视和自利行为导致的系统效率低下。

Comments Accepted to the Main Conference of ACL 2026. 18 pages, 8 figures in total (9 pages, 7 figures for the main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10387 2026-06-03 cs.DB cs.AI 57%

Test-Time Optimization of Physical Query Plans with LLMs

基于LLM的物理查询计划测试时优化

Mehmet Hamza Erol, Xiangpeng Hao, Federico Bianchi, Ciro Greco, Jacopo Tagliabue, James Zou

机构 * Stanford University(斯坦福大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) TogetherAI Bauplan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出DBPlanBench框架,利用LLM在测试时通过语义推理和进化搜索优化物理查询计划,在OLAP查询中实现1.05-1.12倍中位数加速,并支持小规模到大规模的迁移。

Comments Code is available at: https://github.com/BauplanLabs/DBPLANBENCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03951 2026-06-03 cs.CV 50%

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

Demo2Tutorial:从人类经验到多模态软件教程

Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 规划推理 :planning(abstract)

AI总结 提出Demo2Tutorial框架,通过屏幕录制和交互日志将人类经验解析为结构化多模态教程,用于人类学习和GUI智能体训练,实验证明其生成质量超越人工教程并提升任务效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03152 2026-06-03 cs.DB 50%

Cost-Aware Optimization for Agentic Query Execution

面向代价的智能查询执行优化

Lunyiu Nie, Yilin Xia, Yiren Liu, Christopher Jermaine, Swarat Chaudhuri

专题命中 规划推理 :planning(abstract)

AI总结 针对LLM支持的查询执行中算子放置、顺序和粒度影响代价与质量的问题,提出EnumGRPO优化器,通过上下文强化学习从枚举计划中蒸馏启发式策略,在SWAN数据库上实现0.011美元/查询的LLM代价和35.4%的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03138 2026-06-03 cs.IR 50%

Section-Weighted Hybrid Approach for Legal Case Retrieval

基于章节加权的混合方法用于法律案例检索

Rajith Arulanandam, Nisansa de Silva

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一个两阶段、感知章节的法律案例检索框架,先通过大语言模型分割判决书,再结合词法和语义搜索及加权聚合,在司法基准上取得一致提升。

Comments 10 pages, 4 figures. Accepted to the International Conference on Natural Language Processing (ICNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03115 2026-06-03 cs.SE cs.MA 50%

SPOQ: Specialist Orchestrated Queuing for Multi-Agent Software Engineering

SPOQ: 面向多智能体软件工程的专家编排队列

Royce Carbowitz, Dheeraj Kumar

专题命中 规划推理 :planning(abstract)

AI总结 提出SPOQ方法,通过基于波形的拓扑调度、双重验证门控和人类作为智能体集成,优化多智能体软件工程中的协调、质量控制和人类监督问题。

Comments 55 pages, 12 tables, 6 figures; includes longitudinal deployment study and open-weights replication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03047 2026-06-03 cs.RO cs.MA 50%

ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control

ModuLoop: 使用模块化合成器和闭环调试器进行机器人控制的低级代码生成

Gina Yoon, Sumin Lee, Joo Yong Sim

机构 * Department of Mechanical Systems Engineering, Sookmyung Women’s University(苏州市女子大学机械系统工程系)

专题命中 规划推理 :planning(abstract)

AI总结 提出闭环模块化代码合成框架,利用预训练大语言模型进行模块化代码规划与生成,并通过迭代执行和调试探针实现系统调试与优化,成功应用于RGB-D相机与机械臂标定及抓取任务。

Comments IEEE Robotics and Automation Letters (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01698 2026-06-03 cs.IR cs.MM cs.SD eess.AS 50%

TalkPlay-Tools: Conversational Music Recommendation with LLM Tool Calling

TalkPlay-Tools: 基于大语言模型工具调用的对话式音乐推荐

Seungheon Doh, Keunwoo Choi, Juhan Nam

机构 * KAIST(韩国科学技术院) talkpl.ai

专题命中 规划推理 :planning(abstract)

AI总结 提出一种基于LLM工具调用的统一检索-重排序流水线,通过布尔过滤、稀疏检索、稠密检索和生成式检索的组合,实现端到端的对话式音乐推荐。

Comments Accepted for publication at The Workshop on AI for Music, Neural Information Processing Systems (NeurIPS-AI4Music)

详情

展开后加载摘要…

URL PDF HTML 收藏
1104.4251 2026-06-03 cs.RO cs.MA cs.SY eess.SY math.OC 50%

Distributed Self-Organization Of Swarms To Find Globally $ε$-Optimal Routes To Locally Sensed Targets

群体分布式自组织以找到局部感知目标的全局$ε$-最优路径

Ishanu Chattopadhyay

专题命中 规划推理 :planning(abstract)

AI总结 针对大规模群体,提出一种仅利用局部信息的分布式路径规划算法,通过信息渗透和梯度涌现实现接近最优的路径选择,并严格分析了收敛性、鲁棒性、可扩展性及系统参数的影响。

Comments 38 pages 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1104.5384 2026-06-03 eess.SY cs.MA cs.SY math.OC 50%

Chance-constrained Model Predictive Control for Multi-Agent Systems

多智能体系统的机会约束模型预测控制

Daniel Lyons, Jan-P. Calliess, Uwe D. Hanebeck

专题命中 规划推理 :planning(abstract)

AI总结 针对多智能体系统的随机模型预测控制问题,提出一种基于概率边界的保守约束方法,在保证实时性的同时避免智能体间碰撞,并通过仿真验证其优于样本近似方法。

Comments 33 pages, 5 figures, revised version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 6 篇

2606.03577 2026-06-03 cs.CV 85%

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

通过宽基线匹配激发多模态大语言模型中的复杂空间推理

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 本文提出ReasonMatch-Bench基准和动态对应强化学习(DCRL)方法,以系统评估和提升多模态大语言模型在宽基线匹配任务中的空间推理能力。

Comments CVPR 2026. Project page: https://aim-uofa.github.io/reasonmatch/ Code: https://github.com/aim-uofa/ReasonMatch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03460 2026-06-03 cs.CV 78%

From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring

从3D感知到安全推理:基于图的实时地下矿井监控框架

Pasindu Ranasinghe, Simit Raval, Dibyayan Patra, Bikram Banerjee, Ismet Canbulat

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出一个结合3D语义感知、不确定性异常检测、规则检查、设备端LLM推理和GraphRAG记忆分析的连续监控框架,通过场景图和时序图实现结构化安全推理,在115个危险场景中达到93%的覆盖率和92.7%的感知精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 57%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03986 2026-06-03 cs.CV 50%

NewtPhys: Do Foundation Models Understand Newtonian Physics?

NewtPhys: 基础模型理解牛顿物理学吗?

Sebastian Cavada, Soumava Paul, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette

机构 * Inria(法国国家信息与自动化研究所) Valeo.ai(Valeo人工智能公司) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出NewtPhys,一个基于真实场景多视图图像和物理模拟的4D物理标注数据集,用于系统评估基础模型在低层次牛顿物理推理中的能力,揭示了现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03509 2026-06-03 cs.CV 50%

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

EvoMemNav: 用于零样本具身导航的高效自进化细粒度记忆

Zuhao Ge, Xiaosong Jia, Chao Wu, Yuchen Zhou, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 视觉空间推理 :planning(abstract)

AI总结 提出EvoMemNav框架,通过构建视觉-语义记忆图并采用预算驱动的粗到细策略,结合反射驱动写回机制,实现零样本具身导航中高效、自进化的细粒度记忆,提升多实例区分和停止验证性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03142 2026-06-03 cs.CV 50%

Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

解构LVLMs可视化素养中的视觉与事实正确性

Soohyun Lee, Jaeyoung Kim, Seokhyeon Park, Sihyeon Lee, Jiwon Song, Bohyoung Kim, Hyunjoo Song, Jinwook Seo

机构 * Seoul National University(首尔国立大学) MADI Co., Ltd.(MADI公司) Hankuk University of Foreign Studies(韩国民法大学) Soongsil University(顺天大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出框架分离视觉正确性与事实正确性,通过反事实测试和仲裁指标揭示LVLMs在可视化素养评估中依赖事实记忆而非视觉推理的问题。

Comments Under review at IEEE Transactions on Visualization and Computer Graphics (TVCG). 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 19 篇

2512.11213 2026-06-03 cs.AI cs.CL 88%

FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration

FutureWeaver: 面向模块化协作的多智能体系统的测试时计算规划

Dongwon Jung, Peng Shi, Muhao Chen, Yi Zhang

机构 * University of California, Davis(加州大学戴维斯分校) University of Waterloo(滑铁卢大学) Greenshoe, Inc(Greenshoe公司)

专题命中 测试时计算 :planning(title,abstract);test-time compute(title,abstract);分类 cs.CL、cs.AI

AI总结 提出FutureWeaver框架,通过双层次规划架构和自诱导协作模块,在固定预算下优化多智能体系统的测试时计算分配,显著提升协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03866 2026-06-03 cs.IR cs.AI cs.CL 87%

Taiji: Pareto Optimal Policy Optimization with Semantics-IDs Trade-off for Industrial LLM-Enhanced Recommendation

Taiji: 面向工业LLM增强推荐的帕累托最优策略优化与语义ID权衡

Yuecheng Li, Zeyu Song, Jing Yao, Chi Lu, Peng Jiang, Kun Gai

机构 * Kuaishou Technology(快手科技) Unaffiliated(无隶属)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出Taiji框架,通过逆向工程推理和开放拒绝采样生成高质量CoT数据,并采用帕累托最优策略优化(POPO)自适应调整跨域奖励权重,实现LLM语义知识与推荐ID特征的帕累托最优权衡,在快手广告平台部署后服务超4亿日活用户。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03969 2026-06-03 cs.CL cs.AI 84%

Quantifying Faithful Confidence Expression in Large Reasoning Models

量化大型推理模型中的忠实置信表达

Areeb Gani, Asal Meskin, Gabrielle Kaili-May Liu, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)在长链思维输出中难以忠实表达内在置信度的问题,提出基于令牌概率、隐藏状态和响应一致性的框架,系统量化其语言决断性与内部不确定性之间的对齐程度。

Comments Code: https://github.com/yale-nlp/faithful_lrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06960 2026-06-03 cs.CL cs.AI 84%

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+:通过强化学习实现高效且有效的无限时域推理

Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出InftyThink+框架,通过强化学习优化迭代推理的总结时机、保留内容和恢复策略,在DeepSeek-R1-Distill-Qwen-1.5B上提升AIME24准确率21%,并降低推理延迟。

Comments ICML 2026: https://openreview.net/forum?id=tyul8kXaJU Project Page: https://zju-real.github.io/InftyThink-Plus Code: https://github.com/ZJU-REAL/InftyThink-Plus Models: https://huggingface.co/collections/yanyc/inftythink

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03782 2026-06-03 cs.CL 83%

Reasoning over Grammar: Can Synthetic Linguistic Reasoning Traces Enhance Low-Resource Machine Translation?

基于语法的推理:合成语言推理轨迹能否增强低资源机器翻译?

Renhao Pei, Yihong Liu, Sampo Pyysalo, Hinrich Schütze, Shaoxiong Ji

机构 * ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出自动生成语言推理轨迹的方法,通过上下文学习、监督微调和强化微调评估其对低资源机器翻译的影响,发现推理轨迹在推理时指导效果显著,但作为训练数据收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏