arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 478 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 478 篇

2606.08464 2026-06-09 cs.CV 新提交 94%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26935 2026-06-26 cs.AI 新提交 92%

Where Do CoT Training Gains Land in LLM based Agents?

CoT训练在基于LLM的智能体中的增益何在?

Jingyu Liu, Zhiwen Wang, Yuxin Jing, Huanyu Zhou, Yong Liu

机构 * ByteDance(字节跳动) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京市大模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部新一代智能搜索与推荐工程研究中心)

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 通过比较有无思维链的动作预测,发现CoT训练主要提升直接动作预测质量,而非CoT推理优势,后期检查点更依赖提示,选择性掩码动作监督可改善泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11052 2026-06-10 cs.CL 新提交 92%

Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It

混合LLM中的注意力遗忘:当CoT微调破坏长程记忆时,如何修复

Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen, Huiming Wang, Zhijiang Guo

机构 * LARK, HKUST(GZ)(香港科技大学(广州)LARK实验室) UCL(伦敦大学学院) Mistral AI Tsinghua University(清华大学) SUTD(新加坡科技设计大学) HKUST(香港科技大学)

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 发现CoT监督微调会系统性降低混合线性注意力模型的长上下文召回能力,提出QK-Restore方法通过恢复微调前的查询-键投影矩阵来修复,无需额外训练。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02820 2026-08-05 cs.CR cs.AI cs.LG 新提交 91%

Evading Chain-of-Thought Monitoring Through Model Poisoning

通过模型投毒规避思维链监控

Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(summary_cn,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01980 2026-08-04 cs.CV cs.AI 新提交 90%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27304 2026-07-31 cs.LG cs.CV 新提交 90%

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

位置,而非来源:在医学视觉-语言模型中分离推理中介与逢迎行为

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

机构 * IEM Kolkata(印度工程管理学院 Kolkata校区) School of UEMK Kolkata(UEMK Kolkata学院) Heritage Institute of Technology Kolkata(加尔各答遗产技术学院) Indian Institute of Information Technology, Kalyani(卡利亚尼印度信息技术学院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本研究提出CoT-Mediate框架,结合双臂协议与来源控制干预,在VQA-RAD数据集上评估LLaVA-Med和MedGemma,发现上下文位置而非声明来源是医学VLMs使用生成推理的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27025 2026-06-26 cs.CL 新提交 90%

Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization

通过心理学推理和角色感知策略优化改进通用角色扮演智能体

Zhenhua Xu, Dongsheng Chen, Jian Li, Yitong Lin, Zhebo Wang, Jiafu Wu, Yizhang Jin, Chengjie Wang, Meng Han, Yabiao Wang

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出Psy-CoT框架,将角色推理分解为三步,并结合RAPO算法通过互信息加权梯度,提升角色扮演的忠实度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交 89%

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14961 2026-06-16 cs.CL 新提交 89%

CoRA: Confidence-Rationale Alignment for Reliable Chain-of-Thought Reasoning

CoRA: 面向可靠思维链推理的置信度-理由对齐

Juming Xiong, Weixin Liu, Kevin Guo, Congning Ni, Junchao Zhu, Chongyu Qu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21433 2026-07-24 cs.CL cs.AI cs.LG 新提交 89%

Token Budget Saturation and Mechanistic Early Detection of Reasoning Non-Convergence in Chain-of-Thought Models

思维链模型中令牌预算饱和与推理不收敛的机制早期检测

Renuka Oladri, Niveda Jawahar, Abdirisak Mohamed

机构 * University of Maryland(马里兰大学) SAP Labs, LLC(思爱普实验室有限责任公司)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究思维链模型的双峰收敛模式,通过在特定令牌位置的隐藏状态激活上训练线性探针,发现收敛命运可在生成结束前于中间表征中部分编码,为早期退出推理和自适应计算分配开辟道路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19697 2026-06-19 cs.LG cs.AI cs.CL 新提交 88%

Efficiently Representing Algorithms With Chain-of-Thought Transformers

高效表示链式思维Transformer中的算法

Yanhong Li, Anej Svete, Ashish Sabharwal, William Merrill

机构 * Allen Institute for AI(艾伦人工智能研究所) ETH Zürich(苏黎世联邦理工学院)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文证明链式思维Transformer能以多对数开销高效模拟Word RAM算法,包括排序和Dijkstra算法,优于模拟图灵机的二次开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 88%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10666 2026-07-14 cs.CV cond-mat.mtrl-sci cs.AI cs.LG 新提交 88%

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏

Shubham Rao

机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。

Comments 11 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01237 2026-07-07 cs.CL cs.AI 新提交 88%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16222 2026-06-16 cs.AI cs.LG 新提交 88%

Latent Thought Flow: Efficient Latent Reasoning in Large Language Models

潜在思维流:大型语言模型中的高效潜在推理

Xiandong Zou, Jing Huang, Jianshu Li, Pan Zhou

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出Latent Thought Flow (LTF)方法,将推理建模为可变长度连续轨迹,通过连续GFlowNet训练采样器匹配奖励后验,在提升准确率9.5%的同时平均减少推理长度27.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28460 2026-07-31 cs.LG cs.CR 新提交 87%

Cybersecurity Detection Classification with Reasoning-enabled Language Models

基于推理增强语言模型的网络安全检测分类

Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan, Laura Vasilie, Alexandru Apostu, Chase Helwig, Mihaela Gaman, Michael Brautbar, Edward Raff, Chase Midler, Sven Krasser

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 该研究针对SOC警报疲劳问题,训练了思维链推理增强的分类器及校准器,在Windows终端检测任务上提升了良性与恶意召回率,且30B微调模型优于通用大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06522 2026-07-08 cs.AI cs.CV 新提交 87%

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

通过视觉动作结果推理对齐实现物理推理与任务泛化的桥梁

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

机构 * National Taiwan University(国立台湾大学) The University of California, Merced(加州大学默塞德分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对视觉语言模型在物理推理中难以泛化的问题,提出VAORA奖励设计,包括视觉对齐奖励和视觉-动作对齐奖励,通过预训练专家估计概率实现平滑密集奖励,经实验验证可有效提升模型在新任务和未见环境中的物理推理性能。

Comments ICML'26 Workshop RLxF: Reinforcement Learning from World Feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08046 2026-07-10 cs.CL cs.AI 新提交 87%

What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness

大语言模型预测器知道但不说的内容:探究校准和忠实性的内部表示

Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究针对预测微调的大语言模型校准和忠实性问题,通过在中间激活上训练表示池探测器,发现其校准效果更好,还能评估CoT忠实性、追踪行为变化等,证明探究内部表示可用于校准、审计和分类语言模型预测器及推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00361 2026-07-02 cs.CR 新提交 87%

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31580 2026-07-01 cs.DC 新提交 87%

LASER: Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge

LASER: 面向边缘推理大模型的负载感知早退服务

Zhiqing Tang, Size Li, Hanshuai Cui, Zilan Huang, Jianxiong Guo, Tian Wang, Yuan Wu, Weijia Jia

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出LASER系统,通过负载感知自适应退出阈值和难度与负载感知的推理预算预分配,联合优化推理质量与服务延迟,在边缘部署中降低延迟17-38%并提升SLO满足率3-6%。

Comments to be published in WASA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22085 2026-06-23 cs.AI cs.CL cs.LG 新提交 87%

Can Reasoning Models Detect Changes to their Chains of Thought?

推理模型能否检测其思维链的变化?

Sathvik Napa, Utkarsh Singh, Chengyuan Xue, Miriam Wanner, William Walden

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究推理模型在多种条件下检测自身思维链干预的能力,发现模型检测准确率很低,且难以识别修改方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05738 2026-08-07 cs.RO 新提交 86%

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 85%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05734 2026-07-13 cs.IR cs.AI 新提交 85%

SCOReD: Student-Aware CoT Optimization for Recommendation Distillation

SCOReD:用于推荐蒸馏的学生感知思维链优化

Haz Sameen Shahgir, Yufei Li, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Sandeep Pandey, Luke Simon, Yue Dong, Xi Liu

机构 * University of California Riverside(加州大学河滨分校) Meta AI

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对推荐蒸馏中原始教师轨迹不适用于任务的问题,提出SCOReD框架,先解析教师轨迹片段并评分,再动态选择编辑操作,使轨迹适应学生输出分布,训练能为学生模型提供清晰信号,提升指标并减少推理长度。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01598 2026-08-04 cs.CL cs.AI 新提交 85%

PICTURE: Enhancing Theory-of-Mind in Large Language Models by Revealing, Not Hiding, Characters' Lack of Knowledge

PICTURE:通过揭示而非隐藏角色的知识缺失来增强大语言模型的心智理论能力

Eojin Jeon, SangKeun Lee

机构 * Korea University(高丽大学)

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型心智理论推理中事件隐藏导致的性能下降问题,提出PICTURE提示方法,通过在思维链中明确角色知识缺失,使模型在错误信念任务上性能提升7.3%

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18618 2026-07-22 cs.CL cs.AI cs.LG 新提交 85%

LatentMT: Machine Translation with Latent Reasoning

LatentMT:具有潜在推理的机器翻译

Wei-Rui Chen, Samar M. Magdy, Chiyu Zhang, Wenhui Zhu, Zhipeng Wang, Muhammad Abdul-Mageed

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出LatentMT,将潜在推理循环语言模型用于机器翻译,采用小型主干模型经轻量级训练,在多语言翻译方向表现出色,循环推理早期提升质量后期饱和,且训练和推理计算效率高,为紧凑高效的机器翻译提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09867 2026-08-11 cs.CR cs.AI cs.LG 新提交 84%

Stealing Reasoning Traces from Proprietary LLM APIs

从专有大语言模型API窃取推理轨迹

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29287 2026-08-03 cs.CL cs.AI 新提交 84%

Translation with Thought: Difficulty-Adaptive Reasoning via Reinforcement Learning for Multi-Domain Machine Translation

带思考的翻译:面向多领域机器翻译的难度自适应推理强化学习方法

Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) School of Informatics, Xiamen University(厦门大学信息学院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(文化和旅游部闽台非物质文化遗产数字化保护与智能处理重点实验室(厦门大学))

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多领域机器翻译的难度差异挑战,提出TwT框架,经两阶段训练后,其7B和14B参数版本在翻译质量上优于更大的SOTA模型,且token使用量降低32%-60%。

Comments 34 pages, 17 figures, and 21 tables. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10184 2026-06-10 cs.LG cs.AI 新提交 84%

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

Dropout-GRPO: 用于连续潜在推理的变分随机性

Wooil Jung

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在连续潜在推理模型中因确定性轨迹导致优势为零的问题,提出通过结构化Dropout引入随机性,使GRPO能优化贝叶斯模型平均策略,在GSM8K上提升Coconut基线准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13244 2026-08-14 cs.CL cs.CE q-bio.BM 新提交 83%

Localize, Then Reason: Visual Latent Structural Reasoning for Molecular Properties and Edits

先定位,再推理:用于分子性质与编辑的视觉隐式结构推理

Xingqiao Lin, Junmei Wang, Haocheng Tang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对现有化学推理模型无法聚焦分子关键区域的问题,提出VLSR框架,采用先定位再推理策略,在分子性质推理任务上实现9.6倍于文本推理基准的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏