arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 341 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 28 篇

2604.17944 2026-04-21 cs.CL 83%

ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering

ReCoQA:一个用于房地产问答中工具增强和多步骤推理的基准

Yindong Zhang, Wenmian Yang, Yiquan Zhang, Weijia Jia

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学) Beijing Normal University(北京师范大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出ReCoQA基准,包含29270个房地产实例,通过机器可验证的监督提升多步骤推理能力,并提出HIRE-Agent框架作为强基线,验证了层级协作在复杂现实任务中的必要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16396 2026-04-21 cs.CL 83%

QU-NLP at QIAS 2026: Multi-Stage QLoRA Fine-Tuning for Arabic Islamic Inheritance Reasoning

QU-NLP在QIAS 2026中的表现:针对阿拉伯伊斯兰继承推理的多阶段QLoRA微调

Mohammad AL-Smadi

机构 * Qatar University(卡塔尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出通过多阶段QLoRA微调策略提升阿拉伯伊斯兰继承推理能力,利用领域适应和任务特定训练,在低资源下实现高精度推理。

Comments Accepted for publication, The 7th Workshop on Open-Source Arabic Corpora and Processing Tools, LREC26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17935 2026-04-21 cs.LG cs.AI cs.CC 81%

How Much Cache Does Reasoning Need? Depth-Cache Tradeoffs in KV-Compressed Transformers

推理需要多少缓存?KV压缩变换器中的深度-缓存权衡

Xiao Wang

机构 * FujianAI(福建AI)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过k步指针追逐分析KV缓存压缩对多步推理的影响,揭示了深度与缓存大小的理论界限及带宽限制,同时比较了自适应与非自适应缓存的误差缩放差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18169 2026-04-21 cs.LG cs.CE cs.CL 81%

PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning

PiERN:基于令牌级别的路由以整合高精度计算与推理

Hengbo Xiao, Jingyuan Fan, Xin Tong, Jingzhao Zhang, Chao Lu, Guannan He

机构 * Peking University(北京大学) Peking University Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 PiERN通过内生整合计算能力,提升语言模型在复杂系统中的精度与效率,实现高准确性、低延迟和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08539 2026-04-21 cs.CV cs.AI cs.CL 81%

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。

Comments code at: https://github.com/uclanlp/openvlthinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17278 2026-04-21 cs.CV 80%

PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习

Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17399 2026-04-21 cs.AI 79%

Beyond Meta-Reasoning: Metacognitive Consolidation for Self-Improving LLM Reasoning

超越元推理:面向自我改进大语言模型推理的元认知巩固

Ziqing Zhuang, Linhai Zhang, Jiasheng Si, Deyu Zhou, Yulan He

机构 * Southeast University(东南大学) King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东科学院))

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出元认知巩固框架,通过整合历史推理经验提升未来元推理能力,实验显示性能随经验积累而提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17304 2026-04-21 cs.AI 79%

Efficient Test-Time Scaling via Temporal Reasoning Aggregation

通过时间推理聚合实现高效的测试时扩展

Jiakun Li, Xingwei He, Kefan Li, Hongzheng Chai, Hongyue Yu, Yuan Yuan

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Qingdao Research Institute, Beihang University(北航青岛研究院) Hangzhou Innovation Institute, Beihang University(北航杭州创新研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过时间聚合多步骤证据实现高效测试时扩展,减少推理token使用25-30%,保持准确性,优于现有动态推理方法。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15724 2026-04-21 cs.CV cs.AI 79%

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker:构建具有LLM引导工具推理的智能视频大语言模型

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 VideoThinker通过合成工具交互轨迹构建大规模视频与工具推理数据集,提升长视频理解能力,优于传统语言模型和视频模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14738 2026-04-21 cs.CL 79%

AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning

AutoRubric: 基于评分标准的生成奖励用于忠实的多模态推理

Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi

机构 * University of Notre Dame(内布拉斯加大学) Uniphore

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 AutoRubric通过整合可验证奖励学习与过程级监督,利用自动收集的评分标准生成奖励,实现多模态推理的高保真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15404 2026-04-21 cs.CL 79%

How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study

如何增强大推理模型的安全性:一项实证研究

Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)小组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过监督微调探讨如何提升大推理模型的安全性,发现直接蒸馏安全响应无效,但针对性处理危险模式可显著提升安全性,且短或模板化推理过程同样有效。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16931 2026-04-21 cs.AI 79%

Playing Psychic: Using Thought Trees to Predict Reasoning Models Accuracy on Coding Tasks

读心术:利用思维树预测推理模型在编码任务上的准确性

Jiaxin Fang, Runyuan He, Sahil Bhatia, Neel Gajare, Alvin Cheung

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过系统研究前沿推理模型在真实世界编码基准上的表现,提出利用结构化思维树来表示推理轨迹,并通过轻量级分类器预测轨迹正确性,从而提升编码任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17052 2026-04-21 cs.CV 78%

OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning

OASIS:按需分层事件记忆用于流媒体视频推理

Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, Guanbin Li

机构 * Sun Yat-sen University(中山大学) OPPO AI Center(OPPO人工智能中心) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 OASIS通过结构化按需检索解决流媒体视频推理中记忆检索的挑战,提升长周期准确性和组合推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI 76%

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI、cs.LG

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05863 2026-04-21 cs.CL cs.LG cs.SE 73%

ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning

ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码

Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Amazon AGI(亚马逊人工智慧实验室) NAVER Cloud(NAVER云)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17009 2026-04-21 cs.AI 70%

Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition

小模型作为主指挥者:通过并行子任务分解学习统一的智能体-工具协调

Wenzhen Yuan, Wutao Xiong, Fanchen Yu, Shengji Tang, Ting Liu, Tao Chen, Peng Ye, Yuzhuo Fu, Wanli Ouyang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sichuan University(四川大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Agent-as-Tool框架,通过并行子任务分解和状态反馈提升多智能体系统协调效率,ParaManager在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14550 2026-04-21 cs.AR cs.AI cs.LG cs.MA cs.PL 62%

VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs

VeriGraphi:一种用于大规模硬件设计的分层RTL生成多智能体框架

Sazzadul Islam, Tasnim Tabassum, Hao Zheng

机构 * Dept. of Computer Science \& Eng. University of South Florida Tampa, Florida, United States

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VeriGraphi通过构建基于规范的图谱,解决LLM在生成分层RTL时的结构失真问题,实现可靠生成并保持功能正确性。

Comments 9 pages, 2 figures, Case studies, v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10779 2026-04-21 cs.CL cs.AI 62%

Improving Speech Recognition of Named Entities in Classroom Speech with LLM Revision and Phonetic-Semantic Context

通过LLM修订和音义上下文提高课堂语音中命名实体的语音识别

Viet Anh Trinh, Xinlu He, Jacob Whitehill

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM修订和音义上下文提升课堂语音中命名实体的识别准确率,通过MIT课程数据集验证,实现30%的WER降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17827 2026-04-21 cs.CL 57%

Learning to Seek Help: Dynamic Collaboration Between Small and Large Language Models

学习寻求帮助:小语言模型与大语言模型之间的动态协作

Hang Zeng, Xiangyu Liu, Yong Hu, Chaoyue Niu, Jiarui Zhang, Shaojie Tang, Fan Wu, Guihai Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) WeChat Tencent, Beijing, China(微信腾讯) State University of New York at Buffalo, New York, United States(纽约州立大学布法罗分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出动态协作框架,使小模型主动请求大模型进行多步推理,大模型提供适应性反馈,通过系统研究协作策略受模型能力与效率隐私约束的影响,实验表明动态策略优于静态流程和独立推理,并能稳健迁移至未见的大模型。

Comments 8 content pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 57%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24635 2026-04-21 cs.SE cs.AI 57%

DynaFix: Iterative Automated Program Repair Driven by Execution-Level Dynamic Information

DynaFix:基于执行级动态信息的迭代自动程序修复

Zhili Huang, Ling Xu, Chao Liu, Weifeng Sun, Xu Zhang, Yan Lei, Meng Yan, Hongyu Zhang

机构 * Chongqing University(重庆大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 DynaFix通过迭代利用运行时动态信息改进程序修复,利用变量状态、控制流路径和调用栈等结构化提示引导LLM生成候选补丁,有效提升修复效率和准确性。

Comments 30 pages, 11 figures, preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18500 2026-04-21 cs.MA q-fin.GN 50%

QRAFTI: An Agentic Framework for Empirical Research in Quantitative Finance

QRAFTI:量化金融领域实证研究的代理框架

Terence Lim, Kumar Muthuraman, Michael Sury

专题命中 复杂问题求解 :planning(abstract)

AI总结 QRAFTI框架通过整合面板数据研究工具与MCP服务器,支持对大规模金融面板数据进行因子研究,可复现已有因子、测试新信号并生成标准化报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08491 2026-04-21 cs.HC 50%

Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery

图表作为接口:迈向面向大语言模型的科学发现原生图件

Yifang Wang, Rui Sheng, Erzhuo Shao, Yifan Qian, Haotian Li, Nan Cao, Dashun Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出LLM原生图件概念,通过融合语言-视觉接口,实现数据驱动的可解释图件,提升科学发现的可重复性和透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 91 篇

2604.10693 2026-04-21 cs.AI 90%

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG 90%

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11281 2026-04-21 cs.CL cs.AI cs.CY 89%

ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection

ToxiFrench:通过CoT微调提升法语毒性检测的语言模型基准测试

Axel Delaval, Shujian Yang, Haicheng Wang, Han Qiu, Jialiang Lu

机构 * École Polytechnique(巴黎高等理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出ToxiFrench数据集,通过半自动化标注流程构建,发现小语言模型在毒性检测任务中表现更优,并提出动态加权损失策略提升模型忠实度,Qwen3-4B模型在基准测试中取得最佳性能。

Comments 22 pages, 5 figures, 11 tables. This paper introduces TOXIFRENCH, a benchmark of 53,622 comments for French toxicity detection. It proposes a Chain-of-Thought fine-tuning method with a dynamic weighted loss. The fine-tuned 4B model (Qwen3-4B) achieves state-of-the-art performance, outperforming larger models like GPT-4o and DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12782 2026-04-21 cs.AI 88%

HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds

HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试

Petr Anokhin, Roman Khalikov, Stefan Rebrikov, Viktor Volkov, Artyom Sorokin, Vincent Bissonnette

机构 * Artyom Sorokin(AXXX) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Kurchatov Institute(库尔斯克研究所) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。

Comments Code is available at https://github.com/stefanrer/HeroBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17295 2026-04-21 cs.AI 87%

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

LLaTiSA:从视觉感知到语义的难度分层时间序列推理

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) Amap(高德)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07993 2026-04-21 cs.AI 87%

SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models

SkipKV: 为大推理模型高效推理选择性跳过KV生成与存储

Jiayi Tian, Seyedarmin Azizi, Yequan Zhao, Erfan Baghaei Potraghloo, Sean McPherson, Sharath Nittur Sridhar, Zhengyang Wang, Zheng Zhang, Massoud Pedram, Souvik Kundu

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出SkipKV方法,通过选择性跳过KV生成与存储,减少缓存大小,提升推理效率。方法引入句子评分指标,动态调整引导向量,实现高效推理,实验显示准确率提升26.7%,生成长度缩短1.6倍,吞吐量提升1.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17794 2026-04-21 cs.CL cs.AI 86%

Bridging the Reasoning Gap in Vietnamese with Small Language Models via Test-Time Scaling

通过测试时间扩展弥合越南语中的推理差距

Bui The Trung, Do Minh Duc, Nguyen Van Vinh, Bui Nguyen Quoc Trinh

机构 * Computer Science and Engineering(计算机科学与工程) Information Science Faculty(信息科学系) Faculty of Information(信息学院) Faculty of Advanced Technologies and Engineering(先进技术和工程学院) VNU Vietnam(越南VNU) Japan University(日本大学) JAIST VNU University of Engineering and Technology(VNU工程大学) VNU Vietnam Japan University(越南日本大学) Hanoi, Vietnam(越南河内) Ishikawa, Japan(日本石川)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在越南小学数学中通过测试时间扩展策略提升小语言模型推理能力,提出Vi-S1K和Vi-Elementary-Bench基准,发现SFT显著提升解释质量,证明简化测试时间扩展优于复杂代理流程。

Comments FJICAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏