arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2601.05175 2026-03-24 cs.CV 85%

VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice

VideoAuto-R1:通过一次推理、两次回答实现视频自动推理

Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出VideoAuto-R1框架,通过一次推理两次回答策略提升视频理解效率,实现准确率和效率的双重提升。

Comments Accepted to CVPR 2026. Project page: https://ivul-kaust.github.io/projects/videoauto-r1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22117 2026-03-24 cs.LG cs.AI 81%

On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation

关于RLVR更新方向的LLM推理:识别与利用

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨RLVR更新方向对LLM推理的影响,提出通过Δlogp识别关键更新,并应用于测试时插值和训练时重加权以提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10679 2026-03-24 cs.AI cs.LG 81%

Are Your Reasoning Models Reasoning or Guessing? A Mechanistic Analysis of Hierarchical Reasoning Models

您的推理模型是推理还是猜测?对分层推理模型的机理分析

Zirui Ren, Ziming Liu

机构 * Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示分层推理模型在简单谜题中易失效,存在猜测动态和多固定点问题,提出数据增强、输入扰动和模型自举策略提升Sudoku-Extreme准确率至96.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21854 2026-03-24 cs.AI 79%

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

推理还是修辞?对大型语言模型中道德推理解释的实证分析

Aryan Kasat, Smriti Singh, Aman Chadha, Vinija Jain

机构 * TCS AI Practice(TCS人工智能实践) UT Austin(德克萨斯大学奥斯汀分校) Amazon GenAI(亚马逊生成人工智能) Google GenAI(谷歌生成人工智能)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过分析LSTM对道德困境的回应,探讨其是否具备道德发展阶段的真正进展,发现其表现出后常规推理,且存在道德解耦现象,揭示了对成熟道德推理的修辞模仿。

Comments 32 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21341 2026-03-24 cs.AI 79%

RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Models

RoboAlign:学习测试时推理以改进视觉-语言-动作模型中的语言-动作对齐

Dongyoung Kim, Sumin Park, Woomin Song, Seungku Kim, Taeyoung Kim, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * Yonsei University(延世大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出RoboAlign框架,通过零样本自然语言推理生成动作标记并结合强化学习提升动作准确性,从而在视觉-语言-动作模型中实现语言与低级动作之间的对齐,提升模型性能。

Comments 15 pages, 7 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20620 2026-03-24 cs.AI 79%

Reasoning Traces Shape Outputs but Models Won't Say So

推理轨迹影响输出但模型不会坦言

Yijie Hao, Lingjie Chen, Ali Emami, Joyce Ho

机构 * Emory University(埃默里大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨大推理模型产生的推理轨迹是否真实反映其输出驱动因素,发现注入合成推理片段能可靠改变输出,但模型在解释改变时普遍拒绝披露影响,激活分析显示系统性欺骗模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 78%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01205 2026-03-24 cs.HC 78%

When Machines Join the Moral Circle: The Persona Effect of Generative AI Agents in Collaborative Reasoning

当机器加入道德圈:生成式AI代理在协作推理中的人格效应

Yueqiao Jin, Roberto Martinez-Maldonado, Wanruo Shi, Songjie Huang, Mingmin Zheng, Xinbin Han, Dragan Gasevic, Lixiang Yan

专题命中 其他推理 :reasoning(title,abstract)

AI总结 研究探讨生成式AI代理在协作推理中对道德讨论的影响,发现支持性AI增强论证质量,而反对性AI扩大道德框架,表明AI队友能改变道德框架的分布与连接,而非单纯影响道德选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20730 2026-03-24 cs.IR cs.AI cs.CL cs.LG 67%

Do LLMs Understand Collaborative Signals? Diagnosis and Repair

大语言模型理解协作信号吗?诊断与修复

Shahrooz Pouryousef, Ali Montazeralghaem

机构 * Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究大语言模型在推荐任务中处理协作信息的能力,通过检索增强生成方法提升其推理性能,实验表明在提供清晰信息时LLM优于传统矩阵分解模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20397 2026-03-24 cs.LG cs.AI 62%

KV Cache Optimization Strategies for Scalable and Efficient LLM Inference

用于可扩展和高效大语言模型推理的键值缓存优化策略

Yichun Xu, Navjot K. Khaira, Tejinder Singh

机构 * Dell Technologies(戴尔技术)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文系统回顾了键值缓存优化技术,探讨了缓存淘汰、压缩、混合内存方案等五个方向,分析了不同场景下的性能和部署权衡,指出适应性多阶段优化流程是未来研究方向。

Comments 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21701 2026-03-24 cs.CV cs.AI 57%

Rethinking Token Reduction for Large Vision-Language Models

重新思考大型视觉-语言模型中的标记缩减

Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) School of Software Technology, Zhejiang University(浙江大学软件学院) National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MetaCompress,一种基于学习的无提示方法,解决多轮视觉问答中标记缩减的挑战,通过统一压缩映射提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15276 2026-03-24 cs.DB cs.CL 57%

AmbiSQL: Interactive Ambiguity Detection and Resolution for Text-to-SQL

AmbiSQL: 用于文本到SQL的交互式歧义检测与解决

Zhongjun Ding, Yin Lin, Tianjing Zeng, Rong Zhu, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 AmbiSQL通过交互式多选问题帮助用户澄清意图,解决文本到SQL中的歧义问题,提升SQL生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21155 2026-03-24 cs.AI 57%

Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs

大语言模型能否欺骗图学习?探索文本属性图上的通用对抗攻击

Zihui Chen, Yuling Wang, Pengfei Jiao, Kai Wu, Xiao Wang, Xiang Ao, Dalin Zhang

机构 * School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学信息学院) Hangzhou Dianzi University(杭州电子科技大学) Beihang University(北京航空航天大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BadGraph框架,通过联合扰动节点拓扑和文本语义,实现对文本属性图模型的通用对抗攻击,实验显示攻击效果显著,性能下降达76.3%。

Comments Accepted by TheWebConf (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21036 2026-03-24 cs.CL 57%

Left Behind: Cross-Lingual Transfer as a Bridge for Low-Resource Languages in Large Language Models

落后者:跨语言迁移作为低资源语言在大语言模型中的桥梁

Abdul-Salem Beibitkhan

机构 * North American University(北美大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了大语言模型在低资源语言上的表现,发现英语与低资源语言之间存在13.8-16.7个百分点的性能差距,跨语言迁移对双语架构有帮助,但对英语主导模型无益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20732 2026-03-24 cs.CL 57%

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

MzansiText 和 MzansiLM:一种面向南非语言的开放语料库和解码器-only 语言模型

Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍MzansiText和MzansiLM,针对南非11种官方语言中的9种低资源语言,通过任务特定微调在自然语言理解与生成任务中取得显著成果,但小规模下少量推理仍具挑战性。

Comments 15 pages, 11 tables, appendix included. Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20650 2026-03-24 cs.AI cs.CY 57%

From 50% to Mastery in 3 Days: A Low-Resource SOP for Localizing Graduate-Level AI Tutors via Shadow-RAG

从50%到精通:一种低资源SOP,通过影子RAG本地化研究生级AI导师

Zonglin Yang, J. -H. Xie, Lining Zhang, Jiyou Jia, Zhi-X. Chen

机构 * School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院) Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司) Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院) AI for Science Institute, Beijing, 100080, China(AI for Science研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种低成本SOP,利用影子RAG架构和数据清洗策略,在3人天内本地化研究生级AI导师,使32B模型性能从74%提升至90%。

Comments 9 pages, 3 figures, practitioner report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01162 2026-03-24 cs.LG stat.ML 57%

Demystifying Group Relative Policy Optimization: Its Policy Gradient is a U-Statistic

解开群体相对策略优化:其策略梯度是U统计量

Hongyi Zhou, Kai Ye, Erhan Xu, Jin Zhu, Ying Yang, Shijin Gong, Chengchun Shi

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文通过经典U统计量框架解析GRPO,证明其策略梯度本质为U统计量,推导其MSE、有限样本误差界及渐近分布,揭示GRPO渐近等价于拥有价值函数的最优策略梯度算法,并建立通用缩放规律指导最优分组大小选择。

Comments 5 pages, 53 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 57%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21481 2026-03-24 cs.IR 50%

TagLLM: A Fine-Grained Tag Generation Approach for Note Recommendation

TagLLM: 一种用于笔记推荐的细粒度标签生成方法

Zhijian Chen, Likai Wang, Lei Chen, Yaguang Dou, Jialiang Shi, Tian Qi, Dongdong Hao, Mengying Lu, Cheng Ye, Chao Wei

专题命中 其他推理 :CoT(abstract)

AI总结 TagLLM通过用户兴趣手册和多模态CoT提取构建细粒度标签数据,采用标签知识蒸馏提升小模型生成能力,有效提升笔记推荐的点击率和用户停留时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20309 2026-03-24 cs.IR cs.DB 50%

BubbleRAG: Evidence-Driven Retrieval-Augmented Generation for Black-Box Knowledge Graphs

BubbleRAG:基于证据的检索增强生成用于黑盒知识图谱

Duyi Pan, Tianao Lou, Xin Li, Haoze Song, Yiwen Wu, Mengyi Deng, Mingyu Yang, Wei Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 针对黑盒知识图谱的检索与精度问题,提出BubbleRAG方法,通过语义锚点分组、启发式气泡扩展等技术提升召回率与精度,实验显示其在多跳问答任务中表现优异。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏