arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5804 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5804 篇

2405.11040 2024-05-21 cs.CL physics.med-ph 70%

From Generalist to Specialist: Improving Large Language Models for Medical Physics Using ARCoT

Jace Grandinetti, Rafe McBeth

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14025 2024-04-23 cs.CL 70%

Large Language Models and Multimodal Retrieval for Visual Word Sense Disambiguation

Anastasia Kritharoula, Maria Lymperaiou, Giorgos Stamou

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Conference on Empirical Methods in Natural Language Processing (EMNLP) 2023

Journal ref Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12574 2024-04-09 cs.IR cs.AI 70%

Modeling Uncertainty and Using Post-fusion as Fallback Improves Retrieval Augmented Generation with LLMs

Ye Liu, Semih Yavuz, Rui Meng, Meghana Moorthy, Shafiq Joty, Caiming Xiong, Yingbo Zhou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01727 2024-02-06 cs.CY cs.AI 70%

Prompting Diverse Ideas: Increasing AI Idea Variance

Lennart Meincke, Ethan R. Mollick, Christian Terwiesch

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14422 2024-02-02 cs.CL 70%

Large Language Models are biased to overestimate profoundness

Eugenio Herrera-Berg, Tomás Vergara Browne, Pablo León-Villagrá, Marc-Lluís Vives, Cristian Buc Calderon

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 5 pages, 3 figures

Journal ref https://aclanthology.org/2023.emnlp-main.599

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03458 2023-12-07 cs.CL 70%

Think from Words(TFW): Initiating Human-Like Cognition in Large Language Models Through Think from Words for Japanese Text-level Classification

Chengguang Gan, Qinghao Zhang, Tatsunori Mori

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01044 2023-12-05 cs.CL 70%

Large Language Models Are Zero-Shot Text Classifiers

Zhiqiang Wang, Yiran Pang, Yanbin Lin

专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

Comments 9 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05131 2023-03-01 cs.CL 70%

UL2: Unifying Language Learning Paradigms

Yi Tay, Mostafa Dehghani, Vinh Q. Tran, Xavier Garcia, Jason Wei, Xuezhi Wang, Hyung Won Chung, Siamak Shakeri, Dara Bahri, Tal Schuster, Huaixiu Steven Zheng, Denny Zhou, Neil Houlsby, Donald Metzler

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Updated Q1 2023 with Flan-UL2 20B release! :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21131 2025-10-27 cs.CL cs.AI cs.LG 69%

Large Language Models Meet Text-Attributed Graphs: A Survey of Integration Frameworks and Applications

Guangxin Su, Hanchen Wang, Jianwei Wang, Wenjie Zhang, Ying Zhang, Jian Pei

机构 * The University of New South Wales(新南威尔士大学) The University of Technology Sydney(技术大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) Duke University(杜克大学)

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments Surveys and overviews; Natural language processing; Knowledge representation and reasoning; Graph algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12219 2025-02-25 cs.CL cs.AI cs.LG 69%

Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning

Jiasheng Ye, Zaixiang Zheng, Yu Bao, Lihua Qian, Quanquan Gu

专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments add results on reasoning and multimodality; add discussions on latest progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17941 2026-08-19 cs.LG cs.AI cs.CL 新提交 67%

Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation

基于图结构在线难度估计的高效RLVR调度

Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16844 2026-08-18 cs.LG cs.AI cs.CL 新提交 67%

Proteus: Incremental Memory Activation for Long-Context Sequence Modeling

Proteus:面向长上下文序列建模的增量式内存激活机制

Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville

机构 * Mila(米拉计算科学研究所) Google(谷歌公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11660 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing

用于可组合非结构化知识编辑的混合策略自编辑

Tianci Liu, Zihan Dong, Tianchun Li, Yi-Chung Chen, Qiming Cao, Xingchen Wang, Shiyang Wang, Zichen Miao, Linjun Zhang, Haoyu Wang, Jing Gao

机构 * University of Tennessee(田纳西大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) University at Albany(奥尔巴尼大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11233 2026-08-13 cs.CL cs.AI cs.LG 新提交 67%

Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets

将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留

Mark Shapiro

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06578 2026-08-12 cs.AI cs.CL cs.LG 交叉投稿 67%

Divergent Response Modes in Frontier Language Models Under Steering Pressure

前沿语言模型在引导压力下的发散响应模式

Ali Jalal-Kamali

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07595 2026-08-12 cs.IR 版本更新 67%

Towards Comprehensible Recommendation with Large Language Model Fine-tuning

基于大语言模型微调的可理解推荐研究

Yunze Luo, Yinjie Jiang, Gaode Chen, Xinghua Zhang, Kaigui Bian

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究针对传统推荐的语义协同差距问题,提出CURec框架,通过微调LLM并结合强化学习优化,提升推荐可理解性与性能,在公开基准上表现更优。

Comments 11 pages, 6 figures, to be published on CIKM '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22137 2026-08-11 cs.DC 版本更新 67%

HybridFlow: Resource-Adaptive Subtask Routing for Efficient Edge-Cloud LLM Inference

HybridFlow: 适应资源的子任务路由用于高效的边缘-云LLM推理

Jiangwen Dong, Jiayu Li, Tianhang Zheng, Wanyu Lin

专题命中 其他推理 :reasoning(abstract,abstract_cn)

AI总结 HybridFlow通过动态资源适应的子任务路由框架,提升边缘-云LLM推理的效率与准确性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04980 2026-08-06 cs.CL cs.AI cs.LG 新提交 67%

Protoreasoning in Tiny Transformers

微型Transformer中的原型推理

Eduardo Valle, Fergal Reid

机构 * Fin AI Research(Fin AI研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12448 2026-08-05 cs.CL cs.AI cs.LG 版本更新 67%

Uncovering Spontaneous Physics Representations in In-Context Learning

揭示上下文学习中自发形成的物理表征

Yeongwoo Song, Jaeyong Bae, Dong-Kyum Kim, Hawoong Jeong

机构 * Department of Physics, KAIST(KAIST物理系) MPI for Security and Privacy, Germany(德国安全与隐私研究所) Center for Complex Systems, KAIST(KAIST复杂系统中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11699 2026-07-28 cs.SD 版本更新 67%

Qwen-Music Technical Report

Qwen-音乐技术报告

Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian Lin, Dake Guo, Hangrui Hu, Lei Xie, Linhan Ma, Wei Xue, Wenxiang Guo, Xinfa Zhu, Xipin Wei, Yangze Li, Yuanjun Lv, Yuxuan Wang, Yunfei Chu, Zhiyong Wu

机构 * Qwen Team(通义团队)

专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract)

AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 67%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19847 2026-07-23 cs.LG cs.AI cs.CL cs.DB 新提交 67%

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

自动填充:使用专业语言模型准确预测缺失值

Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。

Comments VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Knowledge-Centric Self-Improvement

以知识为中心的自我改进

Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu, Amanda Zichang Wang, Atharva Sehgal, Eric Mazumdar, Yisong Yue

机构 * Caltech(加州理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 67%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19933 2026-07-15 cs.CL cs.AI cs.LG 67%

NRR-Phi: A Typed External Text-to-State Interface and Update Contract for Inspectable Ambiguity-State Maintenance

NRR-Phi:LLM推理中为保持歧义性的文本到状态映射

Kei Saito

机构 * Independent Researcher, Japan(日本独立研究员)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NRR-Phi框架,通过文本到状态映射保留多解释性,在LLM推理中延迟语义坍缩。

Comments 30 pages, 5 figures, 8 tables. Replacement synced to the current GitHub repository snapshot. Series hub: https://github.com/kei-saito-research/nrr-series-hub

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交 67%

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 67%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05196 2026-07-08 cs.CL cs.AI cs.LG cs.SD eess.AS 新提交 67%

Unified Audio Intelligence Without Regressing on Text Intelligence

不退化文本智能的统一音频智能

Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim, Boxin Wang, Zihan Liu, Sungwon Kim, Yang Chen, Arushi Goel, Rajarshi Roy, Wenliang Dai, Zhuolin Yang, Yangyi Chen, Dongfu Jiang, Sreyan Ghosh, Tuomas Rintamaki, Andrew Tao, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。

Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 67%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01104 2026-07-02 cs.LG cs.AI cs.CL 新提交 67%

CausalMix: Data Mixture as Causal Inference for Language Model Training

CausalMix: 数据混合作为语言模型训练的因果推断

Zinan Tang, Yukun Zhang, Shaomian Zheng, Zhuoshi Pan, Qizhi Pei, Dingnan Jin, Jun Zhou, Yujun Wang, Biqing Huang

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏