From Generalist to Specialist: Improving Large Language Models for Medical Physics Using ARCoT
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 8 pages, 3 figures, 1 table
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 8 pages, 3 figures, 1 table
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Conference on Empirical Methods in Natural Language Processing (EMNLP) 2023
Journal ref Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments 5 pages, 3 figures
Journal ref https://aclanthology.org/2023.emnlp-main.599
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 其他推理 :reasoning(abstract);CoT(abstract);分类 cs.CL
Comments 9 pages, 3 figures, 6 tables
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
Comments Updated Q1 2023 with Flan-UL2 20B release! :)
机构 * The University of New South Wales(新南威尔士大学) ; The University of Technology Sydney(技术大学悉尼分校) ; University of Technology Sydney(技术大学悉尼分校) ; Duke University(杜克大学)
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments Surveys and overviews; Natural language processing; Knowledge representation and reasoning; Graph algorithms
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments add results on reasoning and multimodality; add discussions on latest progress
基于图结构在线难度估计的高效RLVR调度
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
用于可组合非结构化知识编辑的混合策略自编辑
机构 * University of Tennessee(田纳西大学) ; Rutgers University(罗格斯大学) ; Purdue University(普渡大学) ; University at Albany(奥尔巴尼大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究针对现有非结构化知识编辑存在的可组合性缺失问题,提出HPSE方法,通过构建混合生成结果实现主动自蒸馏,在多种LLM及编辑工具上取得即插即用的性能提升。
将循环深度改造融入预训练语言模型:在两个参数预算下的安装、外推、迁移与保留
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究在Qwen2.5-0.5B-Instruct中融入循环深度,在两个参数预算下实现安装,其模型在ARC测试集等任务上性能优于同等规模基准,可外推至1.5倍监督深度,推理速度更快。
前沿语言模型在引导压力下的发散响应模式
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究评估六种前沿语言模型在引导压力下的响应差异,发现模型间存在不同响应模式,以Llama为对象追溯到内部机制,相关发现经多实验验证。
基于大语言模型微调的可理解推荐研究
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 该研究针对传统推荐的语义协同差距问题,提出CURec框架,通过微调LLM并结合强化学习优化,提升推荐可理解性与性能,在公开基准上表现更优。
Comments 11 pages, 6 figures, to be published on CIKM '26
HybridFlow: 适应资源的子任务路由用于高效的边缘-云LLM推理
专题命中 其他推理 :reasoning(abstract,abstract_cn)
AI总结 HybridFlow通过动态资源适应的子任务路由框架,提升边缘-云LLM推理的效率与准确性。
Comments Accepted by ICML 2026
微型Transformer中的原型推理
机构 * Fin AI Research(Fin AI研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出原型推理,在约100万参数的微型Transformer上实现逐步推理,通过Dyck语言任务验证其可缩小分布外泛化差距,助力探究LLM的通用推理能力。
揭示上下文学习中自发形成的物理表征
机构 * Department of Physics, KAIST(KAIST物理系) ; MPI for Security and Privacy, Germany(德国安全与隐私研究所) ; Center for Complex Systems, KAIST(KAIST复杂系统中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。
Comments 15 pages, 10 figures
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
RecGPT-V3技术报告
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。
Comments Technique Report
自动填充:使用专业语言模型准确预测缺失值
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。
Comments VLDB 2026
以知识为中心的自我改进
机构 * Caltech(加州理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。
通过对比信念更新来衡量奖励寻求行为
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。
Comments 101 pages, 66 figures
NRR-Phi:LLM推理中为保持歧义性的文本到状态映射
机构 * Independent Researcher, Japan(日本独立研究员)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出NRR-Phi框架,通过文本到状态映射保留多解释性,在LLM推理中延迟语义坍缩。
Comments 30 pages, 5 figures, 8 tables. Replacement synced to the current GitHub repository snapshot. Series hub: https://github.com/kei-saito-research/nrr-series-hub
当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Rice University(里士满大学) ; Workato(Workato公司) ; University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。
RepLLM:迈向自动重现网络研究结果
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。
Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
快手总结注意力技术报告
机构 * Kuaishou(快手)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。
Comments update related works
CausalMix: 数据混合作为语言模型训练的因果推断
机构 * Tsinghua University(清华大学) ; Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出CausalMix框架,将数据混合优化视为因果推断问题,通过条件平均处理效应估计最优混合比例,在7B模型上提升多任务性能,并具备可解释性。
Comments 22 pages, 3 figures