arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-31 至 2026-07-31 共收录 101 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2606.11018 2026-07-31 cs.CL 版本更新 91%

Measuring Human Value Expression in Social Media Texts: Calibrated LLM Annotation and Encoder Transfer

测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移

Maria Milkova, Maksim Rudnev

机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16651 2026-07-31 cs.CL 版本更新 90%

Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations

选择还是投影?评估用于LLM训练数据解释的低维向量

Lukas Hinterleitner, Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过对比选择和投影方法,发现有针对性的组件选择在LLM训练数据解释中更有效且计算更高效。

Comments KONVENS 2026. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13977 2026-07-31 cs.CL cs.AI cs.LG 版本更新 87%

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究

Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

机构 * Hugging Face University of Sheffield(谢菲尔德大学) National Institute of Informatics(日本信息处理研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05539 2026-07-31 cs.AI 版本更新 86%

From Large Language Model Predicates to Logic Tensor Networks: Neurosymbolic Offer Validation in Regulated Procurement

从大型语言模型谓词到逻辑张量网络:神经符号学在受规制采购中的投标验证

Cedric Haufe, Frieder Stolzenburg

机构 * Harz University of Applied Sciences(哈尔茨应用科学大学) Merseburg University of Applied Sciences(梅泽堡应用科学大学) University of New South Wales (UNSW)(新南威尔士大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文提出一种结合符号与子符号人工智能的神经符号方法,用于验证受规制公共机构的投标文件,通过语言模型提取信息并结合逻辑张量网络(LTN)进行可审计决策,提升决策的可解释性和合规性。

Comments 17 pages, 2 figures, 4 tables, extended version, with appendix

Journal ref In Diedrich Wolter and Gesina Schwalbe, editors, KI 2026: Advances in Artificial Intelligence -- 49th German Conference on AI, LNAI 16830, pages 236--243, Bremen, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15011 2026-07-31 cs.LG cs.AI cs.CY cs.MA 版本更新 81%

Epistemic diversity across language models mitigates knowledge collapse

语言模型中的知识崩溃与认知多样性

Damian Hodel, Jevin D. West

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过增加语言模型多样性缓解知识崩溃,发现单一模型短期表现好但长期崩溃加剧,多样性水平随训练迭代增加而提升,实验显示生态多样性对缓解崩溃至关重要。

Comments 30 pages, 21 figures. v3 changelog: updated introduction. v2 changelog: added experimental variations, updated theory, writing revisions, updated metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22078 2026-07-31 cs.RO 版本更新 67%

Do World Action Models Generalize Better than VLAs? A Robustness Study

世界动作模型是否比视觉语言动作模型表现更好?一项鲁棒性研究

Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati, Rui Heng Yang, Yintao Ma, Amir Rasouli, Sajjad Pakdamansavoji, Yangzheng Wu, Lingfeng Zhang, Tongtong Cao, Feng Wen, Xinyu Wang, Xingyue Quan, Yingxue Zhang

机构 * Huawei Technologies(华为技术有限公司) University of Toronto(多伦多大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文比较了最新状态的VLA策略和最近发布的WAMs,在不同视觉和语言扰动下评估其性能,发现WAMs在鲁棒性上表现更强,而VLA需要大量训练数据和多样化学习目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07861 2026-07-31 cs.CV 版本更新 50%

From Synthetic to Real: Toward Identity-Consistent Makeup Transfer with Synthetic and Real Data

从合成到真实:迈向身份一致的化妆转移的合成与真实数据

Yue Yu, Jiayu Wang, Jiajia Shi, Zhiyu Tan, Hao Li, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 预训练与数据 :post-training(abstract)

AI总结 本文提出ConsistentBeauty和RealBeauty方法,通过合成数据筛选和强化学习提升化妆转移的逼真度与身份一致性,并建立多样化基准测试以评估模型在复杂真实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 9 篇

2607.20145 2026-07-31 cs.CL cs.AI 版本更新 91%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 89%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 88%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26654 2026-07-31 cs.CL cs.AI cs.CY cs.LG 版本更新 86%

Constitutional Midtraining: Content Presence Drives Alignment Gains

宪法式中间训练:内容存在驱动对齐增益

Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt

机构 * University of Oxford(牛津大学) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Geodesic Research Oxford Internet Institute, University of Oxford(牛津大学互联网研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出宪法式中间训练方法,在中间训练中插入基于原则价值观的内容,可提升模型对齐的泛化性与持久性,削弱SFT灌输的敲诈倾向且不造成能力损失,为以SFT为中心的流程提供低成本补充方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31413 2026-07-31 cs.AI cs.LG 版本更新 73%

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

学会选择,而非重新学习:硬路由推理LoRA混合

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

机构 * Halmstad University(哈尔姆斯塔德大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。

Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10497 2026-07-31 cs.CL cs.AI 版本更新 73%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 67%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15040 2026-07-31 cs.AI cs.CL 版本更新 62%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 指令微调 :SFT(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新 57%

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2604.16557 2026-07-31 cs.LG cs.CL cs.CV 版本更新 93%

S-GRPO: Unified Post-Training for Large Vision-Language Models

S-GRPO:面向大视觉语言模型的统一后训练方法

Yuming Yan, Kai Tang, Sihong Chen, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu

机构 * Tencent(腾讯)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);language model(title,abstract);post-training(title,abstract);preference optimization(abstract)

AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18046 2026-07-31 cs.CV cs.AI 版本更新 79%

Enhancing Scene Transition Awareness in Video Generation via Post-Training

通过后训练增强视频生成中的场景转换意识

Hanwen Shen, Jiajie Lu, Yupeng Cao, Xiaonan Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07343 2026-07-31 cs.CL cs.LG 版本更新 79%

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

个性化奖励基准:评估与人类对齐的个性化

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。

Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 70%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2606.22932 2026-07-31 cs.LG 版本更新 79%

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练

Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

机构 * Puch AI Singapore Institute of Technology(新加坡理工大学) Nanyang Technological University(南洋理工大学) NVIDIA(英伟达) IIIT-Delhi(德里印度理工学院)

专题命中 长上下文与记忆 :LLM(title);pretraining(abstract);分类 cs.LG

AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05554 2026-07-31 cs.LG cs.AI cs.DM math.CA 版本更新 73%

Critical attention scaling in long-context transformers

长上下文Transformer中的关键注意力缩放

Shi Chen, Zhengjiang Lin, Yury Polyanskiy, Philippe Rigollet

机构 * Department of Mathematics, Massachusetts Institute of Technology(数学系,麻省理工学院) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(电气工程与计算机科学系,麻省理工学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对长上下文Transformer的注意力秩崩溃问题,通过分析简化模型确定关键缩放因子$\beta_n \backsim \text{log} n$,为YaRN和Qwen的注意力缩放提供理论依据,阐明对数缩放可维持长上下文下的稀疏内容自适应注意力。

Comments 31 pages, 2 figures

Journal ref Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17121 2026-07-31 cs.LG cs.AI 版本更新 62%

The Topological Trouble With Transformers

Transformer 的拓扑困境

Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了Transformer在处理序列结构时的拓扑问题,指出其纯前馈架构限制了动态状态跟踪,提出应通过递归架构转向隐含激活动态,并介绍了连续思维Transformer架构的分类方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19139 2026-07-31 cs.CV 版本更新 50%

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

文本模板令牌是扩散Transformer中的隐式语义寄存器

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究文本到图像扩散Transformer中内部计算,引入因果可解释性框架,发现结构模板令牌充当隐式语义寄存器,据此设计剪枝规则,还揭示其生成计算组织方式,提供了DiTs内部机制的因果视图。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 10 篇

2510.01427 2026-07-31 cs.AI 版本更新 89%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26621 2026-07-31 cs.IR cs.AI 版本更新 84%

WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models

WhisperRec:用于高效基础推荐模型的潜在推理方法

Hao Jiang, Peiru Du, Pengfei Yao, Mengting Li, Siyuan Lou, Kuo Cai, Sheng Yu, Qiang Luo, Jian Liang, Ruiming Tang, Fei Pan, Peng Jiang, Wenwu Ou

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 WhisperRec是一种高效潜在推理框架,通过将教师CoT压缩为可学习潜在标记,在快手数据集上优于显式CoT方法,SID@64提升显著且推理吞吐量更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10207 2026-07-31 cs.IR 版本更新 80%

LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation

LASAR:潜在自适应语义对齐推理用于生成推荐

Yiwen Chen, Fuwei Zhang, Zehao Chen, Hehan Li, Peizhi Xu, Hanmeng Liu, Shuanglong Li, Xin Pei, Fuzhen Zhuang, Zhao Zhang

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10345 2026-07-31 cs.SE 版本更新 80%

Recovering Fine-Grained Code Change Rationale from Multiple Software Artifacts

细粒度多文档提取与代码变更理由生成

Mehedi Sun, Antu Saha, Nadeeshan De Silva, Antonio Mastropaolo, Oscar Chaparro

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文研究如何从多个文档中提取代码变更理由,提出ARGUS方法,通过LLM生成简洁的变更理由摘要,提升代码理解和维护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24268 2026-07-31 cs.CL 版本更新 74%

Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

准确性掩盖了语言模型的失败方式:在匹配输出预算下测量失败状态

Zongyou Yang, Yinghan Hou

专题命中 推理与问题求解 :language model(title);分类 cs.CL

AI总结 研究指出语言模型基准测试中准确性分数掩盖问题,引入两层评估框架分离执行证据与正确性。通过实验表明不同模型在匹配输出限制下执行组合不同,验证策略会影响准确性估计,强调评估应同时报告执行状态、覆盖范围和评分者来源。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 73%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏