PackFlow: Generative Molecular Crystal Structure Prediction via Reinforcement Learning Alignment
PackFlow:通过强化学习对齐进行生成分子晶体结构预测
专题命中 后训练与偏好优化 :post-training(abstract)
AI总结 PackFlow通过强化学习对齐生成分子晶体结构,提高预测准确性与效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PackFlow:通过强化学习对齐进行生成分子晶体结构预测
专题命中 后训练与偏好优化 :post-training(abstract)
AI总结 PackFlow通过强化学习对齐生成分子晶体结构,提高预测准确性与效率。
JavisDiT++:联合音频视频生成的统一建模与优化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; HiThink Research(HiThink研究) ; University of Rochester(罗切斯特大学) ; Nanyang Technological University(南洋理工大学)
专题命中 后训练与偏好优化 :preference optimization(abstract)
AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。
Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page
重新思考扩散模型的偏好对齐:基于分类器自由引导
机构 * Westlake University(西湖大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 后训练与偏好优化 :preference optimization(abstract)
AI总结 本文提出基于分类器自由引导的方法,通过分解偏好学习为两个模块并生成对比引导向量,提升扩散模型对人类偏好的对齐效果。
MemoTime: 带记忆的时序知识图增强大语言模型推理
机构 * UNSW Data61(新南威尔士大学Data61) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; UNSW Sydney Australia(新南威尔士大学悉尼分校) ; Data61, CSIRO(Data61,澳大利亚联邦科学与工业研究组织)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 MemoTime通过带记忆的时序知识图框架提升LLM的时序推理能力,解决多跳推理、多实体同步、运算符适应和经验重用等挑战,实现先进性能。
Comments Accepted by The Web Conference 2026 (WWW, 2026)
语言模型中的注意力缺陷:对程序性幻觉的因果解释
机构 * Hassana Labs(Hassana 实验室) ; University of Oxford(牛津大学)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.LG
AI总结 语言模型在执行复杂流程时出现程序性幻觉,研究发现其源于回答模式未激活或候选选择偏差,通过干预可显著提升远距离绑定准确性。
一个标记足矣:通过sink标记改进扩散语言模型
专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 通过引入额外的sink标记,改进扩散语言模型的稳定性与性能,该标记具有低语义内容且位置无关,提升模型鲁棒性。
超越一百万词:评估和增强LLM长期记忆的基准测试
机构 * University of Alberta(阿尔伯塔大学) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LIGHT框架,通过增强LLM的三种记忆系统,提升其在长对话任务中的表现,实验显示平均提升3.5%-12.69%。
AI记忆鸿沟:用户误记他们用AI创作或无AI创作的内容
机构 * Department of Computer Science University of Bayreuth Bayreuth Germany(计算机科学系 巴赖特大学 巴赖特 德国) ; Aalto University Espoo Finland(阿尔托大学 埃斯波 芬兰) ; University of Bayreuth(巴赖特大学) ; Aalto University(阿尔托大学)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究发现用户在使用AI生成内容后,对来源的记忆准确性下降,尤其在混合人工AI工作流程中更为明显,强调了在设计交互式文本生成技术时需考虑来源混淆问题。
Comments 22 pages, 10 figures, 10 tables, ACM CHI 2026
用于恶意软件分析的可解释性内存取证方法
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
AI总结 本文提出了一种基于AI的可解释内存取证方法,利用大语言模型解释内存分析结果并提取入侵指标,提升恶意软件分析的可解释性和实用性。
带有外部库的项目验证代码翻译
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
AI总结 本文提出一种框架,用于将依赖外部库的Go项目翻译为Rust,通过检索机制和跨语言验证流水线提高翻译和验证的准确性。
快速权重产品键内存
机构 * Sakana AI
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI
AI总结 FwPKM是一种稀疏快速权重内存层,通过稀疏梯度下降实现高效存储与检索,有效降低困惑度并提升长上下文处理能力。
混沌的代理
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI
AI总结 研究探讨自主语言模型代理在真实环境中的行为,揭示安全、隐私和治理漏洞,呼吁跨学科关注。
跨语言崩溃:语言中心化基础模型如何塑造大语言模型的推理
机构 * NAVER Cloud(NAVER云) ; KAIST(韩国科学技术院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(title);分类 cs.CL、cs.AI
AI总结 该研究探讨了多语言模型在长链思考中因语言中心化先验导致的推理能力下降问题,并提出通过语言一致性奖励等方法缓解这一现象。
Comments Preprint
Think$^{2}$: 大语言模型中的 grounded 元认知推理
机构 * IIIT Hyderabad(IIIT海得拉尔)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 Think$^{2}$通过引入基于心理理论的元认知框架,提升大语言模型的自我诊断与纠正能力,显著提高推理准确性和可信度。
大语言模型能取代人类程序员吗?引入ContentBench
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文通过ContentBench基准测试,评估低成本大语言模型在解释性编程任务中的表现,揭示其在高精度任务中的优势及在讽刺处理上的局限性。
Comments Project website: https://contentbench.github.io
大语言模型的推理能力。从通用游戏玩法中获得的教训
机构 * Grail Team(Grail团队) ; Warsaw University of Technology(华沙技术大学) ; AGH University of Krakow(克拉科夫AGH大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文通过通用游戏玩法任务评估大语言模型的推理能力,发现部分模型在多步骤任务中表现稳定,但随着任务复杂度增加性能下降。
阿拉伯数字阅读基准:评估大型语言模型在阿拉伯数字阅读任务中的表现
机构 * Imam Mohammad Ibn Saud Islamic University Saudi Arabia(伊玛目穆罕默德·本·沙特伊斯兰大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 阿拉伯数字基准评估大型语言模型在阿拉伯数字阅读任务中的表现,揭示不同提示策略和模型在准确率上的显著差异,指出结构化输出生成的挑战。
利用大语言模型进行贝叶斯网络结构发现
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Michigan State University(密歇根州立大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 本文提出了一种利用大语言模型进行贝叶斯网络结构发现的统一框架,支持数据自由和数据感知设置,在无数据场景下通过PromptBN生成完整DAG,在有数据时通过ReActBN进一步优化结构。
Comments Accepted to TMLR
通过样本一致性校准大型语言模型
机构 * University of Pennsylvania(宾夕法尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究院)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 通过样本一致性方法提升大型语言模型的校准效果,改进其预测置信度评估和性能表现。
Comments AAAI 2024
通过工具集成强化学习激励LLM裁判的代理推理
机构 * Emory University(埃默里大学) ; Google(谷歌) ; Google Cloud AI Research(谷歌云人工智能研究)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 TIR-Judge通过工具集成强化学习提升LLM裁判的推理能力,在多个基准测试中取得显著成效。
Comments ICLR 2026
Journal ref ICLR 2026
DSDR:双尺度多样性正则化用于LLM推理中的探索
机构 * The Ohio State University, USA(俄亥俄州立大学) ; Case Western Reserve University, USA(凯斯西储大学) ; The Chinese University of Hong Kong, Hong Kong(香港中文大学) ; Macquarie University, Australia(麦考瑞大学) ; University of Michigan, USA(密歇根大学) ; The University of Hong Kong, Hong Kong(香港大学) ; University College London, UK(伦敦大学学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。
依赖大语言模型的应用需要系统级威胁监控
机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理学院计算机与信息系统学院)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文主张对依赖大语言模型的应用进行系统级威胁监控,以应对由此带来的安全挑战和确保可靠操作。
Comments 26 pages
清晰可见,自信推理:用于视觉语言模型盲点的即插即用修复方法
机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) ; Department of Computer Science, University of Memphis(密苏里大学计算机科学系)
专题命中 推理与问题求解 :language model(title,abstract);foundation model(abstract);pretraining(abstract)
AI总结 本文提出一种无需微调的即插即用模块,通过细化视觉标记和丰富文本提示,提升VLM对罕见物体的推理能力。
Comments Accepted by CVPR 2026
MathScape:在现实数学情境中评估多模态大语言模型
机构 * Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nankai University(南开大学) ; Beijing Institute of Technology(北京理工大学) ; Baichuan Inc.(百度文心)
专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL
AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。
联邦推理蒸馏框架与模型可学习性感知的数据分配
机构 * Beihang University(北航) ; Heilongjiang University(黑龙江大学) ; Beijing University of Civil Engineering and Architecture(北京建筑大学) ; Yanshan University(燕山大学) ; Shandong University(山东大学) ; Renmin University of China(中国人民大学)
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 LaDa是一种联邦推理蒸馏框架,通过模型可学习性感知的数据分配和领域自适应推理蒸馏方法,解决双向模型可学习性差距和领域无关推理迁移问题。
MolReasoner:迈向分子大语言模型的有效且可解释的推理
机构 * DP Technology, Beijing, China(DP技术有限公司) ; AI for Science Institute, Beijing, China(AI for Science研究院) ; Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Fudan University, Shanghai, China(复旦大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)
AI总结 MolReasoner通过两阶段框架提升分子大语言模型的推理能力和可解释性,有效减少幻觉并提高生成质量。
Think2SQL: 通过可验证奖励强化学习增强大语言模型的推理能力以实现文本到SQL
机构 * Politecnico di Torino(托斯卡纳理工学院) ; EURECOM
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Think2SQL方法,通过可验证奖励强化学习增强大语言模型的推理能力,提升文本到SQL任务的性能。
Comments 26 pages, work in progress
HeatPrompt: 从卫星图像进行零样本的城市热需求视觉-语言建模
机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT), Germany(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 HeatPrompt通过卫星图像和地理信息数据,利用零样本视觉语言模型估算城市热需求,提升预测精度并支持数据稀缺地区的热规划。
TAPE: 语言模型代理中的工具引导自适应规划与约束执行
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 TAPE通过工具引导的自适应规划与约束执行方法,提升语言模型代理在复杂任务中的成功率,特别是在困难设置中表现显著优于现有框架。
Comments Preprint
对LLM代理轨迹进行水印标记
机构 * Zhejiang University, China(浙江大学) ; University of Virginia, USA(弗吉尼亚大学) ; Alibaba Qwen, China(阿里巴巴通义实验室) ; University of Alberta, Canada(阿尔伯塔大学)
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL
AI总结 本文提出ActHook,一种针对LLM代理轨迹数据集的水印方法,通过在决策点插入钩子动作实现可靠的黑盒检测,实验显示其在数学推理等任务中具有高检测精度且性能影响小。
Comments 20 pages, 9 figures