GENESIS: Towards Explainable Causal Discovery
GENESIS:迈向可解释的因果发现
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。
Comments 13 pages, 2 figures, 13 tables, 1 algorithm
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
GENESIS:迈向可解释的因果发现
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。
Comments 13 pages, 2 figures, 13 tables, 1 algorithm
ReasonCast:面向可解释时间序列预测的推理方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文提出任务融合模型ReasonCast,通过微调LLM实现时间序列预测与可解释文本推理的联合生成,在预测准确性上优于LLM和TS模型,还构建了联合评估基准ReasonTS-Bench。
HLE多项选择子集的维度与测量精度
机构 * Stanford University(斯坦福大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。
AoA:基于重新设计语言抽象语法树的定理证明智能体
机构 * Nanyang Technological University Singapore(南洋理工大学新加坡分校) ; Imperial College London London, UK(伦敦帝国理工学院伦敦分校) ; University of Edinburgh Edinburgh, UK(爱丁堡大学爱丁堡分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 研究针对交互式定理证明中人工操作限制可扩展性及基于LLM的证明智能体成本高的问题,提出将智能体从源文本提升到抽象语法树的方法,实现了AoA,在多个方面有显著提升且解决更多难题。
Comments 13 pages
自动演化特定任务优化的提示指南
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型提示指南优化问题,提出AGOPS方法,利用现有任务示例隐含信息,通过优化方案自动演化特定任务指南,提升下游任务性能,弥补提示不明确导致的性能损失。
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。
三狼人杀:大型语言模型中多跳心智理论的丑角角色
专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。
爱因斯坦世界模型
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) ; Tohoku University(东北大学)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。
Comments 12 pages (9 without references), 2 figures, 1 algorithm
智能体模型批判
机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。
量化RAG系统中的先验主导性
机构 * ArtificialGate Ltd.(ArtificialGate有限公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);small language model(abstract);SLM(abstract_cn)
AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。
Comments 15 pages, Preprint
智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。
Operadic一致性:LLM中组合推理失败的无标签信号
机构 * Incubilate ; University of Cambridge(剑桥大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 推理与问题求解 :LLM(title_cn,abstract);分类 cs.CL、cs.LG
AI总结 提出Operadic一致性(OC)作为检测大语言模型组合推理失败的无标签信号,在四个多跳QA数据集上与准确率强相关(Pearson r≥0.86),优于自一致性等方法。
知识图谱与推理大语言模型用于寻找简单而有效的转录组扰动预测因子
机构 * University College London(伦敦大学学院) ; University of Manchester(曼彻斯特大学) ; Valence Labs(Valence实验室) ; Recursion(Recursion公司)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 利用知识图谱的K近邻方法在基因敲除扰动预测中表现优异,结合强化学习优化的LLM可达到最先进性能。
上下文视觉-语言-动作模型:通过上下文后训练与智能体工具使用为视觉-语言-动作模型赋予语言能力
专题命中 推理与问题求解 :post-training(title,abstract);language model(abstract)
AI总结 该研究针对现有VLA模型用CoT会降低控制性能的问题,提出通过上下文后训练和智能体工具使用赋予VLA语言能力的方法,在多模拟和真实机器人任务上实现SOTA性能与效率。
SpatialQuery:评估视觉语言模型中基于几何的多实例空间推理能力
机构 * Posts and Telecommunications Institute of Technology(邮电技术学院)
专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract)
AI总结 该研究针对视觉语言模型的多实例空间推理缺陷,推出SPATIALQUERY框架及含百万对问答的SPATIALQUERY-1M基准,结合UA-CoT提示,使Qwen3-VL-8B在空间推理任务中表现优于多种模型。
面向LLM智能体的优先执行式合成工具使用轨迹生成
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 针对传统数据合成的局限,提出优先执行式框架SyntheticAgentTraceQA生成工具增强型智能体的监督数据,经四工具生态系统及Qwen模型验证,该框架可提升工具执行等性能,且揭示了掩码与全监督的权衡。
LaRec:释放基于大语言模型的生成式推荐中的潜在推理能力
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究针对LLMs在推荐中现有方法的问题,提出LaRec框架。核心方法是通过潜在预训练赋予潜在推理能力,用个性化强化学习调整引导遍历多样推理路径。主要贡献是在多数据集实验中,以相当效率显著超越现有基线。
并非所有大语言模型的推理都能在思维链中体现
机构 * New York University(纽约大学) ; University of Maryland(马里兰大学) ; TogetherAI
专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。
从管道和仪表图到过程图:一种多模态语言模型方法
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)
AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。
MechMem-RTL:用于基于大语言模型的RTL修复的可复用验证机制存储器
专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)
AI总结 研究针对大语言模型修复RTL设计时,利用任务文本相似性易误导的问题,提出MechMem-RTL框架,复用验证器确认的修复记录,通过严格匹配触发证据来注入记录,实验表明该框架在多个任务上修复效果优于标准反馈修复和任务相似性RAG。
Comments 7 pages, 6 figures, 3 tables
当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示
机构 * National University of Singapore(新加坡国立大学) ; Center of AI Research, VinUniversity(文大人工智能研究中心)
专题命中 推理与问题求解 :prompting(title,abstract);language model(abstract)
AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。
Comments Work in progress
摆脱普罗克汝斯忒斯之床:用于音频语言模型的分组正交连接器
机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所) ; ASUS AICS
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract)
AI总结 研究音频语言模型压缩中存在的问题,提出ORCA方法,通过分组使查询输出指向不同方向,在SAKURA多跳推理中表现出色,提升分数,减少查询冗余并提高跨说话者方差。
重新思考基础模型协作:通过代理任务推理增强专用模型
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)
专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)
AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。
比较推理:让音频语言模型更擅长比较情感
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; NVIDIA(英伟达)
专题命中 推理与问题求解 :language model(title,abstract);preference optimization(abstract)
AI总结 提出一种推理引导的序数情感识别框架,通过配对语音输入和推理轨迹训练音频语言模型,实现可解释的比较情感判断,仅需传统方法5%的训练数据。
PAIWorld: 用于机器人操作的三维一致世界基础模型
机构 * Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)
专题命中 推理与问题求解 :foundation model(title,abstract);post-training(abstract)
AI总结 提出PAIWorld框架,通过几何感知交叉注意力、几何旋转位置编码和潜在3D-REPA蒸馏,解决多视图世界模型的3D不一致问题,在机器人操作基准上取得领先性能。
BioHarness:面向生物医学问答的底物感知证据组装——跨文献、知识库和生物图谱
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments)
AI总结 提出BioHarness,通过级联控制机制在文献检索、知识库和生物图谱间选择性组装证据,提升生物医学问答准确率,在19,302个问答项上得分从65.9提升至71.0。
Comments 14 Pages, 11 Figures, Keywords: biomedical question answering; retrieval-augmented generation; large language models; evidence assembly; biomedical knowledge bases; biological atlases
通过浏览器可访问的LLM交互得到度/直径问题的新下界
专题命中 推理与问题求解 :LLM(title,title_cn)
AI总结 通过与ChatGPT交互发现图构造,改进了度/直径问题的下界:N(12,5)≥34,992和N(16,5)≥147,456。
InternVideo3: 用多模态上下文推理代理化基础模型
机构 * Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学)
专题命中 推理与问题求解 :foundation model(title,abstract);pretraining(abstract)
AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。
推理评审团:用于评估推理轨迹的多模型共识机制
机构 * Amazon AGI(亚马逊AGI)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。
SAG:基于查询时动态超边的SQL检索增强生成
机构 * Zleap AI(智量科技)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本研究提出SAG(SQL检索增强生成)架构,通过查询时动态超边实现结构化检索,在HotpotQA等多跳问答基准上性能优于基线,为LLM智能体处理组织知识提供了新方案。