arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-18 至 2026-06-18 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2606.19257 2026-06-18 cs.CL 新提交 87%

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

DreamReasoner-8B:面向扩散推理模型的块大小课程学习

Zirui Wu, Lin Zheng, Jiacheng Ye, Shansan Gong, Xueliang Zhao, Yansong Feng, Wei Bi, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 提出块大小课程学习,通过从细粒度到粗粒度的渐进训练,解决块扩散语言模型在长链推理中性能差距问题,DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18624 2026-06-18 cs.CL 新提交 83%

PragReST: Self-Reinforcing Counterfactual Reasoning for Pragmatic Language Understanding

PragReST:用于语用语言理解的自我强化反事实推理

Jihyung Park, Minchao Huang, Leqi Liu, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 提出PragReST框架,通过自监督构建语用问答数据、生成反事实推理轨迹,结合监督微调和强化学习提升大语言模型的语用推理能力,在四个基准上显著优于基线模型。

Comments First two authors contributed equally. Code and models: https://github.com/jihyung803/PragReST

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18910 2026-06-18 cs.LG cs.CL 新提交 62%

REVES: REvision and VErification--Augmented Training for Test-Time Scaling

REVES:通过修订与验证增强的测试时扩展训练

Yuanxin Liu, Ruida Zhou, Xinyan Zhao, Amr Sharaf, Hongzhou Lin, Arijit Biswas, Mohammad Ghavamzadeh, Zhaoran Wang, Mingyi Hong

机构 * Northwestern University(西北大学) Amazon AGI(亚马逊人工智能实验室) Qualcomm AI Research(高通人工智能研究) University of Minnesota(明尼苏达大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出REVES框架,通过将中间步骤的“接近正确”答案转化为解耦的修订和验证提示,实现高效的离策略数据生成,提升大语言模型的多步推理能力,在LiveCodeBench上比强化学习基线高6.5分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交 57%

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18453 2026-06-18 cs.CL 新提交 57%

LLM Parameters for Math Across Languages: Shared or Separate?

跨语言数学问题的LLM参数:共享还是分离?

Behzad Shomali, Luisa Victor, Tim Selbach, Ali Hamza Bashir, David Berghaus, Joachim Koehler, Mehdi Ali, Markus Frey

机构 * Lamarr Institute(Lamarr研究所) University of Bonn(波恩大学) Fraunhofer IAIS(弗劳恩霍夫智能分析和信息系统研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 通过跨语言机制分析,发现多语言LLM中数学相关参数存在部分跨语言重叠,且主要集中在中间层,英语参数集最大,低资源语言参数集较小。

Comments 5 pages. Accepted at ACL Student Research Workshop (SRW) 2026. Code: https://github.com/luisavictor/math-across-languages Translated Datasets: https://huggingface.co/math-across-languages Webpage: https://math-across-languages.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2606.19315 2026-06-18 cs.LG 新提交 70%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 代码与定理证明 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18746 2026-06-18 cs.AI 新提交 57%

What Must Generalist Agents Remember?

通用型智能体必须记住什么?

Khurram Yamin, Namrata Deka, Maitreyi Swaroop, Albert Ting, Jeff Schneider, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文形式化论证了通用型智能体为在多个环境和目标下近似最优行动,必须存储领域相关信息以区分观察瓶颈处的不兼容最优动作,并证明记忆可用于重构局部转移动态。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 1 篇

2606.18850 2026-06-18 cs.CL cs.IR 新提交 74%

ScholarSum: Student-Teacher Abstractive Summarization via Knowledge Graph Reasoning and Reflective Refinement

ScholarSum:基于知识图谱推理与反思性精炼的师生式抽象摘要生成

Bohou Zhang, Xiaoyu Tao, Mingyue Cheng, Huijie Liu, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL

AI总结 提出ScholarSum框架,通过构建层次知识图谱引导学生生成初稿,并利用教师式审阅者迭代检查与修正,实现科学文献摘要的流畅性与事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 14 篇

2606.18947 2026-06-18 cs.AI cs.CL cs.IR cs.MA 新提交 81%

Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents

将搜索与推理解耦:面向LLM Agent的供应商无关的接地架构

Emmanuel Aboah Boateng, Kyle MacDonald, Amardeep Kumar, Siddharth Kodwani, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出解耦搜索接地(DSG)架构,将搜索接地从推理模型中分离,通过MCP兼容网关实现供应商路由、缓存等控制,在降低成本和延迟的同时保持或提升准确性。

Comments 15 pages, Figure 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18954 2026-06-18 cs.CL 新提交 79%

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO:基于图的推理模型策略优化

Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出GraphPO框架,将推理轨迹建模为有向无环图,通过合并语义等价路径减少冗余探索,并利用边级优势函数提高推理效率,在多个基准上优于链式和树式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18105 2026-06-18 cs.NI cs.LG 新提交 79%

OmniPlan: An Adaptive Framework for Timely and Near-Optimal Network Planning Optimization

OmniPlan:一种用于及时且近乎最优的网络规划优化的自适应框架

Longlong Zhu, Jiashuo Yu, Zedi Chen, Yuhan Wu, Zhifan Jiang, Yuchen Xian, Yimeng Liu, Jiajie Su, Shaopeng Zhou, Xingyuan Li, Hongyan Liu, Xuan Liu, Dong Zhang, Chunming Wu, Xiang Chen

机构 * Zhejiang University(浙江大学) Fuzhou University(福州市大学) Yangzhou University(扬州大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 提出OmniPlan自适应框架,利用大语言模型解析用户意图,通过混合专家架构动态选择MIP求解器、启发式算法或深度强化学习模型,实现网络规划优化的及时性与近乎最优性,在分布式机器学习推理卸载任务中延迟降低97.8%,资源消耗降低11.5%。

Comments Accepted by ACM KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19214 2026-06-18 econ.GN q-fin.EC 新提交 78%

Testing Centralized and Polycentric Computational Planning

测试集中式和多中心计算规划

Ricardo Alonzo Fernández Salguero

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出一个可复现的合成基准,在模拟经济中比较计算规划者、基于代理的市场和混合元市场,发现规划者福利损失更低,但结果受设计选择影响,主要贡献是方法论而非意识形态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18633 2026-06-18 cs.MA 新提交 78%

PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

PersonalPlan: 面向个性化编程学习的多智能体系统规划

Zhiyuan Wen, Jiannong Cao, Peng Gao, Haochen Shi, Wengpan Kuan, Bo Yuan, Xiuxiu Qi

专题命中 规划推理 :planning(title,abstract)

AI总结 提出PersonalPlan,一种两阶段多智能体规划器,通过分层SFT和奖励自适应GRPO生成可执行、个性化且具有教学支架的计划,在MAP-PPL数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18516 2026-06-18 cs.RO 新提交 78%

Task Allocation and Motion Planning in Dynamic, Cluttered Environments via CBBA and Graphs of Convex Sets

动态杂乱环境下的任务分配与运动规划:基于CBBA与凸集图

Matthew D. Osburn, Cameron K. Peterson, John L. Salmon

机构 * Electrical and Computer Engineering(电气与计算机工程系) Mechanical Engineering(机械工程系)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对动态杂乱环境中的多智能体任务规划,提出结合凸集图(GCS)进行轨迹优化与共识捆绑算法(CBBA)进行分布式任务分配的方法,实现安全高效的轨迹规划和任务协调。

Comments 15 pages single column, 10 figures, AIAA-Scitech 2027 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 70%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13672 2026-06-18 cs.RO 新提交 67%

WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

$\texttt{WEAVER}$:更好、更快、更长——一种有效的机器人操作世界模型

Arnav Kumar Jain, Yilin Wu, Jesse Farebrother, Gokul Swamy, Andrea Bajcsy

机构 * Mila - Québec AI Institute(Mila - 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) McGill University(麦吉尔大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 提出WEAVER世界模型架构,通过流匹配损失训练多视图潜在预测,同时实现高保真度、长程一致性和高效推理,在机器人操作任务中显著提升策略评估、改进和测试时规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 62%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19308 2026-06-18 cs.CL cs.MA 新提交 57%

Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play

通过多智能体虚拟博弈增强大语言模型的决策能力

Leyang Shen, Yang Zhang, Xiaoyan Zhao, Chun Kai Ling, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多智能体系统中决策任务因立场纠缠而难以分解的问题,提出基于虚拟博弈的多智能体虚拟博弈(MAFP)范式,通过迭代最佳响应实现均衡求解,提升决策质量和鲁棒性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19172 2026-06-18 cs.AI 新提交 57%

User as Engram: Internalizing Per-User Memory as Local Parametric Edits

用户作为印迹:将每用户记忆内化为局部参数编辑

Bojie Li

机构 * Pine AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出User as Engram方法,将用户事实存储为Engram模型的哈希键控记忆表中的局部编辑,推理技能共享一个适配器,实现高精度间接推理且内存占用极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15504 2026-06-18 cs.AI 新提交 57%

Toward Vibe Medicine: A Self-Evolving Multi-Agent Framework for Clinical Decision Support

迈向振动医学:一种用于临床决策支持的自演化多智能体框架

Qianxue Zhang, Yiming Ren, Shihuan Qin, Xiao Zhang, Liao Zhang, Jinyang Huang, Zhengliang Liu, Chenbin Liu, Hongying Feng, Jingyuan Chen, Yuzhen Ding, Weihang You, Hanqi Jiang, Yi Pan, Yifan Zhou, Junhao Chen, Lifeng Chen, Wei Liu, Tianming Liu, Zengren Zhao, Lian Zhang

机构 * Medical AI Lab, The First Hospital of Hebei Medical University(河北医科大学第一医院医学人工智能实验室) Hebei Provincial Engineering Research Center for AI-Based Cancer Treatment Decision-Making, The First Hospital of Hebei Medical University(河北省人工智能癌症治疗决策工程研究中心,河北医科大学第一医院) State Key Laboratory of Neurology and Oncology Drug Development(神经与肿瘤药物研发国家重点实验室) School of Computing, University of Georgia(佐治亚大学计算学院) Department of Radiation Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital and Shenzhen Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院北京协和医学院国家癌症中心/国家肿瘤临床医学研究中心/肿瘤医院深圳医院放射治疗科) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) College of Mechanical and Power Engineering, China Three Gorges University(三峡大学机械与动力工程学院) Department of Radiation Oncology, Guangzhou Concord Cancer Center(广州康华肿瘤中心放射治疗科) Gastrointestinal Disease Diagnosis and Treatment Center, The First Hospital of Hebei Medical University(河北医科大学第一医院胃肠疾病诊疗中心) Department of General Surgery, The First Hospital of Hebei Medical University(河北医科大学第一医院普通外科)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出VIBEMed多智能体框架,通过自演化机制和架构级安全沙箱,从交互历史中动态学习,实现个性化临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12837 2026-06-18 cs.CL 新提交 57%

LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling

LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试

Jiarui Zhao, Rongzhi Zhang, Lingchuan Liu, Hao Yang, Xunliang Cai, Xi Su

机构 * Meituan(美团)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19267 2026-06-18 cs.RO cs.SY eess.SY 新提交 50%

A Mixed-Reality Testbed for Autonomous Vehicles

自动驾驶汽车的混合现实测试平台

H. M. Sabbir Ahmad, Ehsan Sabouni, Emrullah Celik, Zean Wan, Damola Ajeyemi, Christos G. Cassandras, Wenchao Li

机构 * Division of Systems Engineering(系统工程系) Boston University(波士顿大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 规划推理 :planning(abstract)

AI总结 提出一种混合现实硬件在环测试平台,集成物理移动机器人与高保真仿真环境,用于验证感知、规划和控制算法,并支持多智能体系统研究。

Comments 9 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 5 篇

2606.18846 2026-06-18 cs.CV 新提交 82%

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具

Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) OPPO

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11918 2026-06-18 cs.AI 新提交 79%

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

提问的艺术:一致性增强空间推理中的事实性

Theo Uscidda, Marta Tintore Gazulla, Maks Ovsjanikov, Federico Tombari, Leonidas Guibas

机构 * The University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Oxford(牛津大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自监督强化学习框架,通过几何与语义一致性验证器(如图像翻转、文本对象顺序交换)对齐预训练模型的内在空间推理能力,无需标注数据即可达到接近监督方法的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18441 2026-06-18 cs.CV 新提交 78%

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

推理即交集:视频多模态大语言模型中视觉焦点的一致性帧对齐

Chengwen Liu, Zhe Huang, Jisheng Dang, Hong Peng, Qi Tian, Tat-Seng Chua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Cloud and AI BU, Huawei(华为云与AI业务部) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出无时间标注的过程级奖励框架CF-GRPO,通过视频内在线索构建一致性帧先验,并利用一致性帧奖励优化模型帧使用与先验的对齐,提升视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19253 2026-06-18 cs.CV cs.AI cs.LG cs.RO 新提交 62%

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

OneCanvas: 通过全景重投影实现3D场景理解

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学) Huawei(华为)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出OneCanvas方法,将多视图补丁特征聚合到全景画布上,利用深度和相机位姿进行重投影,无需复杂几何编码器或大量训练,在SQA3D等基准上达到最先进精度。

Comments Project page: https://baranowskibrt.github.io/onecanvas/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16849 2026-06-18 cs.NE cs.GR cs.HC 新提交 50%

Evolution & Foundation: AI Shares Creative Control

进化与基础模型:AI共享创意控制

Dylan Banarse, Stephen Todd, William Latham, Frederic Fol Leymarie

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 6 篇

2606.18385 2026-06-18 cs.AI 新提交 92%

CaVe-VLM-CoT: An Interpretable Vision-Language Model Framework

CaVe-VLM-CoT:一种可解释的视觉-语言模型框架

Sneha Rao, Shaina Raza, Dhanesh Ramachandram

机构 * Vector Institute(向量研究所)

专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 提出CaVe-VLM-CoT框架,通过五阶段闭环流水线(提取器、检索器、求解器、引用注入器、验证器)实现证据推理,并引入CaVeScore复合指标评估检索质量、引用忠实度和跨模态基础,在ScienceQA和MMMU上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 79%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19264 2026-06-18 cs.LG cs.CL 新提交 62%

Structured Inference with Large Language Gibbs

大语言吉布斯结构化推理

Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer

机构 * University of Edinburgh, School of Informatics(爱丁堡大学信息学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出大语言吉布斯方法,利用大语言模型的条件分布作为转移算子进行结构化概率推理,通过迭代重采样变量避免顺序偏差,在合成分布、一致性推理和贝叶斯结构学习中验证有效性。

Comments Code: https://github.com/hyeok9855/large-language-gibbs

详情

展开后加载摘要…

URL PDF HTML 收藏