arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-12 至 2026-08-12 共收录 147 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2608.10108 2026-08-12 cs.AI 新提交 57%

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA:面向长视野智能体记忆的任务自适应多结构证据选择

Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MESA是面向长视野智能体记忆的多结构证据选择框架,通过自适应选择融合互补记忆结构,在AMA-Bench上性能优于基线且减少了证据标记使用量。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09790 2026-08-12 cs.AI cs.MA cs.SI 版本更新 57%

CARD: Controlled Agentic Reddit Discussions for Credit Card Simulation

CARD:用于信用卡模拟的受控智能体Reddit讨论框架

Yaoning Yu, Kai-Min Chang, Ye Yu, Yi-Chia Wang, Haojing Luo, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) U.S. Bank(美国银行) Stanford University(斯坦福大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究提出CARD框架,通过规划器、生成器与校准循环,结合多维度控制项生成逼真信用卡讨论线程,经多指标评估,其效果优于多种LLM模拟基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09096 2026-08-12 cs.CL 版本更新 57%

Evo-Bench: Can Language Models Improve Agent Harness?

Evo-Bench:语言模型能否改进智能体框架?

Lisheng Huang, Chen Yang, Hao Zhou, Huatong Song, Zongchao Chen, Ran Le, Yang Song, Wayne Xin Zhao, Tao Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06128 2026-08-12 cs.AI 版本更新 57%

Contextual Information Policy Optimization for Search Agents

面向搜索智能体的上下文信息策略优化

Xingyu Guo, Wei Chen, Linlin Yang, Baochang Zhang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有搜索智能体方法存在的先验驱动推理问题,提出CIPO框架,通过回合级信用分配对齐策略与证据使用,无需额外标注或奖励模型,在7个基准上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 57%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18579 2026-08-12 cs.IR cs.AI 版本更新 57%

GraFine: Retrieval-Time Refinement for Efficient Graph RAG over Corpus Graphs

FastInsight: 图形RAG中通过融合运算实现快速且有洞察力的检索

Seonho An, Chaejeong Hyun, Min-Soo Kim

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 FastInsight通过融合运算提升图RAG检索效率和洞察力,改进检索准确性和生成质量。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00945 2026-08-12 cs.LG cs.CY 版本更新 57%

TS-Mob: Social and Geographical-Aware Time Series Foundation-Model Framework for Human Mobility Prediction

TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架

Massimiliano Luca, Ciro Beneduce, Bruno Lepri

机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) Department of Computer Science, University of Trento(特伦托大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11164 2026-08-12 cs.IR 新提交 50%

Role of Personality in Conversational Information Seeking

人格在对话式信息检索中的作用

Abdisalam Abukar, Junchen Fu, Chengli Zhai, Joemon M. Jose

专题命中 规划推理 :planning(abstract)

AI总结 本研究以大五人格为变量,开展受控被试内实验,发现助手人格与任务的交互作用影响对话式信息检索的信任与决策,助手人格需作为语境敏感的交互设计变量。

Comments Accepted by CIKM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 50%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 规划推理 :planning(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10838 2026-08-12 cs.CV 新提交 50%

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

PolyLayout:超越矩形房间的分层VLM引导布局生成

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

机构 * IKEA Retail (Ingka Group)(宜家零售(英卡集团))

专题命中 规划推理 :planning(abstract)

AI总结 PolyLayout提出混合分层VLM引导框架,分三阶段生成非矩形房间布局,在生产数据和不规则拓扑上表现出高感知合理性、低延迟,填补了学术与实际应用的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10485 2026-08-12 cs.RO 新提交 50%

JitTrack: Onboard Multi-Object Tracking Against Viewpoint Jitter for Agile UAVs

JitTrack:面向敏捷无人机的、应对视点抖动的机载多目标跟踪

Yachun Shan, Feitian Zhang

专题命中 规划推理 :planning(abstract)

AI总结 针对敏捷无人机机载多目标跟踪的视点抖动难题,提出JitTrack框架,结合语义细化、运动感知查询校正等技术,通过闭环流水线实现鲁棒跟踪,实验验证其有效性。

Comments 9 pages, 7 figures. Submitted to IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 50%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 规划推理 :planning(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08787 2026-08-12 eess.AS 版本更新 50%

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

超越重构:用于音乐生成的全上下文生成式DiT

Yunjia Li, Menglin Wu, Junyu Dai, Xinyue Fan, Xiangang Li, Haoxu Wang, Jianwei Yu, Huaicheng Zhang, Han Zhao, Weiqin Li, Yufei Shi, Cheng Wen, Sitong Zhao, Qixi Zheng, Haina Zhu, Wei Li

专题命中 规划推理 :planning(abstract)

AI总结 该研究提出FullDiT模型,通过EMDC和4-CFG等技术解决混合音乐生成器的编解码器接口暴露偏差问题,其系统在多数自动指标上优于商业系统且在人工分析中排名前三。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08101 2026-08-12 q-bio.PE 版本更新 50%

From Stochastic Shocks to Macroscopic Tails: The Moyal Distribution as a Unified Framework for Epidemic Dynamics

从随机冲击到宏观尾部:Moyal分布作为流行病动态的统一框架

Jose de Jesus Bernal-Alvarado, David Delepine, Omar Rafael Ramirez-Guzman

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于Moyal分布的统一框架,通过微观碰撞过程描述病毒传播,揭示宏观社会摩擦的涌现属性,用于解释极端流行病事件。

Comments 19 pages, 8 figures, published in PHYS A: Statistical Mechanics and its appilcations

Journal ref published in PHYS A: Statistical Mechanics and its appilcations (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 13 篇

2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 81%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 80%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23399 2026-08-12 cs.AI 版本更新 79%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10886 2026-08-12 cs.CV cs.RO 新提交 78%

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

GESTO:面向动态场景推理的以人为中心的时空记忆

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) Google Research(谷歌研究院) TU Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 78%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新 71%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉空间推理 :reasoning(title)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 67%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 62%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10835 2026-08-12 cs.CV cs.LG 新提交 57%

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

机构 * NVIDIA Research(英伟达研究院) Technion(以色列理工学院) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%

Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 57%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 50%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07218 2026-08-12 cs.CV 版本更新 50%

SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis

SceneNAT:基于语言引导的室内场景合成的掩码生成模型

Jeongjun Choi, Yeonsoo Park, H. Jin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。

Comments Under review. Project page: https://scenenat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 16 篇

2608.07968 2026-08-12 cs.CL cs.AI 版本更新 90%

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源

Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 87%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);self-correction(abstract)

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 83%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏