arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-30 至 2026-07-30 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2607.26102 2026-07-30 cs.CR cs.AI 新提交 87%

A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

检测大语言模型中沉默推理失败的无参考分数

Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.AI

AI总结 该研究针对大语言模型数学思维链评估的推理-答案一致性差距问题,提出无参考的RAFS分数,结合多维度指标诊断沉默推理与答案提取错误,相关研究在GSM8K、MATH数据集上开展验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26119 2026-07-30 cs.AI cs.CL 新提交 81%

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量

Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。

Comments Second Workshop on XAI4Science, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 62%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 4 篇

2607.26903 2026-07-30 cs.AI cs.RO 新提交 70%

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

从被动视频到可编辑体验:具身智能的物理基础体验合成

Jia Luo

专题命中 逻辑推理 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 针对具身AI的数据瓶颈,提出Pegasus低资源框架,通过结构化知识传递将人类操作视频转化为机器人可学习数据,经多基准与机器人评估验证其跨具身翻译及数据生成的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26602 2026-07-30 cs.NI cs.LG 新提交 57%

Harnessing Large Language Models for Intelligent Resource Allocation in the Internet of Everything

利用大语言模型实现万物互联环境下的智能资源分配

Haijun Zhang, Zhuojun Duan, Zijun Wu, Xu Ma, Yuzheng Ren

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对万物互联的动态资源调度挑战,提出大语言模型驱动的资源分配方案,构建多维调度决策模型并引入反馈模块,仿真显示其在收敛速度等指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交 57%

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 57%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 10 篇

2607.26324 2026-07-30 eess.SY cs.SY 新提交 78%

Planning Waste-to-Energy-Coupled AI Data Centers Through Grade-Matched Cooling and Corridor Screening

通过品位匹配冷却与廊道筛选规划耦合垃圾发电的AI数据中心

Qi He, Chunyu Qu, Wenjie Zuo

专题命中 规划推理 :planning(title,abstract)

AI总结 本研究针对AI数据中心发展受供电、互联及冷却制约的问题,开发耦合WtE的冷却廊道筛选框架,通过品位匹配提供冷却,经案例验证其可实现电力节省与规模适配,明确了WtE耦合冷却的可行性及约束条件。

Journal ref Thermo2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 57%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27177 2026-07-30 cs.AI cs.HC cs.MA 新提交 57%

Partner Capability Estimation for Task-Agnostic Adaptation in Ad-Hoc Teamwork

面向临时团队中任务无关适应的伙伴能力估计

Peter Tisnikar, Maja Swieczkowska, Benteng Ma, Gerard Canal, Matteo Leonetti

机构 * King’s College London(伦敦国王学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该研究针对临时团队协作中伙伴能力隐藏与人类行为不可预测问题,提出CE-CM及CE-CM-Div方法,通过仿真采样与多样规划器rollout实现任务无关的能力估计,提升了团队协作的可行性与鲁棒性。

Comments 44 pages, 18 figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27130 2026-07-30 cs.AI 新提交 57%

AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching

AgentMap:用于本体匹配的联合等价与包含关系发现

Yiping Song, Jiaoyan Chen, Renate Schmidt, Hui Yang, Wen Zhang

机构 * The University of Manchester(曼彻斯特大学) Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出统一等价与包含发现的混合本体匹配任务,构建基于LLM的多智能体框架AgentMap,在三类设置下的本体匹配任务中均取得优异性能。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27106 2026-07-30 cs.LG 新提交 57%

Hierarchical Spatio-Temporal Transformer for Coherent Emergency Department Forecasting

用于连贯急诊科预测的分层时空Transformer

Filipa Lino, Bárbara Tavares, Carlos Santiago, Cláudia Soares, Manuel Marques

机构 * Institute for Systems and Robotics(系统与机器人研究所) LARSyS Instituto Superior Técnico(高等技术学院) NOVA School of Science and Technology(NOVA科学技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有急诊科预测方法忽略层级关联导致预测不连贯的问题,提出HierSTT分层时空Transformer框架,在葡萄牙ED数据集上实现多层面连贯预测,性能优于非分层基线及经典分层协调方法。

Comments Accepted at 11th Workshop on Data Science for Social Good - ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26935 2026-07-30 cs.AI cs.CR 新提交 57%

What Does It Take to Detect an AI Agent? Minimal Feature Sets for Behavioral Detection under Browser Automation

检测AI智能体需要什么?浏览器自动化下行为检测的最小特征集

Vishisht Choudhary, Lukas Schmidt, Anne Zoë Kenntner, Feras Skhab, Michel Osswald, Jens Ernstberger

机构 * Technical University of Munich(慕尼黑工业大学) Kontext

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出三类检测框架区分人类、机器人与AI智能体,发现最小特征集可实现AI智能体的稳健检测,且基于浏览器自动化的缺失特征构建判别信号,抗规避能力优异。

Comments 17 pages (11 main + appendices), 7 figures. Accepted at the North East AI Agents Day 2026 workshop, Jane Street, New York City. Workshop: https://ne-agents-day.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26520 2026-07-30 cs.DB cs.AI cs.IR 新提交 57%

A Graph-Native Bitemporal Memory Store for Conversational AI Agents

面向对话式AI智能体的原生图双时态内存存储

Alp Niksarli, Gopesh Baheti

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对对话式AI智能体跨会话持久内存缺失的问题,提出原生图双时态内存存储方案,经LongMemEval基准测试,在知识更新等任务上取得良好效果,为纯检索的局限性提供了改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27100 2026-07-30 cs.CY 新提交 50%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 规划推理 :planning(abstract)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26893 2026-07-30 cs.IR 新提交 50%

Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising

超越动作模仿:面向在线广告的决策感知用户模拟器学习

Zipeng Chen, Jiaer Zheng, Xiangyang Xu, Xinyu Lin, Zhaobin Wang, Zhaohui Liu, Qianjin Xiang, Xiaoyu Zhao, Zhuozhen Yu, Guangshuo Wang, Daxing Chen, Junwei Pan, Zhangbin Zhu, Chengguo Yin, Hao Chen, Tat-Seng Chua, Haijie Gu, Jie Jiang

专题命中 规划推理 :reasoning(abstract)

AI总结 针对现有用户模拟器仅基于单领域交互模仿动作的缺陷,本文提出决策感知用户模拟器DASH,通过上下文工程、蒸馏思考轨迹与定制规则奖励模型,在腾讯广告数据上验证了其多维度优势。

Comments 23 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26836 2026-07-30 cs.CR 新提交 50%

Before Agents Speak: Pre-hoc Failure Risk Inference in Multi-Agent Systems

智能体交流前:多智能体系统中的事前失败风险推断

Shi Lin, Chenpei Wang, Peng Qian, Dezhang Kong, Minghao Li, Yufeng Li, Xun Wang

专题命中 规划推理 :reasoning(abstract)

AI总结 本研究针对多智能体系统中幻觉级联失败的问题,提出事前风险推断框架HalluProp,通过建模内在幻觉风险与传播机制实现早期诊断,性能优于事后方法,可提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 5 篇

2607.27145 2026-07-30 cs.CV 新提交 78%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26910 2026-07-30 cs.CV 新提交 67%

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

CinemaTraj:用LLM智能体为3D场景合成原子相机轨迹

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

机构 * Technical University of Munich(慕尼黑工业大学) Huawei Dresden Research Center(华为德累斯顿研究中心)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 CinemaTraj是将LLM智能体与3D场景图结合的框架,可从自然语言生成带旁白的3D场景相机轨迹,在真实环境中优于现有方法。

Comments 17 pages, including 8-page main paper, references, and supplementary material; project page: https://cinematraj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26769 2026-07-30 cs.CV cs.AI 新提交 57%

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

See2Think:多模态模型是否真正利用中间视觉状态?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。

Comments 10 pages, 5 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26595 2026-07-30 cs.CV 新提交 50%

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26196 2026-07-30 cs.CV 新提交 50%

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

Rad-JEPA 3D:用于三维计算机断层扫描的放射学联合嵌入预测模型

Quoc-Huy Trinh, Minh-Van Nguyen, Ulas Bagci

机构 * Northwestern University(西北大学) Technical University of Denmark(丹麦技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Rad-JEPA 3D是用于3D CT的自监督联合嵌入预测框架,采用混合H-Mamba编码器与HSOR正则化,在12万次CT扫描预训练后,在器官识别、空间推理等任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 2 篇

2607.26819 2026-07-30 cs.SE cs.AI 新提交 57%

A First Look at Coding Agents' Compliance with AI Contribution Rules in Open-Source Communities

初探编码智能体在开源社区中对AI贡献规则的合规性

Wenhao Yang, Runzhi He, Minghui Zhou

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本研究构建RepoComplianceBench基准测试编码智能体对开源社区AI贡献规则的合规性,发现当前智能体几乎不主动检索规则,仅在提示等辅助下实现披露与验证,但始终不执行AI禁令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26335 2026-07-30 cs.DC 新提交 50%

The Fabric Is the Cluster Driver: Cross-Layer eBPF Policies for GPU-CXL Fabrics

Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略

Yiwei Yang, Andi Quinn

专题命中 测试时计算 :verifier(abstract)

AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 4 篇

2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 84%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26588 2026-07-30 cs.AI 新提交 57%

Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models

Eco3S:基于智能体模型的复杂社会经济系统仿真

Shaopeng Wei, Yufei Cheng, Wenxi Sun, Yepeng Ding, Yu Zhao, Gang Kou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Eco3S是面向经济研究与政策分析的社会经济系统仿真框架,通过三种关键机制解决现有LLM-based ABM的挑战,经多场景实验验证其有效性、可扩展性与通用性。

Comments 18 pages, 18 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交 50%

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26409 2026-07-30 cs.NI 新提交 50%

Can We Trust AI in 6G? Verifiable and Auditable AI-Driven Trustworthy Wireless Networks

我们能信任6G中的AI吗?可验证且可审计的AI驱动可信无线网络

Genze Jiang, Yizhou Huang, Kezhi Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对6G中AI在无线网络应用的信任问题,提出基于3GPP规范的机械审计方法与原生审计网络架构,支持AI功能的部署前认证和运行时审计,为AI驱动的可信无线网络提供解决方案。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 17 篇

2607.26977 2026-07-30 cs.CL 新提交 90%

TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning

TREK:面向复杂行程规划的大语言模型智能体旅行推理与评估工具包

Jinhu Qi, Wentao Zhang, Siu Man Ng, Feiyang Xu, Yanyu Chen, Yaoman Li, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Macao Polytechnic University(澳门理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 本研究推出TREK旅行基准测试,解决现有行程规划智能体基准的不足,实验显示最强LLM智能体仅在不足五成任务生成可行计划,满足旅行者未明确需求是普遍瓶颈。

Comments Code, data, and evaluator: https://github.com/TonyQJH/TREK-A-Travel-Reasoning-and-Evaluation-Kit-for-LLM-Agents-in-Complex-Trip-Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26952 2026-07-30 cs.CL 新提交 87%

Credit Cards, Confusion, Computation, and Consequences: What Can We Uncover About Language Model Reasoning?

信用卡、困惑、计算与后果:我们能从语言模型推理中发现什么?

Arnav Hiray, Agam Shah, Caleb Lu, Meghaj Tarte, Harsit Mittal, Sudheer Chava

机构 * College of Computing(计算机学院) Scheller College of Business(舍勒商学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 该研究构建了首个基于真实信用卡协议的数值推理金融素养基准CreditCardQA,评估发现程序思维(PoT)提示可提升模型推理性能,错误多源于金融规则误用等,边缘案例易影响财务脆弱群体。

Comments Accepted at CoLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏