arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-28 至 2026-04-28 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 39 篇

2604.18398 2026-04-28 cs.CL cs.AI 62%

AlphaContext: An Evolutionary Tree-based Psychometric Context Generator for Creativity Assessment

AlphaContext:一种基于进化树的心理测量情境生成器用于创造力评估

Yixuan Wang, Yue Huang, Hong Qian, Yunzhao Wei, Yifei Ding, Wenkai Wang, Zhi Liu, Zhongjing Huang, Aimin Zhou, Jiajun Guo

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 AlphaContext通过进化树方法生成高质量的情境,提升创造力评估的准确性与多样性,实验显示在六个质量指标上平均提升8%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA 62%

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03669 2026-04-28 cs.LG cs.AI cs.DM math.OC stat.ML 62%

Unrealized Expectations: Comparing AI Methods vs Classical Algorithms for Maximum Independent Set

未实现的期望:比较AI方法与经典算法在最大独立集问题上的表现

Yikai Wu, Haoyu Zhao, Sanjeev Arora

机构 * Department of Computer Science & Princeton Language and Intelligence (PLI)(计算机科学系及普林斯顿语言与智能中心) Princeton University(普林斯顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了AI方法与经典算法在最大独立集问题上的性能,发现经典算法在随机图上表现更优,AI方法存在系统性不足,需重新审视AI在组合优化中的应用。

Comments Published on TMLR 04/2026. 28 pages, 6 figures, 98 tables

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23924 2026-04-28 cs.AI q-bio.BM 57%

Agentic AI platforms for autonomous training and rule induction of human-human and virus-human protein-protein interactions

用于自主训练和人类-病毒蛋白-蛋白相互作用规则诱导的代理AI平台

Hung N. Do, Jessica Z. Kubicek-Sutherland, Oscar A. Negrete, S. Gnanakaran

机构 * Theoretical Biology and Biophysics Group, Theoretical Division(理论生物学与生物物理学组,理论 division) Physical Chemistry and Applied Spectroscopy Group, Chemistry Division(物理化学与应用光谱组,化学 division) Systems Biology Department, Sandia National Laboratories(系统生物学部门,桑迪亚国家实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出两种代理AI平台,分别用于自主训练预测ML模型和诱导人类-病毒蛋白-蛋白相互作用的显式规则,通过数据收集、验证、特征嵌入等步骤提升预测准确率并增强可解释性。

Comments Other correspondence email: donguyenhung238@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23902 2026-04-28 cs.AI 57%

LLM-Augmented Traffic Signal Control with LSTM-Based Traffic State Prediction and Safety-Constrained Decision Support

基于LSTM的交通信号控制与大语言模型增强的交通状态预测与安全约束决策支持

Jiazhao Shi

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合LSTM交通状态预测和大语言模型的交通信号控制框架,通过预测信号相位和生成自然语言解释,提升交通效率并确保安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23821 2026-04-28 cond-mat.mtrl-sci cs.LG 57%

Accelerating Quantum Materials Characterization: Hybrid Active Learning for Autonomous Spin Wave Spectroscopy

加速量子材料表征:用于自主自旋波光谱的混合主动学习

William Ratcliff

机构 * NIST Center for Neutron Research(国家标准与技术研究院中子研究中心)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出TAS-AI框架,通过分离检测、推断和细化任务,提升自旋波光谱的自主分析能力,展示了在不同模型下显著的效率提升。

Comments 47 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23783 2026-04-28 cs.IR cs.AI 57%

S2G-RAG: Structured Sufficiency and Gap Judging for Iterative Retrieval-Augmented QA

S2G-RAG:结构充分性与间隙判断用于迭代检索增强问答

Minghan Li, Junjie Zou, Xinxuan Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 S2G-RAG通过结构化充分性判断和间隙判断机制,提升多跳问答的准确性和鲁棒性,适用于多轮检索流程。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23626 2026-04-28 cs.CL 57%

GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs

GraphPlanner: 多智能体LLM的图记忆增强代理路由

Tao Feng, Haozhen Zhang, Zijie Lei, Peixuan Han, Jiaxuan You

机构 * Department of Computer Science(计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 GraphPlanner通过图记忆增强代理路由方法,提升多智能体LLM在任务规划和多轮协作中的性能,实现更高的准确率和计算效率。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04751 2026-04-28 cs.AI 57%

Evaluating the Search Agent in a Parallel World

在平行世界中评估搜索代理

Jiawei Chen, Xintian Shen, Lihao Zheng, Lifu Mu, Haoyi Sun, Ning Mao, Hao Ma, Tao Wei, Pan Zhou, Kun Zhan

机构 * Li Auto

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Mind-ParaWorld框架,通过生成未来场景和不可侵犯的原子事实,解决传统搜索代理评估中的基准构建、动态过时和证据判断难题。

Comments https://github.com/TIMMY-CHAN/Mind-ParaWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07410 2026-04-28 cs.RO cs.AI 57%

Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks

利用语言模型作为闭环高层规划器用于机器人应用:简要概述与基准测试

Hao Wang, Sathwik Karnik, Bea Lim, Somil Bansal

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(南加州大学明希德电气与计算机工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系) Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了语言模型在机器人闭环高层规划中的应用,探讨了控制时间跨度和预热启动对性能的影响,并通过实验提供改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23459 2026-04-28 cs.MA cs.CR cs.LG 57%

Architecture Matters for Multi-Agent Security

多智能体安全中的架构问题

Ben Hagag, William L. Anderson, Christian Schroeder de Witt, Sarah Scheffler

机构 * Carnegie Mellon University(卡内基梅隆大学) Oxford Witt Lab, University of Oxford(牛津Witt实验室,牛津大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文研究多智能体系统设计决策对任务性能与攻击抵御之间的权衡,通过三个环境和13种架构配置,分析智能体角色、通信拓扑和内存三个关键设计选择的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23449 2026-04-28 cs.AI cs.HC 57%

ArguAgent: AI-Supported Real-Time Grouping for Productive Argumentation in STEM Classrooms

ArguAgent:支持实时小组分组以促进STEM课堂中的有效辩论

Jennifer Kleiman, Yizhu Gao, Xin Xia, Zhaoji Wang, Zipei Zhu, Jongchan Park, Xiaoming Zhai

机构 * AI4STEM Education Center, University of Georgia(AI4STEM教育中心,佐治亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 ArguAgent通过实时分析学生立场和辩论能力,优化小组分组,提升STEM课堂中有效辩论的生产力。

Comments Full paper accepted to the 27th International Conference on AI in Education (AIED 2026). AIED Proceedings to be released Summer 2026

Journal ref International Conference on Artificial Intelligence in Education, AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 57%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12890 2026-04-28 cs.CV cs.AI 57%

Towards Long-horizon Agentic Multimodal Search

面向长视界代理多模态搜索

Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 polled 智能学院) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LMM-Searcher框架,通过文件化视觉表示和定制化图像加载工具,解决长视界多模态搜索中的信息管理与成本问题,实验证明其在长视界基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15993 2026-04-28 cs.CL 57%

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

解释自然语言中的谜题解决方案:对6x6数独的探索性研究

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了五种LLM在解决和解释6x6数独中的表现,发现尽管部分模型能解决谜题,但无法提供反映战略推理或直观问题解决的解释,凸显了LLM在人机协作决策中需解决的关键挑战。

Comments Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24550 2026-04-28 cs.SE 50%

Mono2Sls: Automated Monolith-to-Serverless Migration via Multi-Stage Pipeline with Static Analysis

Mono2Sls:通过多阶段流水线进行自动单体到无服务器迁移

Xingyan Chen, Yuxin Su, Zishan Su, Yang Yu, Zibin Zheng

专题命中 规划推理 :planning(abstract)

AI总结 本文提出Mono2Sls,一种自动化将单体Web后端转换为AWS SAM应用的流水线,通过静态分析和四个LLM代理实现高正确率迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01157 2026-04-28 cs.DB cs.IR 50%

Beyond Quacking: Deep Integration of Language Models and RAG into DuckDB

超越鸭子叫:将语言模型和RAG深度整合到DuckDB中

Anas Dorbani, Sunny Yasser, Jimmy Lin, Amine Mhedhbi

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出FlockMTL,通过整合语言模型和RAG技术,简化了知识密集型分析应用的开发,采用模型驱动的函数和SQL抽象优化实现效率。

Journal ref Proc. VLDB Endow. (PVLDB), Vol. 18, No. 12, pp. 5415-5418 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23620 2026-04-28 cs.IR 50%

Synthetic Data Powers Product Retrieval for Long-tail Knowledge-Intensive Queries in E-commerce Search

合成数据助力电商搜索中长尾知识密集型查询的产品检索

Gui Ling, Weiyuan Li, Yue Jiang, Wenjun Peng, Xingxian Liu, Dongshuai Li, Fuyu Lv, Dan Ou, Haihong Tang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种高效的数据合成框架,用于处理电商搜索中长尾知识密集型查询,通过隐式提炼强大离线查询重写模型的能力,提升检索效果。

Comments Accepted to SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23524 2026-04-28 eess.SY cs.SY 50%

Physics-Aware LLM-Based Probabilistic Wind Power Scenario Generation under Extreme Icing Conditions

基于物理的LLM风力发电场景生成方法:极端覆冰条件下的概率建模

Lei Wang, Ying Zhang, Di Shi, Fei Ding

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于物理的LLM框架,用于在极端覆冰条件下生成风力发电场景,结合SCADA物理建模、多模态分词和因果Transformer架构,有效约束功率和爬坡限制,提升可再生能源电力系统的韧性评估。

Comments 5 pages, 3 figures, 3 tables. Accepted by the 2026 IEEE Power & Energy Society General Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23513 2026-04-28 cs.RO 50%

Large Language Model based Interactive Decision-Making for Autonomous Driving

基于大语言模型的自主驾驶交互决策

Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang

机构 * College of Transportation, Tongji University, Shanghai 201804, China(同济大学交通运输学院,上海201804,中国) School of Automotive Studies, Tongji University, Shanghai 201804, China(同济大学汽车学院,上海201804,中国) School of Computer Science and Technology, Tongji University, Shanghai 201804, China(同济大学计算机科学与技术学院,上海201804,中国)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出基于大语言模型的交互决策框架,通过语义建模和意图感知提升安全性和效率,实验表明在混合交通场景中优于传统方法,且具有高度的人类相似性。

Comments Accepted by Journal of Traffic and Transportation Engineering (English Edition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09944 2026-04-28 cs.DB 50%

PLOP: Cost-Based Placement of Semantic Operators in Hybrid Query Plans

PLOP:基于成本的语义运算符在混合查询计划中的放置

Qiuyang Mang, Yufan Xiang, Hangrui Zhou, Runyuan He, Jiaxiang Yu, Hanchen Li, Aditya Parameswaran, Alvin Cheung

专题命中 规划推理 :planning(abstract)

AI总结 PLOP通过等价保留的重写将混合语义-关系查询规划简化为语义过滤器放置,通过动态规划模型平衡LLM和关系成本,实现1.5倍速度提升和4.29倍成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11827 2026-04-28 cs.PL 50%

Evolving Abstract Transformers for Gradient-Guided, Adaptable Abstract Interpretation

为梯度引导的可适应抽象解释设计的演化抽象变换器

Shaurya Gomber, Debangshu Banerjee, Gagandeep Singh

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出Evolving Abstract Transformer,通过UPOSE和AGG算法解决传统抽象解释的局限性,实现跨领域、高效精度-效率权衡和更精确的不变量。

Comments 41 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 10 篇

2603.27507 2026-04-28 cs.CV 80%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 78%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08592 2026-04-28 cs.CV 78%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16046 2026-04-28 cs.RO cs.CV 78%

DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning

DextER:基于语言的灵巧抓取生成与具身推理

Junha Lee, Eunha Park, Minsu Cho

机构 * Pohang University of Science and Technology(釜山科学技术大学) RLWRLD

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DextER通过具身推理生成灵巧抓取,结合任务语义与物理约束,提升抓取成功率与意图对齐度。

Comments CVPR 2026, Project page: https://junha-l.github.io/dexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24300 2026-04-28 cs.CV 71%

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science(香港科学大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))

专题命中 视觉空间推理 :reasoning(title)

AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。

Comments Project Page: https://3dlg-hcvc.github.io/revsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22805 2026-04-28 cs.CV cs.AI cs.SY eess.SY 70%

See No Evil: Semantic Context-Aware Privacy Risk Detection for AR

见不得恶:面向AR的语义上下文感知隐私风险检测

Jialu Liu, Yao Li, Zhuoheng Li, Huining Li, Ying Chen

机构 * Pennsylvania State University(宾夕法尼亚州立大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PrivAR框架,利用视觉语言模型进行AR环境中的语义隐私风险检测,通过上下文推理识别敏感信息并降低隐私泄露风险,实验表明其在准确率和F1分数上优于基线方法。

Comments Proc. IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG 57%

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17411 2026-04-28 cs.RO cs.LG 57%

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1:通过3D理解超越机器人演示

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

机构 * INSAIT

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出SPEAR-1,通过融合3D感知与语言指导的具身控制,提升机器人基础模型的泛化能力,使用20倍少的机器人演示数据在24个Open X-Embodiment数据集上训练,超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏