arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-29 至 2026-05-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 34 篇

2605.29307 2026-05-29 cs.CL cs.AI cs.IR cs.LG 67%

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek:训练用于直接语料库交互的搜索代理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29368 2026-05-29 cs.CL cs.AI 62%

SURGENT: A Surgical Multi-Agent Assistance System Across the Perioperative Workflow

SURGENT: 一种跨围手术期工作流程的手术多智能体辅助系统

Dongsheng Shi, Yue Li, Xin Yi, Yongyi Cui, Huawei Feng, Linlin Wang

机构 * East China Normal University(华东师范大学) City University of Hong Kong(香港城市大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SURGENT手术多智能体辅助系统,结合思维树规划器、多科室协作智能体和检索增强推理,通过新型记忆设计管理长期患者病史和短期工作摘要,在五项围手术期任务中优于基线LLM和现有医疗多智能体框架。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16548 2026-05-29 cs.LG cs.AI cs.CV 62%

A Composable Multimodal Framework for cine CMR-Text-Driven Prediction of Heart Failure Outcomes

用于电影心脏磁共振-文本驱动的心力衰竭结局预测的可组合多模态框架

Jianzhou Chen, Jinyang Sun, Xiumei Wang, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu

机构 * Department of Cardiology, Nanjing Drum Tower Hospital, State Key Laboratory of Pharmaceutical Biotechnology, Nanjing University(南京鼓楼医院心内科,南京大学国家药物生物技术重点实验室) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Electronic and Optical Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学电子与光学工程学院) College of Integrated Circuit Science and Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学集成电路科学与工程学院) Department of Cardiology, Nanjing Drum Tower Hospital Clinical College of Nanjing Medical University(南京医科大学南京鼓楼医院临床学院心内科) Institute of Quantum Information and Technology, Nanjing University of Posts and Telecommunications(南京邮电大学量子信息与技术研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可组合多模态框架,通过整合cine CMR影像、结构化临床指标和非结构化文本记录,实现比单模态AI算法更准确的心力衰竭预后预测,并支持个性化治疗优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30150 2026-05-29 cs.AI 57%

Anchorless Diversification for Parallel LLM Ideation

无锚点多样化并行LLM创意生成

Fares Nabil Ibrahim, Nafis Saami Azad, Raiyan Abdul Baten

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing, University of South Florida(贝尔尼人工智能、网络安全与计算学院,佛罗里达州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究无锚点方法(如语义方向分层)在并行LLM创意生成中实现候选池多样化,无需依赖种子想法,在多样性、质量和计算效率上优于有锚点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29932 2026-05-29 cs.LG cs.CV 57%

Treatment-Conditioned Diffusion for Forecasting Neurodegenerative Disease Progression

治疗条件扩散用于预测神经退行性疾病进展

Danylo Boiko, Viktoriia Mishkurova

机构 * Innoloft Inc.(Innoloft公司) Bogomolets National Medical University(博戈莫列茨国家医学大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 提出一种治疗条件扩散框架,通过条件化生成过程于患者的筛查DaTscan图像和一年内左旋多巴等效日剂量,预测高保真未来脑状态,在临床保真度上显著优于基线。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 57%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29678 2026-05-29 cs.CL 57%

Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?

虚假提示:无关提示能否引导大型语言模型?

Pawel Batorski, Abtin Pourhadi, Jerzy Sarosiek, Przemyslaw Spurek, Paul Swoboda

机构 * Heinrich Heine University Düsseldorf(海因里希·海因斯大学多特蒙德分校) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究语义无关的提示(虚假提示)对大型语言模型行为的影响,提出黑盒搜索方法发现此类提示,并证明其在多个基准和模型上能显著影响模型输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02849 2026-05-29 cs.AI 57%

AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents

AutoSizer: 通过大语言模型代理自动调整模拟和混合信号电路的尺寸

Xi Yu, Dmitrii Torbunov, Soumyajit Mandal, Yihui Ren

机构 * Artificial Intelligence Department, Brookhaven National Laboratory, Upton, NY(布鲁赫斯国家实验室人工智能部) Instrumentation Department, Brookhaven National Laboratory, Upton, NY 11973(布鲁赫斯国家实验室仪器部)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出AutoSizer,一种反射式LLM驱动的元优化框架,通过双循环结构统一电路理解、自适应搜索空间构建和优化编排,在模拟和混合信号电路尺寸调整中实现更优解质量、更快收敛和更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01869 2026-05-29 cs.AI 57%

Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents

Skill-Pro: 通过非参数PPO从经验中学习可复用技能以用于LLM智能体

Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang

机构 * Key Laboratory of Interdisciplinary Research of Computation and Economics(交叉计算与经济学交叉研究实验室) Shanghai University of Finance and Economics(上海财经大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能研究所) University of Bristol(布里斯托大学) Peking University(北京大学) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Skill-Pro框架,通过非参数PPO从交互经验中自动学习可复用的程序性技能,无需参数更新,实现高效经验重用和长期自主性。

Comments Accepted at ICML 2026 (spotlight); 22 Pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29578 2026-05-29 cs.AI 57%

GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation

基于季节性空间先验和LLM活动链生成的GPS增强游客移动性建模

Yifan Liu, Yanling Sang, Xishun Liao, Morgan Sun, Bo Yang, Zhiyuan Zhang, Chris Stanford, Haoxuan Ma, Jiaqi Ma

机构 * UCLA Mobility Lab, Department of Civil and Environmental Engineering, University of California, Los Angeles(加州大学洛杉矶分校移动实验室,土木与环境工程系,加州大学洛杉矶分校) Novateur Research Solutions(Novateur研究解决方案) University of Central Florida(中央佛罗里达大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出一种四阶段仿真框架,结合GPS和调查数据推导的月份条件空间先验、游客人口统计信息、距离可行区域序列分配以及基于LLM的活动链生成,以解决游客移动性建模中非例行、吸引驱动且对旅行目的、季节和成员组成高度敏感的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29534 2026-05-29 cs.AI 57%

UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents

UI-KOBE:面向轻量级图引导GUI代理的知识导向行为探索

Yuxiang Chai, Han Xiao, Xinyu Fu, Jinpeng Chen, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港大学多模态实验室) Huawei Research(华为研究) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出UI-KOBE框架,通过自动构建应用知识图谱并引导轻量级GUI代理进行运行时决策,以提升其移动端GUI任务执行效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29041 2026-05-29 cs.AI 57%

Practitioner Beliefs and Behaviors in AI-Enhanced Education: DOT Framework Survey Evidence

AI增强教育中的从业者信念与行为:DOT框架调查证据

David Gibson, M. Elizabeth Azukas, Gerald Knezek

机构 * Curtin University(Curtin 大学) Georgia Tech Research Institute(佐治亚理工研究学院) Georgia Institute of Technology(佐治亚理工学院) University of North Texas(北卡罗来纳州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 基于DOT框架,通过横截面调查(n=72)探究高等教育从业者对AI整合的信念、行为及制度条件,发现从业者支持AI教学辅助但强调人类监督,且设计导向实践与理论存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28994 2026-05-29 cs.AI 57%

BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation

BEAMS:用于建模与仿真的AI基准测试与评估

Sara Metcalf, William Schoenberg

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出BEAMS倡议,通过建立以人为本的基准测试框架,评估AI工具在建模与仿真中的表现,发现其在因果推理和定量修正方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26428 2026-05-29 cs.CL cs.HC 57%

Slide Deck Q&A Quality Assurance App: A Multi-Stage Pipeline for Pedagogical Question Generation

Slide Deck Q&A 质量保证应用:面向教学问题生成的多阶段流水线

Jim Salsman

机构 * TalkNicer, Inc.(TalkNicer公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 提出一个基于Flask的多阶段大语言模型流水线,从PDF幻灯片中提取文本和图像,生成结构化的教学问题集,并通过窗口规划、幻灯片合成、标注和协调四个阶段提高问题质量。

Comments 15 pages, 3 research questions, 1 figure, 1 table, 6 references, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24399 2026-05-29 cs.AI 57%

ConceptM$^3$oE: Concept-Guided Multimodal Mixture of Experts for Interpretable Computational Pathology

ConceptM$^3$oE:面向可解释计算病理学的概念引导多模态专家混合模型

Xuan Wang, Zhongling Xu, Gopi Kannedhara, Joakim Nguyen, Jian Yu, Jinrui Fang, Abdurrahmaan Baghdadi, Tianlong Chen, Awais Naeem, Chandra Krishnan, Edward Castillo, Andrew H. Song, Ankita Shukla, Ying Ding, Nicholas Konz, Hairong Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Dell Children’s Medical Center(德尔儿童医疗中心) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) University of Nevada, Reno(内华达大学里诺分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ConceptM$^3$oE框架,通过概念引导的多模态专家混合路径嵌入概念形成,并利用残差路径保持性能与可解释性,在脑肿瘤分类中优于基线并提升小样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08013 2026-05-29 cs.AI 57%

Small Agent Group is the Future of Digital Health

小型智能体群是数字健康的未来

Yuqiao Meng, Luoxi Tang, Dazheng Zhang, Rafael Brens, Elvys J. Romero, Nancy Guo, Safa Elkefi, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布inghamton分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出小型智能体群(SAG)通过协作推理替代单一大型模型,在数字健康中实现更优的有效性、可靠性和部署效率。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI 57%

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14233 2026-05-29 eess.SP 50%

Burst Aware Forecasting of User Traffic Demand in LEO Satellite Networks

LEO卫星网络中用户流量需求的突发感知预测

Yekta Demirci, Guillaume Mantelet, Stephane Martel, Jean-Francois Frigon, Gunes Karabulut Kurt

专题命中 规划推理 :planning(abstract)

AI总结 针对LEO卫星网络中突发流量导致缓冲区溢出和丢包的问题,提出一种基于Transformer架构的突发感知预测方法,通过嵌入突发距离、解码器线性层和不对称损失函数,显著降低预测误差。

Comments Accepted by IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28985 2026-05-29 econ.TH 50%

Subsidizing Sequential Search

补贴顺序搜索

Salvador Candelas, Nicole Immorlica, Brendan Lucier

专题命中 规划推理 :reasoning(abstract)

AI总结 研究企业通过补贴消费者搜索成本来竞争注意力的市场,建立补贴排序原则,并证明在直觉准则下存在唯一均衡,该均衡最大化信息揭示并确保有效搜索,随后分析AI中介平台的最优线性定价导致过度搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 18 篇

2605.29288 2026-05-29 cs.AI 87%

Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces

诊断答案正确长链思维训练轨迹中的有害延续

Chen He, Yuhao Wu, Lei Wang, Wenxuan Zhang, Fumin Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院)

专题命中 视觉空间推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究长链思维训练数据中答案正确但后续推理有害的延续现象,通过删除后缀实验发现其损害训练效果,并提出轻量级边界代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28890 2026-05-29 cs.CR cs.LG 85%

Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought

推理中的回声:通过思维链实现隐蔽且有效的数字水印

Jiacheng Lu, Yiming Li, Tao Song, Weijian Wang, Wenjie Qu, Haibing Guan, Jiaheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.LG

AI总结 提出BiCoT框架,通过将水印嵌入推理轨迹的内部几何结构,并利用基于Top-logprob的黑盒验证器RSR,在不影响推理保真度的前提下实现鲁棒的水印检测。

Comments This paper is accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 83%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30318 2026-05-29 cs.GR cs.AI cs.CV 79%

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

快门之前:3D场景中美学的且可执行的人像摄影规划

Ruixiang Jiang, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.AI

AI总结 提出在3D场景中生成人像姿态、相机、照明和曝光方案的方法,通过构建摄影场景图实现美学引导的规划,生成视觉上引人注目且几何与光度可行的人像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30231 2026-05-29 cs.CV cs.AI 79%

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

超越3D VQA:将3D空间先验注入视觉-语言模型以增强几何推理

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

机构 * FAIR at Meta(Meta的FAIR)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出GASP框架,通过将几何先验注入LLM的Transformer层,利用对比损失和深度一致性监督训练,显著提升VLM的3D空间推理能力,在多个基准上取得大幅提升。

Comments CVPR 2026. Project page: https://danielchyeh.github.io/GASP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18527 2026-05-29 cs.CV cs.AI cs.SD 79%

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯AI实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27959 2026-05-29 cs.CV cs.AI 79%

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

ROVER: 面向对象中心视觉证据的路由用于基于多图像推理

Guannan Lv, Ren Nie, Hongjian Dou, Tingting Gao

机构 * Kuaishou Technology(快手科技)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ROVER,一种轻量级可学习插件,通过对象中心差分注意力聚合上下文、蒸馏图像内线索并路由历史感知证据,实现高效全局视觉证据路由,在多图像推理中提升答案和定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29894 2026-05-29 cs.CV 78%

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

训练智能体而非专家:学习利用异构专家进行多轮视觉推理

Yaowu Fan, Tao Han, Dazhao Du, Andy J. Ma, Jia Wan

机构 * Sun Yat-sen University(中山大学) HKUST(香港科技大学) Harbin Institute of Technology(哈尔滨理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出VisHarness,一种可训练的视觉智能体,通过解耦高层感知推理与低层任务执行,学习利用异构视觉专家模型,以轻量训练实现多轮交互下的通用视觉任务求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18859 2026-05-29 cs.AI cs.CL cs.LG 67%

RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models

RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播

Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao, Ka Ho Li, Dahai Yu, Michael Kwok-Po Ng

机构 * TMLR Group(TMLR小组) Hong Kong Baptist University(香港 Baptist大学) TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司) Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学) Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RewardFlow方法,通过构建状态图进行拓扑感知的奖励传播,为智能体推理提供无标注的密集奖励,显著提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13517 2026-05-29 q-bio.NC cs.LG 57%

A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments

基于交互式VR实验的心理旋转深度学习模型

Raymond Khazoum, Daniela Fernandes, Aleksandr Krylov, Qin Li, Stephane Deny

机构 * Department of Computer Science, Aalto University, Espoo, Finland(奥卢大学计算机科学系,芬兰埃斯波) Department of Neuroscience and Biomedical Engineering, Aalto University, Espoo, Finland(奥卢大学神经科学与生物医学工程系,芬兰埃斯波)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出一个由等变编码器、神经符号对象编码器和神经决策代理组成的深度学习模型,通过VR实验验证,准确模拟人类心理旋转的性能、响应时间和行为。

Comments Version accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV 50%

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏