arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-29 至 2026-04-29 共收录 95 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2601.21225 2026-04-29 cs.CL cs.AI 84%

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

MGSM-Pro:一种用于多语言数学推理评估的简单策略

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) University of Toronto(多伦多大学) Masakhane Hanyang University(翰阳大学) Instituto Politécnico Nacional(国家理工学院) Umbaji University of Ibadan(伊巴德安大学) McPherson University(麦菲逊大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MGSM-Pro,通过增加数字变化实例提升多语言数学推理评估的鲁棒性,发现低资源语言在不同数字实例下表现下降,且专有模型对数字变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI 79%

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25155 2026-04-29 eess.SP 78%

Rethinking Wireless Communications through Formal Mathematical AI Reasoning

通过形式数学AI推理重新思考无线通信

Changyuan Zhao, Jiacheng Wang, Dusit Niyato, Zan Li, Abbas Jamalipour, Shiwen Mao, Xianbin Wang, Dong In Kim

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出通过形式数学AI推理重新构建无线通信理论,提出验证、推导和发现三层框架,推动无线数学知识的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 70%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25167 2026-04-29 cs.AI 57%

From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models

从洞察到行动:一种新的框架,用于基于可解释性指导的数据选择在大语言模型中

Ling Shi, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Yangyang Liu, Linlong Xu, Longyue Wang, Deyi Xiong, Weihua Luo

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IGDS框架,通过内部任务特征识别和选择共振数据来提升大语言模型性能,实验显示在数学推理任务中数据效率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24807 2026-04-29 cs.CY cs.AI cs.MA 57%

From Prototype to Classroom: An Intelligent Tutoring System for Quantum Education

从原型到课堂:面向量子教育的智能辅导系统

Iizalaarab Elhaimeur, Nikos Chrisochoides

机构 * Center for Real-Time Computing(实时计算中心) Computer Science Department(计算机科学系) Old Dominion University(旧 Dominion 大学) Physics Departments(物理系)

专题命中 数学推理 :planning(abstract);分类 cs.AI

AI总结 本文提出ITAS系统,通过多智能体架构和课程设计解决量子教育中的可靠性问题,验证系统在真实课堂中的可行性及教学分析能力。

Comments 10 pages, 6 figures, 1 table. Submitted to IEEE QCE 2026. Companion papers (in preparation): ITAS architecture and latency analysis

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 4 篇

2510.16340 2026-04-29 cs.CL cs.AI 84%

Thinking About Thinking: Evaluating Reasoning in Post-Trained Language Models

思考中的思考:评估后训练语言模型的推理能力

Pratham Singla, Shivank Garg, Ayush Singh, Ishan Garg, Ketan Suhaas Saichandran

机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Boston University(波士顿大学)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 研究评估后训练语言模型的推理能力,通过三个核心能力评估其意识、泛化和推理与输出的对齐情况,发现强化学习模型在意识和泛化上优于SFT模型,但推理与输出对齐较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25053 2026-04-29 cs.CL cs.AI 81%

Analyzing LLM Reasoning to Uncover Mental Health Stigma

分析LLM推理以揭示心理健康污名

Sreehari Sankar, Aliakbar Nafar, Mona Barman, Hannah K. Heitz, Ashwin Kumar, Pouria Tohidi, Dailun Li, Danish Hussain, Russell DuBois, Hamed Hasheminia, Farshad Majzoubi

机构 * BetterHelp

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM推理过程,揭示隐藏的污名化语言及内部逻辑,利用临床专业知识分类污名化模式,并扩展心理健康污名基准以识别模型逻辑缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25264 2026-04-29 cs.CR cs.SE 67%

MARD: A Multi-Agent Framework for Robust Android Malware Detection

MARD:一种用于鲁棒Android恶意软件检测的多智能体框架

Xueying Zeng, Youquan Xian, Sihao Liu, Xudong Mou, Yanze Li, Lei Cui, Bo Li

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 MARD通过结合LLM的语义理解和传统静态分析,提出多智能体框架,有效降低APK深度分析成本,实现高可解释性检测,F1得分达93.46%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 57%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 15 篇

2604.24831 2026-04-29 cs.SE cs.LG 85%

FGDM: Reasoning Aware Multi-Agentic Framework for Software Bug Detection using Chain of Thought and Tree of Thought Prompting

FGDM:基于推理的多智能体框架用于软件缺陷检测的链式思维和树式思维提示

Srita Padmanabhuni, Bhargavi Karuturi, Jerusha Karen Indupalli, Santhan Reddy Chilla, Vivek Yelleti

机构 * SRM University, Andhra Pradesh(安得拉邦SRM大学)

专题命中 规划推理 :reasoning(title);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出FGDM框架,利用链式思维和树式思维提示,通过流程图识别代码错误并生成修复代码,有效提升大型代码库中缺陷检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 84%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 规划推理 :CoT(summary_cn,abstract);planning(abstract);分类 cs.CL

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 84%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07927 2026-04-29 cs.AI 83%

EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools

EigentSearch-Q+: 通过结构化推理工具增强深度研究代理

Boer Zhang, Mingyan Wu, Dongzhuoran Zhou, Yuqicheng Zhu, Wendong Fan, Puzhen Zhang, Zifeng Ding, Guohao Li, Yuan He

机构 * Meta Northeastern University, China(东北大学) University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Cambridge(剑桥大学) Mina AI Amazon(亚马逊)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Q+工具,通过引导查询规划和证据提取提升深度研究代理的搜索效率,实验显示在多个基准测试中提升了模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 81%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25683 2026-04-29 cs.IR 78%

K-CARE: Knowledge-driven Symmetrical Contextual Anchoring and Analogical Prototype Reasoning for E-commerce Relevance

K-CARE:基于知识的对称上下文锚定与类比原型推理用于电商相关性

Chen Yifei, Tian Zhixing, Wang Chenyang, Cheng Ziguang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 K-CARE通过结合外部知识与类比推理,解决电商搜索中因知识边界缺失导致的相关性问题,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 73%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25040 2026-04-29 cs.AI cs.CL 62%

Leverage Laws: A Per-Task Framework for Human-Agent Collaboration

利用率法则:一种面向任务的人机协作框架

Stan Loosmore

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种面向任务的利用率比率,用于衡量人机协作中人类工作被代理所替代的比例,结合信息需求的流向和时间成本,探讨了利用率的渐进行为及任务新颖性对规划的影响。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 62%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25885 2026-04-29 hep-ph cs.LG hep-ex 57%

Explainable AI for Jet Tagging: A Comparative Study of GNNExplainer, GNNShap, and GradCAM for Jet Tagging in the Lund Jet Plane

可解释的AI用于喷注标记:GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的比较研究

Pahal D. Patel, Sanmay Ganguly

机构 * Department of Physics, Indian Institute of Technology, Kanpur Uttar-Pradesh-208016, India(印度理工学院坎浦尔分校物理系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文比较了GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的性能,通过蒙特卡洛真实解释掩码和物理指导评估框架,揭示了非微扰与微扰区域的解释质量变化,并量化了解释器分配的节点重要性与经典喷注子结构观测量的相关性。

Comments 25 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25389 2026-04-29 cs.HC cs.AI 57%

Co-Writing with AI: An Empirical Study of Diverse Academic Writing Workflows

与AI共同写作:关于多样化学术写作流程的实证研究

Silvia Bodei, Duncan P. Brumby, Katie Fisher, Jon Mella

机构 * University College London(伦敦大学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究探讨大学生如何整合AI工具到写作流程中,分析不同写作任务中AI使用模式及个体因素影响,揭示AI整合的多样性与三种价值导向的配置。

Comments 25 pages, 1 table, 5 figures. Accepted at CHIWORK 2026 (ACM Symposium on Human-Computer Interaction for Work)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09618 2026-04-29 cs.DC cs.AI cs.CR 57%

HearthNet: Edge Multi-Agent Orchestration for Smart Homes

HearthNet:边缘多智能体协调用于智能家居

Zhonghao Zhan, Krinos Li, Yefan Zhang, Hamed Haddadi

机构 * Imperial College London(伦敦帝国学院) Independent Researcher(独立研究员)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 HearthNet通过边缘多智能体系统解决智能家居中自然语言控制、设备故障和持续协调的问题,采用MQTT、Git共享状态和授权租赁实现设备管理。

Comments (CAIS 2026) Proceedings of the ACM Conference on AI and Agentic Systems, Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08567 2026-04-29 cs.CL cs.MA 57%

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00931 2026-04-29 cs.AI 57%

PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor

PsychAgent: 一种基于经验的终身学习代理用于自我进化的心理辅导员

Yutao Yang, Junsong Li, Qianjun Pan, Jie Zhou, Kai Chen, Qin Chen, Jingyuan Zhao, Ningning Zhou, Xin Li, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PsychAgent,通过长期多会话交互的内存增强规划引擎、技能进化引擎和强化内化引擎,实现心理辅导员的自我进化,提升多会话咨询的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO 50%

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 8 篇

2512.03043 2026-04-29 cs.CV 85%

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 80%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25318 2026-04-29 cs.GR cs.AI cs.CL 62%

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

Cutscene Agent:一种用于自动化3D场景生成的LLM代理框架

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan Li, Zhen Hui, Keer Zhou, Lan Zhou, Shujun Dai

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cutscene Agent框架,通过双向集成LLM代理与游戏引擎,实现多代理协作生成可编辑的电影化3D内容,并构建了针对长周期多步骤协作的评估基准。

Comments 27 pages excluding appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25268 2026-04-29 cs.CL cs.AI 62%

CRAFT: Grounded Multi-Agent Coordination Under Partial Information

CRAFT:在部分信息下的 grounded 多智能体协调

Abhijnan Nath, Hannah VanderHoeven, Nikhil Krishnaswamy

机构 * Department of Computer Science, Colorado State University(计算机科学系,科罗拉多州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CRAFT 是评估大语言模型在严格部分信息下实用沟通能力的多智能体基准,通过自然语言构建共享3D结构。研究发现更强推理能力不必然带来更好协调,小模型常表现更优,表明多智能体协调仍是当前语言模型的挑战。

Comments Added revisions, corrected typos and additional analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25526 2026-04-29 cs.SE cs.AI 57%

AI as Consumer and Participant: A Co-Design Agenda for MBSE Substrates and Methodology

AI作为消费者和参与者:MBSE子系统与方法论的协同设计议程

Siyuan Ji

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了AI在MBSE模型中的应用问题,指出现有模型未为AI消费设计,提出需协同设计模型与方法论,使其成为可查询的知识子系统,而非仅为人导航的结构化 artifacts。

详情

展开后加载摘要…

URL PDF HTML 收藏