arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-22 至 2026-05-22 共收录 145 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2605.22106 2026-05-22 cs.AI 79%

ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning

ArborKV: 一种面向树状推理的KV缓存管理方法

Yeqiu Chen, Ziyan Liu, Zhenxin Huang, Runquan Gui, Hong Wang, Lei Liu

机构 * University of Science(科学大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ArborKV,一种结构感知的KV缓存管理方法,通过轻量级值估计器和树状分配策略,实现纯token提取式淘汰与惰性再水合,从而在保持高精度的同时减少KV内存使用,使在固定硬件预算下能支持更大规模的树状推理搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22104 2026-05-22 cs.CV 78%

OPERA: An Agent for Image Restoration with End-to-End Joint Planning-Execution Optimization

OPERA: 一种用于图像修复的智能体,通过端到端联合规划-执行优化

Feng Zhu, Shuyang Xie, Yihan Zeng, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 规划推理 :planning(title,abstract)

AI总结 该研究提出OPERA框架,通过端到端联合优化修复规划和工具执行,解决图像修复中复杂混合退化问题,优于现有方法和统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22456 2026-05-22 cs.RO cs.AI 74%

Steins;Gate Drive: Semantic Safety Arbitration over Structured Futures for Latency-Decoupled LLM Planning

Steins;Gate Drive: 基于结构化未来语义安全仲裁的延迟解耦LLM规划

Anjie Qiu, Hans D. Schotten

机构 * Institute for Wireless Communication and Navigation(无线通信与导航研究所) RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文提出SteinsGateDrive架构,通过延迟解耦规划与运行时架构,在保持安全边界的同时,将有效延迟从+3.07秒减少到-0.01秒,提升了自动驾驶的规划效率。

Comments 10 pages, 2 figures, 5 tables, submitted to IEEE transaction of intelligent vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22364 2026-05-22 cs.AI 74%

Scaling Observation-aware Planning in Uncertain Domains

在不确定领域中扩展感知意识规划

Adrian Zvizdenco, Arthur Conrado Veiga Bosquetti, Alberto Lluch Lafuente, Christoph Matheja

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文研究了在不确定领域中扩展感知意识规划的方法,通过子符号技术扩展可决定OOP片段的解决方法,包括传感器选择问题和位置可观察性问题,并通过分解POMDPs识别合理的观察函数,从而提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22221 2026-05-22 cs.LG cs.AI cs.LO 62%

Can Transformers Learn to Verify During Backtracking Search?

Transformer能否在回溯搜索中学习验证?

Yin Jun Phua, Tony Ribeiro, Tuan Nguyen, Katsumi Inoue

机构 * Yin Jun Phua (corresponding author) Institute of Science Tokyo, 2-12-1 Ookayama, Meguro-ku, Tokyo 152-8550, Japan Tony Ribeiro Centrale Nantes, CNRS, Laboratoire des Sciences du Num\'erique de Nantes, LS2N, UMR 6004, F-44000 Nantes, France National Institute of Informatics, 2-1-2 Hitotsubashi, Chiyoda-ku, Tokyo 101-8430, Japan Steelous Protocol, 8-20-32, Ginza, Chuo-ku, Tokyo 104-0061, Japan Tuan Nguyen Hanoi University of Science Technology, No. 1 Dai Co Viet, Hai Ba Trung, Ha Noi, Vietnam Katsumi Inoue National Institute of Informatics, 2-1-2 Hitotsubashi, Chiyoda-ku, Tokyo 101-8430, Japan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了Transformer在回溯搜索中的验证能力,指出传统方法在处理轨迹数据时存在散列检索和历史纠缠问题,并提出局部化和选择性状态注意力(SSA)来解决这些问题,通过实验验证了SSA在3-SAT、图着色、Blocks World和回溯解析等任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10067 2026-05-22 cs.LG cs.AI 62%

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis: 通过自进化元认知策略优化学习 jailbreak LLMs

Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Metis框架,通过将jailbreaking重新表述为对抗性部分可观测马尔可夫决策过程中的推理时间策略优化,以提高对抗性测试的效率和效果,同时通过结构化反馈和透明推理轨迹提升可解释性,实验表明Metis在多种模型上均表现出更高的攻击成功率和更低的token成本。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22785 2026-05-22 cs.CL 57%

Evaluating Commercial AI Chatbots as News Intermediaries

评估商业AI聊天机器人作为新闻中介

Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou

机构 * Stanford University(斯坦福大学) Independent Researcher(独立研究者) Together AI

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究评估了AI聊天机器人在跨语言和区域处理新兴事实的准确性,发现其在多选题中表现良好,但在自由回答和复杂问题上存在显著误差,揭示了区域不平等和依赖检索基础设施的问题。

Comments https://suzgunmirac.github.io/ai-news-preview/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22703 2026-05-22 cs.LG 57%

Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals

剪裁瓶颈:通过近边界信号的随机恢复稳定RLVR

Shuo Yang, Jinda Lu, Chiyu Ma, Kexin Huang, Haoming Meng, Qihui Zhang, Yuyang Liu, Bolin Ding, Guoyin Wang, Li Yuan, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)中由于硬剪裁决策导致的训练不稳定问题,提出了一种名为近边界随机救援(NSR)的简单方法,通过随机保留略微超出边界范围的token来恢复丢失的信号,从而提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22504 2026-05-22 cs.AI cs.CV 57%

LACO: Adaptive Latent Communication for Collaborative Driving

LACO:适应性潜在通信用于协同驾驶

Tianhao Chen, Yuheng Wu, Dongman Lee

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LACO,一种无需训练的潜在通信范式,通过迭代潜在推理、跨时间显著性归因和结构化语义知识蒸馏,解决协同驾驶中潜在通信的延迟和信息丢失问题,实验证明其在降低通信和推理延迟的同时保持了强大的协同驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09851 2026-05-22 cs.LG 57%

CoFEH: LLM-driven Feature Engineering Empowered by Collaborative Bayesian Hyperparameter Optimization

CoFEH: 由协作贝叶斯超参数优化赋能的LLM驱动特征工程

Beicheng Xu, Keyao Ding, Wei Liu, Yupeng Lu, Bin Cui

机构 * School of CS \& Key Lab of High Confidence Software Technologies (MOE), Peking University Beijing China School of CS \& Beijing Key Laboratory of Software Hardware Cooperative Artificial Intelligence Systems, Peking University Beijing China School of CS \& Key Lab of High Confidence Software Technologies (MOE), Peking University Hardware Cooperative Artificial Intelligence Systems, Peking University

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出CoFEH框架,通过结合LLM驱动的特征工程和贝叶斯超参数优化,实现鲁棒的端到端AutoML,解决了传统方法在搜索空间刚性和缺乏领域意识的问题,并引入互条件机制提升FE与HPO的协同效果。

Comments Accepted at KDD 2026. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06556 2026-05-22 cs.CR cs.AI 57%

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

对增强工具的语义攻击:保护模型上下文协议免受描述级操纵

Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过工具描述符与外部工具交互的模型上下文协议(MCP)中存在的语义攻击问题,提出了一种分层防御方案,通过描述符完整性验证、预上下文语义审查和轻量级运行时防护机制,有效降低描述级操纵导致的不安全工具调用风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02885 2026-05-22 cs.CY cs.CL cs.HC 57%

"Would You Want an AI Tutor?" Understanding Stakeholder Perceptions of LLM-based Systems in the Classroom

你希望有一个AI导师吗?理解基于大语言模型的系统在课堂中的利益相关者观点

Caterina Fuligni, Daniel Dominguez Figaredo, Armanda Lewis, Julia Stoyanovich

机构 * Khan Academy New York City Department of Education(纽约市教育部) Learning Innovation Catalyst(学习创新催化剂)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了在课堂中部署基于大语言模型(LLM)系统的利益相关者观点,提出了一种以利益相关者为中心的框架,以支持更谨慎的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21919 2026-05-22 cs.CV cs.AI 57%

SDGBiasBench: Benchmarking and Mitigating Vision--Language Models' Biases in Sustainable Development Goals

SDGBiasBench: 评估和减轻可持续发展目标中视觉-语言模型的偏见

Zihang Lin, Huaiyuan Qin, Muli Yang, Hongyuan Zhu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SDGBiasBench,一个用于评估和减轻可持续发展目标中视觉-语言模型偏见的大型基准测试集,通过分析模型在决策和估计层面的偏见,提出CADE方法以减少偏见,提高模型的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21712 2026-05-22 cs.CL 57%

Broadening Access to Transportation Safety Data with Generative AI: A Schema-Grounded Framework for Spatial Natural Language Queries

通过生成式AI拓宽交通安全管理数据的可及性:一种基于模式的时空自然语言查询框架

Mahdi Azhdari, Eric J. Gonzales

机构 * Department of Civil and Environmental Engineering, University of Massachusetts Amherst(麻省大学阿姆赫斯特分校土木与环境工程系)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出了一种基于模式的自然语言接口,利用大型语言模型解释用户意图,同时保持确定性和可审查的执行,以解决交通安全管理数据访问不均的问题,通过整合事故记录、道路属性和地理空间数据,提升公共部门的安全规划能力。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11574 2026-05-22 cs.AI 57%

Learning to Configure Agentic AI Systems

学习配置代理AI系统

Aditya Taparia, Som Sagar, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院) Arizona State University(亚利桑那州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于半马尔可夫决策过程(SMDP)的代理配置方法,通过ARC模型动态选择查询特定的代理配置,从而在多个基准测试中提升了推理准确性、工具使用准确性和τ-Bench(Airline)Pass的成功率。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04753 2026-05-22 eess.SY cs.SY 50%

Toward Self-Organizing Production Logistics: A Multi-Agent Approach

迈向自组织生产物流:一种多智能体方法

Jan-Felix Klein, Yongkuk Jeong, Erik Flores-García, Magnus Wiktorsson

专题命中 规划推理 :planning(abstract)

AI总结 本文提出自组织生产物流(SOPL)的概念,通过设计科学研究方法论(DSRM)框架,结合多智能体架构、事件驱动协调和数字孪生等技术,解决生产物流中日益复杂的不确定性问题。

Comments Submitted to IFIP International Conference on Advances in Production Management Systems 2026 (APMS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18003 2026-05-22 cs.CV 50%

Universal Skeleton Understanding via Differentiable Rendering and MLLMs

通过可微渲染和大语言模型实现通用骨架理解

Ziyi Wang, Peiming Li, Xinshun Wang, Yang Tang, Kai-Kuang Ma, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国) Tencent(腾讯) Nanjing University of Aeronautics(南京航空航天大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出SkeletonLLM,通过可微渲染将任意骨架序列转换为大语言模型的视觉模态,实现通用骨架理解,同时引入协同训练策略提升推理能力,展示了在开放词汇动作识别中的强泛化能力,并扩展到异构骨架格式的运动描述和问答任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21674 2026-05-22 cs.CR 50%

Adversarial Reframing: A Framework for Targeted Generation in Language Models

对抗性重构:一种用于语言模型针对性生成的框架

Shahnewaz Karim Sakib, Swati Kar, Anindya Bijoy Das

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出THREAT框架,通过协调多个语言模型进行迭代搜索,寻找文本劫持提示,并通过非凸优化问题解决提示发现问题,提高了攻击成功率并降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21673 2026-05-22 physics.ao-ph cs.CY cs.DL 50%

From Licensing to Open Access: Designing a Sustainable Transition in Operational Weather Data

从许可到开放获取:设计可持续的运营天气数据转型

Emma Pidduck, Umberto Modigliani, Victoria L. Bennett, Fabio Venuti, Florian Pappenberger, Florence Rabier

专题命中 规划推理 :planning(abstract)

AI总结 本文研究了欧洲中期天气预报中心(ECMWF)从受限数据许可模式向CC BY 4.0开放获取的转型,探讨了其设计方法和可持续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 15 篇

2605.22013 2026-05-22 cs.CV cs.GR cs.LG 90%

PointLLM-R: Enhancing 3D Point Cloud Reasoning via Chain-of-Thought

PointLLM-R: 通过链式推理增强3D点云推理

Chaoqi Chen, Qile Xu, Wenjun Zhou, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science(视觉计算研究中心(VCC),计算机科学学院) Software Engineering (CSSE) Shenzhen University China(软件工程(CSSE)深圳大学中国) VCC, CSSE Shenzhen University China(VCC,CSSE 深圳大学中国) Shenzhen University(深圳大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种数据驱动的框架,用于构建大规模链式推理监督,以改进3D点云理解。通过两阶段流程优化点文本指令数据,并合成高质量推理路径,构建了包含55K样本的PoCoTI数据集,训练PointLLM-R实现3D多模态语言模型的推理能力,实验表明其在生成3D分类和描述任务中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22816 2026-05-22 cs.RO cs.CV 82%

AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation

AwareVLN: 基于自感知的视觉语言导航推理

Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出AwareVLN框架,通过自感知推理机制实现端到端的视觉语言导航,解决了传统方法在理解代理、指令和场景关系上的不足,并在多个数据集上实现了优于现有方法的性能。

Comments Accepted to CVPR 2026. Project page: https://gwxuan.github.io/AwareVLN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22818 2026-05-22 cs.CV 78%

MotiMotion: Motion-Controlled Video Generation with Visual Reasoning

MotiMotion: 基于视觉推理的运动控制视频生成

Lee Hsin-Ying, Hanwen Jiang, Yiqun Mei, Jing Shi, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔茨分校) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出MotiMotion框架,通过将运动控制转化为推理生成问题,改进视频生成中因果关系和常识一致性,引入免训练视觉语言推理器和置信度感知控制方案,通过MotiBench基准测试验证其生成视频的合理性与交互性。

Comments ICML 2026. Project page: https://motimotion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22607 2026-05-22 cs.CV 78%

Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following

增强视觉基础模型中的眼动推理以实现眼动跟随

Shijing Wang, Yaping Huang, Chaoqun Cui, David Wong, Yihua Cheng, Alexandros Neophytou, Hyung Jin Chang

机构 * Beijing Jiaotong University(北京交通大学) University of Birmingham(英国伯明翰大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Microsoft, UK(微软公司(英国))

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出了一种新的训练机制,通过局部LoRA和锥外惩罚来增强视觉基础模型中的眼动推理,以提升眼动跟随任务的性能,特别是在目标不显著时表现更优。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22558 2026-05-22 cs.CV 78%

GeoWeaver: Grounding Visual Tokens with Geometric Evidence before Scene Reasoning

GeoWeaver: 在场景推理前通过几何证据 grounding 视觉 token

Deshui Miao, Xingsen Huang, Yameng Gu, Xin Li, Haijun Zhang, Ming-Hsuan Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔)) Hainan University(海南大学) University of California at Merced(加州大学默塞德分校)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出 GeoWeaver,一种在场景推理前通过几何证据对视觉 token 进行 grounding 的框架,以提升空间推理能力并保持多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21801 2026-05-22 cs.LG cs.CL 62%

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

为何语义熵失效:面向策略优化的几何感知与校准不确定性

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16416 2026-05-22 cs.CV cs.AI 57%

Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models

Circle-RoPE: 用于大视觉-语言模型的锥形解耦旋转位置嵌入

Chengcheng Wang, Jianyuan Guo, Hongguang Li, Yuchuan Tian, Ying Nie, Chang Xu, Kai Han

机构 * Huawei Noah's Ark Lab.(华为诺亚实验室) City University of Hong Kong.(香港城市大学) University of Sydney.(悉尼大学) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学人工智能国家重点实验室,智能科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Circle-RoPE,通过将图像标记坐标映射到与文本位置轴正交的圆环上,实现跨模态位置解耦,同时保留图像内部空间结构,并通过交替几何编码增强跨模态位置解耦和细粒度图像空间结构保留。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21796 2026-05-22 cs.CV cs.CL 57%

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

MM-Conv: 一种多模态数据集和基准,用于上下文感知的3D对话中指代解析

Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan, Lubos Marcinek, Anna Klezovich, Iolanda Leite, Jonas Beskow

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种多模态数据集和基准,用于在动态3D环境中实现上下文感知的指代解析,通过引入包含6.7小时第一人称VR交互的同步语音、动作、注视和3D场景几何数据的基准,以及一个两阶段的指代解析流水线,改进了对话中的指代解析性能。

Comments Extended version of the paper published at LREC 2026 (Palma de Mallorca, Spain), with expanded VLM baselines and inter-annotator agreement analysis

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21622 2026-05-22 cs.AI 57%

TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization

TO-Agents:一种用于基于偏好的拓扑优化的多智能体AI流水线

Isabella A. Stewart, Hongrui Chen, Faez Ahmed

机构 * Department of Mechanical Engineering Massachusetts Institute of Technology Cambridge, MA, 02139 USA(机械工程系 马萨诸塞理工学院 哥伦布, 马萨诸塞州, 02139 美国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TO-Agents,一种多智能体AI框架,通过将自然语言设计意图与迭代拓扑优化相结合,解决设计者手动转换非直接关联的偏好到求解器设置的问题,并在两个长周期设计任务中验证了其有效性。

Comments Accepted for publication in the Proceedings of the ASME 2026 International Design Engineering Technical Conferences (IDETC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22812 2026-05-22 cs.RO cs.CV 50%

GesVLA: Gesture-Aware Vision-Language-Action Model Embedded Representations

GesVLA: 一种具有手势感知能力的视觉-语言-动作模型嵌入表示

Wenxuan Guo, Ziyuan Li, Meng Zhang, Yichen Liu, Yimeng Dong, Chuxi Xu, Yunfei Wei, Ze Chen, Erjin Zhou, Jianjiang Feng

机构 * Tsinghua University(清华大学) Dexmal

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GesVLA模型,通过引入手势作为平行指令模态,解决现有VLA系统在复杂场景中空间模糊问题,采用双VLM架构实现手势表示与动作策略的紧密耦合,并通过手势数据生成管道和两阶段训练策略提升目标定位准确性和人机交互效率。

Comments Project page: https://gwxuan.github.io/GesVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22619 2026-05-22 cs.CV 50%

GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT

GLeVE: 在3D CT中基于图的病变接地与提案验证

Shuo Jiang, Yuhao Hong, Chunbo Jiang, Weihong Chen, Huangwei Chen, Shenghao Zhu, Beining Wu, Mingxuan Liu, Zhu Zhu, Feiwei Qin, Min Tan, Yifei Chen

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Children's Hospital, Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出GLeVE框架,通过图引导的病变接地和解剖学先验验证,解决3D CT中自由文本叙述与体积解剖之间的语义-空间差距问题,提升病变定位的准确性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏