arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-28 至 2026-07-28 共收录 209 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 51 篇

2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 62%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05132 2026-07-28 cs.CL cs.AI 版本更新 62%

PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment

PrinciplismQA: 一种基于哲学的评估LLM与人类临床医学伦理对齐的方法

Chang Hong, Minghao Wu, Qingying Xiao, Yuchi Wang, Xiang Wan, Guangjun Yu, Benyou Wang, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PrinciplismQA,一种基于哲学框架的评估方法,用于评估LLM在临床医学伦理上的对齐情况,通过专家验证的问题集揭示模型在伦理推理上的不足。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00044 2026-07-28 physics.chem-ph cs.AI cs.LG q-bio.QM 62%

UAlign: Pushing the Limit of Template-free Retrosynthesis Prediction with Unsupervised SMILES Alignment

UAlign: 推动无模板反合成预测的极限:基于无监督SMILES对齐

Kaipeng Zeng, Bo yang, Xin Zhao, Yu Zhang, Fan Nie, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 UAlign通过无监督SMILES对齐技术,提升无模板反合成预测的准确性,超越现有模板化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24601 2026-07-28 cs.SE cs.AI cs.HC 新提交 57%

Evaluating the Impact of Explainable AI on Trust in AI-Assisted Code Review

评估可解释人工智能对人工智能辅助代码审查中信任的影响

Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究可解释人工智能(XAI)对开发人员在人工智能辅助代码审查中信任的影响,通过对34名参与者的受试者内用户研究,比较不同XAI支持水平的系统,发现解释水平显著影响信任和认同,结果为可信代码审查系统设计等研究提供信息。

Comments 23 pages, 4 figures, 5 tables. To appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA093 (ISSTA 2026). Published under CC BY 4.0. Replication package: https://doi.org/10.5281/zenodo.21457282

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交 57%

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23942 2026-07-28 cs.AI 新提交 57%

From Cognitive Architectures to Language Agents: A Mechanism-Level Review of Lineage, Convergence, and Migration Gaps

从认知架构到语言智能体:谱系、融合与迁移差距的机制层面综述

Haodi Fan, Zucong Lan

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 该综述连接多个认知架构与语言智能体系统,重构机制并编码相关关系,指出现代智能体部分功能已实现,最强机会在机制耦合,存在五个剩余组合,贡献了机制目录、证据深度框架及可证伪议程。

Comments 28 pages, 9 figures, 14 tables. Review article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23821 2026-07-28 cs.LG q-bio.GN 新提交 57%

SCTA: An Agentic Framework for Stable and Interpretable Target Gene Discovery from Single-Cell RNA Sequencing

SCTA:一种用于从单细胞RNA测序中稳定且可解释地发现靶基因的智能体框架

Shuyu Chen, Chen Zhu, Ye Zhang, Yang Li, Qiqi Xie, Haohan Wang

机构 * Novartis Biomedical Research(诺华生物医学研究公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 研究旨在从scRNA-seq数据中稳定且可解释地发现靶基因,提出SCTA智能体框架,将靶标发现分解为专门智能体并结合结构化证据约束推理,通过遗传性慢性胰腺炎研究验证其能提高靶标发现的多项性能。

Comments 10 pages, 4 figures. To appear in the ACM SIGKDD Workshop on Data Mining in Bioinformatics (BioKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23809 2026-07-28 cs.AI 新提交 57%

ACM: Agentic Context Management for Long Horizon Tasks

ACM:长期任务的智能体上下文管理

Xiaochuan Li, Ryan Ming, Meng Chu, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究长期智能体任务上下文管理问题,提出ACM框架,受人类记忆启发让智能体自主管理上下文,还开发训练后管道,能提升模型在相关任务上的性能,有效管理上下文可降低压力、实现扩展探索并产生更一致方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交 57%

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22609 2026-07-28 cs.AI 新提交 57%

Evaluating LLMs as Interpretable Controllers for Dynamical Systems

评估大语言模型作为动态系统的可解释控制器

Aleksander Østensen, Alberto Mino Calero, Anastasios M. Lekkas, Adil Rasheed

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨大语言模型能否成为动态热环境的可解释控制器,评估五个不同规模模型在多场景下的表现。结果显示控制性能与模型复杂度有关,高复杂度模型表现更佳,整合物理模型可提升性能,还揭示了不同规模模型推理的进展,为混合控制策略提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23983 2026-07-28 physics.geo-ph cs.LG 新提交 57%

HydroAgent: Formalizing Forecaster Expertise into Skill-Orchestrated Flood Forecasting Workflows

HydroAgent:将预报员专业知识形式化为技能编排的洪水预报工作流程

Qingyi Yang, Siqian Qiu, Bing Li, Xu Shan, Jia Feng, Shunan Zhou, Xudong Zhou, Tiantian Xing, Jiale Guo, Xiaoyi Dong, Gaoyu Liu, Xiaohuan Liu, Haiqing Pu, Qingwen Deng, Xun Zhang, Zhongrun Xiang, Haiyang Qian, Ying Yan, Yongkang Xu, Nuo Lei, Tianlong Jia, Baoying Shan, Carlo De Michele

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对业务洪水预报中隐性预报员专业知识难形式化等问题,提出HydroAgent框架,将大语言模型嵌入洪水预报工作流程,经实验验证其有效性,能转化隐性知识为可审核流程,辅助决策并展示规则引导语言模型推理补充物理模拟的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23006 2026-07-28 cs.IR cond-mat.mtrl-sci cs.AI 新提交 57%

VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

VecTree-RAG:一种结合向量和树检索的智能检索增强生成框架,以提高效率和准确性

Xinyan Zhong, Yuwei Shi, Yuqi Wei, Chen Shen, Tianhang Zhou, Zhenghao Wu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对科学问答中识别相关论文及找支持证据的问题,提出VecTree-RAG框架,结合向量与树检索机制。经多组问题评估,该框架在多个基准上获高分,证据页面精度高,且完整架构所需推理令牌少,为科学文献问答提供结构感知且可追溯的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21340 2026-07-28 cs.CL 版本更新 57%

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖

Prerit Ahuja

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。

Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03168 2026-07-28 cs.CV cs.LG 版本更新 57%

Farm-LightSeek: An Edge-centric Multimodal Agricultural IoT Data Analytics Framework with Lightweight LLMs

Farm-LightSeek:一种以边缘为中心的多模态农业物联网数据分析框架,集成轻量级语言模型

Dawen Jiang, Zhishu Shen, Qiushi Zheng, Tiehua Zhang, Wei Xiang, Jiong Jin

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Engineering, Swinburne University of Technology(斯威本科技大学工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉筹伯大学计算、工程与数学科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 针对智能农业面临的挑战,提出Farm-LightSeek框架,将大语言模型与边缘计算集成。通过传感器收集多源数据,在边缘节点进行跨模态推理等。创新包括闭环架构等,实验表明该框架在关键任务中性能可靠,推动了智能实时农业及两者深度集成。

Comments Accepted by IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03241 2026-07-28 cs.RO cs.LG 57%

Terrain Classification Enhanced with Uncertainty for Space Exploration Robots from Proprioceptive Data

基于不确定性增强的地形分类用于空间探索机器人的本体数据

Mariela De Lucas Álvarez, Jichen Guo, Raul Domínguez, Matias Valdenegro-Toro

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种基于不确定性量化的神经网络方法,利用本体数据实现可靠的地形分类,以提高空间探索机器人在不可预测环境中的决策可靠性。

Comments 6 pages, 4 figures. LatinX in AI Workshop @ ICML 2023 Camera Ready

Journal ref International Conference on Machine Learning Conference: LatinX in AI (LXAI) Research Workshop 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23712 2026-07-28 eess.SP 新提交 50%

Wireless Intelligence Needs a Cerebellum: Score-Based Foundation Models Toward Real-Time Physical-Layer Inference

无线智能需要一个小脑:基于分数的基础模型实现实时物理层推理

Chang Cai, Boyu Teng, Xiaojun Yuan, Ying-Jun Angela Zhang

专题命中 规划推理 :planning(abstract)

AI总结 研究针对无线智能中物理层快速精确推理需求,提出轻量级ScoreFM基础模型。它学习可重复使用分数函数,推理时嵌入特定任务算法作去噪器,支持多样下游任务,案例研究验证其灵活性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24417 2026-07-28 cs.IR 新提交 50%

CORE: A Unified Cascaded Ordinal Relevance Estimation Framework for E-commerce Search

CORE:一种用于电子商务搜索的统一级联序数相关性估计框架

Zhi Jin, Xi Wang, Yunfei Li, Guojun Liu, Qingsong Hua, Wei Lin

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究针对电商搜索中排名相关性问题,提出统一级联二元分类框架,将相关性估计转为顺序决策过程。框架适用于大语言模型和在线BERT模型,经实验验证能显著提升相关性性能,降低在线坏例率,表明分层建模对相关性估计有效。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24313 2026-07-28 cs.IR cs.CV cs.MA cs.RO 新提交 50%

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

通过局部多智能体RAG实现能量受限的分层水下监测

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

专题命中 规划推理 :reasoning(abstract)

AI总结 针对海洋生物监测受能量等限制的问题,提出结合边缘传感与局部推理的低功耗水下监测架构,采用分层设计,利用特定嵌入、识别层及多智能体框架,经案例研究评估,实现低功耗连续传感与局部多模态智能结合,减少能耗与通信开销。

Comments Contains 25 pages, 11 figures. To be submitted to Elsevier Ocean Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23930 2026-07-28 eess.SY cs.RO cs.SY 新提交 50%

Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping

通过可行动作映射桥接强化学习与最优控制

Stefan Richter, Alberto Giammarino, Guillem Torrente, Sam Blakeman, Peter Dürr

专题命中 规划推理 :planning(abstract)

AI总结 针对操作受约束动态系统,提出FAOC框架,整合RL与OC。通过计算高效映射算法,将RL动作转换为OCP可行参数集,兼顾安全性与灵活性。应用于机器人乒乓球运动规划,模拟实验显示其在样本效率和闭环性能上优于现有基准。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23797 2026-07-28 cs.RO 新提交 50%

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map

注意力的记忆:通过视觉-语言-运动地图进行语言条件下的重新感知

Dibyendu Ghosh

专题命中 规划推理 :planning(abstract)

AI总结 研究携带行为注释地图的机器人的规划问题,通过将重新感知视为注意力决策,利用持久地图的记忆实现资源分配优化,在语言条件任务中表现出色,证明地图能指导机器人关注重点,而非空间导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23718 2026-07-28 cs.IR 新提交 50%

Melo: A Production LLM-Powered Music Recommendation Agent

Melo:一个由大语言模型驱动的音乐推荐代理

Shijia Wang, Da Guo, Qiang Xiao, Fanghui Bi, Weisheng Li, Dongjing Wang, Chuanjiang Luo

专题命中 规划推理 :planning(abstract)

AI总结 研究基于网易云音乐部署的大语言模型驱动音乐推荐代理Melo,针对实体幻觉和长尾退化故障模式,采用推理时实体基础和反思性重试机制,经测试在播放列表留存和参与度指标上有提升,强调运行时机制对推荐进展的重要性。

Journal ref Proceedings of the 20th ACM Conference on Recommender Systems (RecSys '26), September 27-October 02, 2026, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23511 2026-07-28 cs.CV 新提交 50%

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

MOJITO:用于统一端到端自动驾驶的模态联合学习

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto(理想汽车) University of New South Wales(新南威尔士大学)

专题命中 规划推理 :planning(abstract)

AI总结 研究针对端到端自动驾驶系统问题,提出基于模态联合学习的MOJITO框架,去除级联接口,执行逐块模态联合注意力更新多模态特征,在数据集上取得新的最优成绩,展现出强大能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23106 2026-07-28 cs.GT 新提交 50%

Shapley Meets Tutte

沙普利值与图特多项式相遇

Martin Loebl

专题命中 规划推理 :planning(abstract)

AI总结 研究存在预先对齐代理组的合作博弈,通过连通性增强局部值的沙普利值建模局部连接对网络连通性的贡献,并将其与色多项式、图特多项式及Potts模型配分函数相联系,以解决相关网络问题。

Comments 14 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 50%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 规划推理 :planning(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09113 2026-07-28 eess.SP 版本更新 50%

Redefining Digital Twins as Predictive Decision Engines for AI-Native Wireless Networks

迈向智能无线网络:生成式AI与数字孪生的协同

Afan Ali, Ali Arshad Nasir, Naveed Iqbal, Daniel Benevides da Costa

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一种生成式AI赋能的数字孪生框架,通过实时同步信道、移动性、流量和能量信息,实现系统级主动优化,在无人机辅助非地面网络场景中节能约69.2%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08274 2026-07-28 cs.MA 版本更新 50%

Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents

迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作

Safia Baloch, Rahemeen Khan

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09995 2026-07-28 cs.CE 版本更新 50%

QuantHarness: Price-Driven Multi-Agent LLMs for High-Frequency Trading

QuantHarness:用于高频交易的价格驱动多智能体大语言模型

Fei Xiong, Xiang Zhang, Aosong Feng, Siqi Sun, Chenyu You

专题命中 规划推理 :reasoning(abstract)

AI总结 研究针对高频交易需求,引入QuantHarness多智能体LLM框架,将交易分解为四个智能体,利用结构化信号与LLM推理结合,经多金融工具实验验证,该框架在多指标上优于基线方法,为高频金融市场实时决策提供可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 14 篇

2607.24199 2026-07-28 cs.CV 新提交 90%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);verifier(abstract)

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22732 2026-07-28 cs.AI 新提交 88%

Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning

大语言模型游戏智能体中的空间推理:因果上下文和多步规划的影响

Mohit Jiwatode, Ronja Fuchs, Robin Schmöcker, Bodo Rosenhahn, Alexander Dockhorn

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 研究基于大语言模型的游戏智能体在复杂任务中表现不佳的问题,通过实验验证因果提示增强和多步规划可提升胜率并控制延迟,引入新基准评估,发现较大模型定位更准,融入因果上下文和多步规划能优化性能与速度。

Comments To be published at COG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25629 2026-07-28 cs.CV cs.LG 版本更新 79%

LanteRn: Latent Visual Structured Reasoning

LanteRn:潜在视觉结构推理

André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

机构 * Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏