arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3361 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3361 篇

2605.26543 2026-05-27 cs.AI cs.LG 62%

PolyFusionAgent: A Multimodal Foundation Model and Autonomous AI Assistant for Polymer Property Prediction and Inverse Design

PolyFusionAgent: 用于聚合物性能预测和逆向设计的多模态基础模型与自主AI助手

Manpreet Kaur, Xingying Zhang, Qian Liu

机构 * Department of Applied Computer Science, The University of Winnipeg(应用计算机科学系,温尼伯大学) Department of Mechanical Engineering, University of Manitoba(机械工程系,曼尼托巴大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PolyFusionAgent框架,结合多模态聚合物基础模型PolyFusion和工具增强的设计代理PolyAgent,通过对齐序列、拓扑、3D几何和指纹等多模态视图学习共享潜在空间,实现热物理性能预测和化学有效、结构新颖的聚合物逆向设计,并利用文献证据检索闭环设计流程。

Comments 23 pages, 5 figures, 2 tables; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 62%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03191 2026-05-26 cs.CV cs.AI cs.LG 62%

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

机构 * Hasso Plattner Institute(霍普夫纳研究所) MBZUAI(穆萨大学人工智能研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL 62%

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21801 2026-05-22 cs.LG cs.CL 62%

Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization

为何语义熵失效:面向策略优化的几何感知与校准不确定性

Zheyuan Zhang, Kaiwen Shi, Han Bao, Zehong Wang, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种新的策略优化框架GCPO,通过几何感知措施捕捉语义分歧,并利用基于奖励的校准对齐不确定性与学习信号强度,从而更准确地跟踪梯度变化并提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20284 2026-05-21 cs.CV cs.AI cs.LG 62%

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

JUDO: 一种面向工业异常问答的多模态推理框架

Hyunju Kang, Woohyun Lee, Jaewon Kim, Hogun Park

机构 * Sungkyunkwan University(成均馆大学) Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JUDO框架,通过结合领域知识和上下文提升多模态推理能力,以解决工业异常检测中模型缺乏领域知识的问题,实验表明其在MMAD基准上优于Qwen2.5-VL-7B和GPT-4o。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23747 2026-05-20 cs.CV cs.AI cs.LG 62%

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16727 2026-05-19 cs.CL cs.AI 62%

Beacon: Single-Turn Diagnosis and Mitigation of Latent Sycophancy in Large Language Models

Beacon:单轮诊断和缓解大型语言模型中潜在的阿谀倾向

Sanskar Pandey, Ruhaan Chopra, Angkul Puniya, Sohom Pal

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Beacon基准测试,用于单轮诊断和缓解大型语言模型中潜在的阿谀倾向,通过评估十二种最先进的模型,揭示了阿谀倾向在语言和情感方面的稳定子偏差,并提出了在提示和激活层面的干预措施,以调节这些偏差,从而揭示对齐作为事实性和社会合规判断之间的动态流形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22473 2026-05-19 stat.ML cs.AI cs.LG 62%

Gradient Dynamics of Attention: How Cross-Entropy Sculpts Bayesian Manifolds

注意力的梯度动力学:交叉熵如何塑造贝叶斯流形

Naman Agarwal, Siddhartha R. Dalal, Vishal Misra

机构 * Columbia University(哥伦比亚大学) Columbia University School of Professional Studies(哥伦比亚大学专业研究学院) Department of Statistics(统计学系) Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析交叉熵训练如何重塑Transformer注意力分数和值向量,揭示了注意力评分的优势路由定律和值的职责加权更新,展示了梯度动力学如何塑造贝叶斯流形以支持概率推理。

Comments v2: Add dual-entropy connection - advantage signal drives \r{ho} down; fix duplicate bibliography entries (synced from Paper I)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22471 2026-05-19 cs.LG cs.AI stat.ML 62%

The Bayesian Geometry of Transformer Attention

Transformer 注意力的贝叶斯几何

Naman Agarwal, Siddhartha R. Dalal, Vishal Misra

机构 * Columbia University(哥伦比亚大学) Columbia University School of Professional Studies(哥伦比亚大学专业研究学院) Department of Statistics(统计学系) Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建贝叶斯风道,验证了Transformer在上下文中的贝叶斯推理能力,发现其通过几何机制实现后验更新与路由,揭示了注意力机制的必要性及扁平架构的不足。

Comments v2: Add dual-entropy measurement framework (H_I, H_P, \r{ho} = H_P/H_I); incorporate Overleaf revisions; fix duplicate bibliography entries (akyurek mashup; openai title; legacy aliases removed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07642 2026-05-14 cs.AI cs.CL cs.CV 62%

Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents

拆解与构建:基于技能的视觉-语言导航代理混合

Tianyi Ma, Yue Zhang, Zehao Wang, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) ESAT-PSI, KU Leuven(KU莱顿大学ESAT-PSI实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SkillNav框架,通过模块化技能推理提升视觉-语言导航性能,通过合成数据训练无监督的路由模型,实现对复杂场景的泛化能力。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11301 2026-05-13 cs.AI cs.CL cs.CV 62%

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

LatentRouter: 在看到答案之前,我们能否选择合适的多模态模型?

Xueqi Cheng, Yushun Dong

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LatentRouter通过多模态效用预测实现多模态大语言模型的路由,通过隐式通信和胶囊修正提升模型选择准确性,在MMR-Bench和VL-RouterBench实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 62%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11824 2026-05-12 cs.AI cs.LG 62%

Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models

Revis: 通过稀疏潜在引导缓解大视觉-语言模型中的物体幻觉

Jialin Wu, Wei Shi, Han Shen, Peigui Qi, Kunsheng Tang, Zhicong Huang, Binghao Wang, Zhou Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Revis通过潜在空间几何学提取纯视觉信息向量,采用校准策略在抑制发生深度进行稀疏干预,有效降低物体幻觉率19%,同时保持推理能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 62%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 视觉空间推理 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05953 2026-05-08 cs.CL cs.AI 62%

Hallucination as an Anomaly: Dynamic Intervention via Probabilistic Circuits

幻觉作为异常:通过概率电路进行动态干预

Erik Nielsen, Elia Cunegatti, Marcus Vukojevic, Giovanni Iacca

机构 * Department of Information Engineering and Computer Science(信息工程与计算机科学系) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PCNET,通过概率电路估计LLM残差流密度,检测幻觉作为几何异常,从而改进幻觉纠正,减少错误生成并提升事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 62%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22228 2026-05-01 cs.CV cs.AI cs.CL 62%

Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation

迷失在空间中?视觉-语言模型在相对相机姿态估计中挣扎

Ken Deng, Yifu Qiu, Yoni Kasten, Shay B. Cohen, Yftah Ziser

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在相对相机姿态估计中的表现,发现其在多视角空间推理中存在显著不足,尽管人类和专用几何方法表现良好,但VLMs仍处于初级水平,揭示了跨视角对应和投影相机运动理解等关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25318 2026-04-29 cs.GR cs.AI cs.CL 62%

Cutscene Agent: An LLM Agent Framework for Automated 3D Cutscene Generation

Cutscene Agent:一种用于自动化3D场景生成的LLM代理框架

Lanshan He, Haozhou Pang, Qi Gan, Xin Shen, Ziwei Zhang, Yibo Liu, Gang Fang, Bo Liu, Kai Sheng, Shengfeng Zeng, Chaofan Li, Zhen Hui, Keer Zhou, Lan Zhou, Shujun Dai

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cutscene Agent框架,通过双向集成LLM代理与游戏引擎,实现多代理协作生成可编辑的电影化3D内容,并构建了针对长周期多步骤协作的评估基准。

Comments 27 pages excluding appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25268 2026-04-29 cs.CL cs.AI 62%

CRAFT: Grounded Multi-Agent Coordination Under Partial Information

CRAFT:在部分信息下的 grounded 多智能体协调

Abhijnan Nath, Hannah VanderHoeven, Nikhil Krishnaswamy

机构 * Department of Computer Science, Colorado State University(计算机科学系,科罗拉多州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CRAFT 是评估大语言模型在严格部分信息下实用沟通能力的多智能体基准,通过自然语言构建共享3D结构。研究发现更强推理能力不必然带来更好协调,小模型常表现更优,表明多智能体协调仍是当前语言模型的挑战。

Comments Added revisions, corrected typos and additional analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 62%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 62%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18566 2026-04-22 cs.AI cs.HC cs.LG 62%

Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion

对系统动力学AI助手的基准测试:云与本地LLM在CLD提取与讨论中的比较

Terry Leitch

机构 * Ruxton AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了云和本地LLM在系统动力学AI助手中的表现,发现本地模型在CLD提取和讨论任务中表现不一,且后端选择对性能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG 62%

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00065 2026-04-21 cs.CL cs.AI 62%

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

使用视角词比词汇词对人类更困难,甚至对多模态语言模型更为困难

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和多模态语言模型在使用词汇、所有格和指示词时的认知负荷,发现视角词对两者都更难,且多模态模型在所有格和指示词上表现更差,揭示了其在常识和社交认知能力上的不足。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16421 2026-04-21 cs.CL cs.AI 62%

Measuring Representation Robustness in Large Language Models for Geometry

在大型语言模型中测量几何表示的鲁棒性

Vedant Jawandhia, Yash Sinha, Murari Mandal, Ankan Pal, Dhruv Kumar

机构 * Department of Computer Science and Information Systems, BITS Pilani(比特学院计算机科学与信息系统系) School of Computer Science, KIIT University(KIIT大学计算机科学学院) Department of Mathematics, BITS Pilani(比特学院数学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GeoRepEval框架,评估几何问题在不同表示形式下的正确性、不变性和一致性,发现表示选择对模型性能有显著影响,尤其在向量形式上表现脆弱,通过提示干预可提升高容量模型性能,但低容量模型无明显改进。

Comments 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11811 2026-04-21 cs.CL cs.AI cs.CV cs.CY 62%

Enhancing Geo-localization for Crowdsourced Flood Imagery via LLM-Guided Attention

通过LLM引导注意力增强 crowdsourced 洪水影像的地理定位

Fengyi Xu, Jun Ma, Waishan Qiu, Cui Guo, Jack C. P. Cheng

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系) Urban Systems Institute, The University of Hong Kong(香港大学都市系统研究所) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港理工大学土木与环境工程系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPR-AttLLM框架,通过整合大语言模型的语义推理与地理知识,提升 crowdsourced 洪水影像的地理定位精度,实验表明在真实洪水影像上召回率提升1-3%,最高达8%。

Comments Updated author list to include additional contributor. Revised title and improved methodology section based on collaborative feedback

Journal ref Computers, Environment and Urban Systems, 127, 102434 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10562 2026-04-20 cs.CV cs.AI cs.CL cs.CY 62%

Seeing the Intangible: Survey of Image Classification into High-Level and Abstract Categories

看见无形:图像分类到高级和抽象类别的调查

Delfina Sol Martinez Pandiani, Valentina Presutti

机构 * University of Bologna(博洛尼亚大学) University of Bologna Department of Computer Science(博洛尼亚大学计算机科学系) University of Bologna Department of Modern Languages, Literatures(博洛尼亚大学现代语言文学系) Centrum Wiskunde en Informatica(数学与信息学研究中心) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克奎恩特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统回顾高阶视觉理解的研究,探讨了抽象概念在自动图像分类中的处理,揭示了高阶视觉推理的挑战与机遇,强调了混合AI系统的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 62%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09604 2026-04-14 cs.AI cs.LG 62%

LLMs for Text-Based Exploration and Navigation Under Partial Observability

基于部分可观测性的文本基于探索与导航中的大型语言模型

Stephan Sandfuchs, Maximilian Melchert, Jörg Frochte

机构 * AKIS -- Interdisciplinary Institute for Applied AI and Data Science Ruhr(AKIS——鲁尔跨学科应用人工智能与数据科学研究所) Bochum University of Applied Sciences(波鸿应用科学大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在部分可观测环境下作为纯文本控制器的可行性,评估了九种不同LLM在探索和导航任务中的表现,发现推理调优模型在导航任务中表现更可靠,但效率仍低于理想路径。

Comments 15 pages, (to be published Springer Lecture Notes of the Institute for Computer Sciences, Social Informatics and Telecommunications Engineering [LNICST] )

详情

展开后加载摘要…

URL PDF HTML 收藏