arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-25 至 2026-06-25 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2606.25568 2026-06-25 cs.CL 新提交 83%

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

Riazi-8B:用于数学推理的乌尔都语大语言模型

Azher Ali, Ibtsam Haider, Raja Khurram Shahzad, Seemab Latif, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) National University of Sciences and Technology (NUST)(国家科学与技术大学) Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) Mid Sweden University(中瑞典大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24994 2026-06-25 cs.LG cs.AI 新提交 62%

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

ExTra: 面向语言模型强化学习的探索性轨迹优化

Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) SAP

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ExTra框架,通过新颖性奖励和熵引导前缀再生增强GRPO,在数学推理基准上提升pass@1约5%、pass@16约7%。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2606.24902 2026-06-25 cs.DL cs.AI 新提交 57%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25363 2026-06-25 cs.IR cs.AI math.HO 新提交 57%

TheoremGraph: Bridging Formal and Informal Mathematics

TheoremGraph:连接形式化与非形式化数学

Simon Kurgan, Evan Wang, Eric Leonen, Sophie Szeto, Luke Alexander, Artemii Remizov, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。

Comments 31 pages, 9 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25561 2026-06-25 cs.CR 新提交 50%

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

CrypFormBench:评估大型语言模型在密码方案形式化分析中的能力基准

Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

专题命中 代码与定理证明 :verifier(abstract)

AI总结 提出CrypFormBench基准,涵盖符号与计算安全,评估LLM在密码方案形式化分析中的五项核心能力,发现模型在生成、转换和修正方面表现有限。

Comments 23 pages, 17 figures, FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 4 篇

2606.22485 2026-06-25 cs.AI cs.CL cs.DB cs.LO 新提交 81%

VADAOrchestra: Neurosymbolic Orchestration of Adaptive Reasoning Workflows

VADAOrchestra:自适应推理工作流的神经符号编排

Teodoro Baldazzi, Luigi Bellomarini, Andrea Coletta, Michela Iezzi, Carsten Maple, Alessandro Pesare, Emanuel Sallinger

机构 * TU Wien(维也纳工业大学) Banca d’Italia(意大利央行) University of Warwick(华威大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VADAOrchestra框架,结合LLM灵活性与Datalog+/-符号推理,实现可审计、可扩展的自适应工作流编排,在金融场景中验证了忠实性、可扩展性和可解释性。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交 81%

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25622 2026-06-25 cs.CR cs.AI 新提交 70%

Probabilistic Agents in Deterministic Audits: Evaluating Multi-Agent Systems for Automated Audits Based on the German IT-Grundschutz

确定性审计中的概率性智能体:基于德国IT-Grundschutz的自动化审计多智能体系统评估

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) Freie Universität Berlin(柏林自由大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出结合混合检索增强生成的多智能体系统架构,通过假设验证循环和解耦推理流水线部分自动化IT-Grundschutz认证,实验表明在语义任务上高效但在逻辑推理阶段受限于LLM的概率性。

Comments Accepted for publication at the 2026 IEEE International Systems Conference (SysCon), Halifax, NS, Canada, April 6-9, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 50%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 13 篇

2606.25404 2026-06-25 cs.RO 新提交 82%

HEART: Coordination of Heterogeneous Expert Agents for Physically Grounded Robotic Task Planning

HEART: 异构专家智能体协调实现物理接地机器人任务规划

Junho Lee, Seabin Lee, Wonjong Lee, Nayoung Kim, Moonjeong Kang, Changjoo Nam

机构 * Sogang University(西江大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出异构多LLM框架HEART,将指令分解为原子推理任务分配给角色专家,通过约束驱动规划合成,提升机器人任务规划的物理可行性和效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25066 2026-06-25 cs.AI cs.CV 新提交 79%

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

视觉-语言模型的搜索方式与人类相似吗?经典视觉搜索范式中推理标记作为反应时间类似物

Farahnaz Wick

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究视觉-语言模型(VLM)在经典视觉搜索任务中是否表现出类似人类的行为模式,通过推理标记数量作为搜索努力度的指标,发现模型复现了部分人类特征但也存在关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25509 2026-06-25 cs.RO cs.CV 新提交 78%

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Lenovo Group Limited(联想集团)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25484 2026-06-25 cs.CY econ.GN q-fin.EC stat.AP 新提交 78%

From Causal Discovery to Implementation: An Agentic AI Framework for E-Scooter Mobility Hub Planning Across 29 German Cities

从因果发现到实施:面向29个德国城市的电动滑板车出行枢纽规划的智能体AI框架

Meng Jin, Melanie Handrich, Simone Martinenz, Nicholas Hoeser, Ziyue Li

专题命中 规划推理 :planning(title,abstract)

AI总结 提出一个三阶段智能体AI框架,利用29个德国城市的公共GBFS数据构建因果模板库,通过LLM驱动的因果发现揭示城市类型与集群类型对热点需求的因果驱动差异,并在海尔布隆指导两个枢纽站点建设。

Comments 32 Pages, Submitted to Transportation Research Part D: Transport and Environment. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25606 2026-06-25 cs.CV cs.AI cs.LG 新提交 73%

Expresso-AI: Explainable Video-Based Deep Learning Models for Depression Diagnosis

Expresso-AI: 基于可解释视频的深度学习模型用于抑郁症诊断

Felipe Moreno, Sharifa Alghowinem, Hae Won Park, Cynthia Breazeal

机构 * Media Lab MIT Cambridge, USA(媒体实验室 MIT 摄影实验室 美国剑桥)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可解释的深度学习框架,通过微调动作识别预训练的DCNN,分析面部视频中的时空特征,生成显著性图以解释模型决策,同时提升抑郁症严重程度预测性能。

Comments 8 pages. Accepted at the 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII). Code: https://github.com/felmoreno1726/Expresso-AI

Journal ref 2023 11th International Conference on Affective Computing and Intelligent Interaction (ACII), 2023, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 62%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25532 2026-06-25 cs.AI cs.AR cs.LG cs.MA 新提交 62%

Agentic evolution of physically constrained foundation models

物理约束基础模型的智能体演化

Jiangwei Zhang, Wen Sun, Chong Wang, Shiyao Li, Cheng Che, Chunjing Han, Dan Meng, Jian Yang, Yu Wang, Rui Hou

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出基于演化知识图谱的多智能体发现引擎,自动设计硬件兼容计算系统,在基础模型部署中演化出超越人工的压缩方法,实现大规模模型高效部署。

Comments 29 pages, 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25451 2026-06-25 cs.LG cs.AI 新提交 62%

Learning with a Single Rollout via Monte Carlo Pass@k Critic

通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习

Fengdi Che, Yang Liu, Lei Yu, Meng Cao, Tong Che, Rupam Mahmood, Dale Schuurmans

机构 * University of Alberta(阿尔伯塔大学) BIGAI(北京通用人工智能研究院) University of Toronto(多伦多大学) McGill University, Mila(麦吉尔大学,米拉) Nvidia Research(英伟达研究院) Amii(阿尔伯塔机器智能研究所) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24965 2026-06-25 cs.AI cs.LG 新提交 62%

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World: 迈向神经关系推理器的自动化基准测试

Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert

机构 * Cardiff University(卡迪夫大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。

Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25358 2026-06-25 cs.AI cs.MA 新提交 57%

Agentic Knowledge Tracing: A Multi-Agent LLM Architecture for Stealth Assessment of Financial Literacy in Serious Games

Agentic知识追踪:用于严肃游戏中金融素养隐形评估的多智能体大语言模型架构

Gabriel Santos, Rita Julia, Marcelo Nascimento

机构 * Federal University of Uberlândia Computer Science Faculty(伯南布哥联邦大学计算机科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出多智能体大语言模型架构Agentic BKT,通过四阶段流程从严肃游戏事件中隐形评估金融素养,实验表明其预测效度显著优于单智能体基线。

Comments 8 pages, 5 figures, IEEE CoG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25098 2026-06-25 cs.DC cs.AI cs.PF cs.SY eess.SY 新提交 57%

Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute

灵活功率的AI数据中心:一种电网响应式计算的新范式

Chris Williams, Philip Colangelo, Ayse Coskun, Ethan Levine, Andy Neale, Ciaran Roberts, Shayan Sengupta, Nikhil Shirolkar, Varun Sivaram, Sarah Soares, Ethan Tiao, Scott Underwood, Daniel Wilson, Frank Sharp, Luke Wainwright, Harry Petty, Scott Wallace, Brandon Records

机构 * Emerald AI Electric Power Research Institute (EPRI)(电力研究研究院) National Grid(国家电网) NVIDIA Oracle

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出将GPU集群作为电网交互式资产,通过软件编排实现负载快速削减、持续降载和碳感知运行,同时保持优先级任务服务水平,并实现跨地理集群的性能感知负载迁移。

Comments 14 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交 57%

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25489 2026-06-25 cs.HC 新提交 50%

When LLM Rationales Become User-Facing: Effects on Trust Perception, Decision-Making, and Gaze Behaviors

当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响

Xin Sun, Ting Pan, Yajing Wang, Shu Wei, Jos A. Bosch, Isao Echizen, Abdallah El Ali, Saku Sugawara

专题命中 规划推理 :reasoning(abstract)

AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 8 篇

2606.26029 2026-06-25 cs.CV cs.AI 新提交 87%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25000 2026-06-25 cs.LG cs.AI physics.geo-ph 新提交 86%

Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks

Geo-Strat-RL:从可验证任务中学习地质事件推理

Lukas Mosser

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交 82%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 79%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25319 2026-06-25 cs.CV 新提交 78%

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理

Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang

机构 * SCU(四川大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25206 2026-06-25 cs.RO cs.AI cs.CL 新提交 76%

RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory

RAVEN: 基于视觉-空间-时间记忆的长期推理与导航

Yixun Hu, Zhicheng Zheng, Lihan Zha, Chunwei Xing, Rajdeep Singh, Omar Hossain, Antonio Loquercio, Dhruv Shah

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。

Comments Project website: https://ravenmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26079 2026-06-25 cs.CL cs.CV cs.LG 新提交 62%

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

相同证据,不同答案:多模态大语言模型中的顺序敏感性审计

Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25391 2026-06-25 cs.SD cs.AI cs.MM 新提交 57%

From Sounds to Scenes: A Benchmark for Evaluating Context-Aware Auditory Scene Understanding in Large Audio Language Models

从声音到场景:评估大型音频语言模型中上下文感知听觉场景理解的基准

Pengfei Zhang, Hoang H Nguyen, Kazi Shaharair Sharif, Yutong Song, Wenjun Huang, Henry Peng Zou, Pinxin Liu, Honghui Xu, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Kennesaw State University(肯尼索州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出CASU基准,通过构建半合成音频流和设计四项任务,评估大型音频语言模型整合语音、事件和背景环境进行上下文感知听觉场景理解的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏