arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-02 至 2026-07-02 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 2 篇

2602.03370 2026-07-02 cs.CV cs.LG 版本更新 79%

GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition

GryphOne: 面向离线手写数学表达式识别中结构细化的符号感知掩码扩散

Takaya Kawakatsu, Ryo Ishiyama

机构 * Preferred Networks, Inc.(Preferred Networks公司) Kyushu University(九州大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 提出离散扩散框架GryphOne,将HMER重构为迭代符号细化而非序列生成,通过符号感知分词和随机掩码互学习提升鲁棒性,在MathWriting上达到5.51% CER和59.9% EM,超越所有重实现模型和商业系统。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13349 2026-07-02 cs.LG 版本更新 57%

When Less Latent Leads to Better Relay: Information-Preserving Compression for Latent Multi-Agent LLM Collaboration

少而精的潜在信息带来更好的中继:面向潜在多智能体大语言模型协作的信息保持压缩

Yiping Li, Zhiyu An, Wan Du

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, Merced(加州大学默塞德分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种信息保持压缩方法,通过引入正交回填机制,在减少通信开销的同时保持信息完整性,提升了多智能体大语言模型协作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 3 篇

2511.06160 2026-07-02 cs.AI cs.CL cs.CY 版本更新 84%

Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles

通过逻辑网格谜题评估LLM推理中的隐性偏见

Fatima Jahara, Mark Dredze, Sharon Levy

机构 * Rutgers University(罗格斯大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PRIME框架,利用逻辑网格谜题系统探测LLM在复杂推理中受社会刻板印象的影响,发现模型在解与刻板印象一致时推理更准确。

Comments 26 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04694 2026-07-02 cs.CL cs.AI 版本更新 81%

Reasoning Up the Instruction Ladder for Controllable Language Models

在指令阶梯上推理以实现可控语言模型

Zishuo Zheng, Vidhisha Balachandran, Chan Young Park, Faeze Brahman, Sachin Kumar

机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Microsoft Research(微软研究院) Allen Institute for AI(艾伦人工智能研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 70%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 10 篇

2606.30552 2026-07-02 cs.RO cs.CV 版本更新 85%

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

训练具有密集具身思维链监督的视觉-语言-动作模型

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

机构 * Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);planning(abstract)

AI总结 提出ZR-0模型,通过密集具身思维链监督对齐跨具身表示,采用双流架构(VLM生成结构化推理,扩散Transformer生成动作),在多个仿真和真实平台实现强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23405 2026-07-02 cs.MA cs.AI cs.RO 版本更新 83%

Planning over MAPF Agent Dependencies via Multi-Dependency PIBT

通过多依赖PIBT规划MAPF智能体依赖关系

Zixiang Jiang, Yulun Zhang, Rishi Veerapaneni, Jiaoyang Li

机构 * University Of Melbourne(墨尔本大学) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出多依赖PIBT(MD-PIBT)框架,通过搜索智能体依赖关系来规划多智能体路径,在拥挤环境中高效处理多达10000个智能体,支持多种运动学约束。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04453 2026-07-02 cs.CV 版本更新 82%

UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving

UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型

Zhexiao Xiong, Xin Ye, Burhan Yaman, Sheng Cheng, Yiren Lu, Jingru Luo, Nathan Jacobs, Liu Ren

机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Case Western Reserve University(凯斯西储大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。

Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03591 2026-07-02 cs.RO cs.SY eess.SY 版本更新 78%

Manifold-constrained Hamilton-Jacobi Reachability Learning for Decentralized Multi-Agent Motion Planning

流形约束的 Hamilton-Jacobi 可达性学习用于去中心化多智能体运动规划

Qingyi Chen, Ruiqi Ni, Junyoung Kim, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 提出流形约束的 HJR 学习框架,通过求解流形约束下的 HJR 问题获取任务感知安全条件,并集成到去中心化轨迹优化规划器中,实现安全且任务可行的多智能体运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04988 2026-07-02 cs.MA cs.AI 版本更新 70%

When AI Agents Compete for Jobs: Strategic Capabilities and Economic Dynamics of AI Labour Markets

当AI代理竞争工作岗位:AI劳动力市场的战略能力与经济动态

Christopher Chiu, Simpson Zhang, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge(剑桥大学应用数学与理论物理系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AI-Work模拟平台,研究AI代理在劳动力市场中的竞争行为,发现元认知、竞争意识和长期战略规划能力使代理获得更高利润和市场份额。

Comments Accepted at ICML 2026, Code available at https://github.com/chy-chiu/ai-work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04140 2026-07-02 cs.AI cs.CL 版本更新 62%

Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs

选择性专家引导实现强化学习中有效且多样的探索

Zishang Jiang, Jinyi Han, Tingyun Li, Xinyi Wang, Sihang Jiang, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MENTOR框架,仅在关键决策点提供专家引导,平衡探索的有效性与多样性,提升LLM在可验证奖励强化学习中的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17406 2026-07-02 cs.AI 版本更新 57%

EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale

EvoMaster:一种用于大规模代理科学的基础进化代理框架

Xinyu Zhu, Yuzhu Cai, Zexi Liu, Cheng Wang, Fengyang Li, Wenkai Jin, Wanxu Liu, Zehao Bing, Bingyang Zheng, Jingyi Chai, Shuo Tang, Rui Ye, Yuwen Du, Xianghe Pang, Yaxin Du, Tingjia Miao, Yuzhi Zhang, Ruoxue Liao, Zhaohan Ding, Linfeng Zhang, Yanfeng Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) SciLand DP Technology(DP技术)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 EvoMaster通过持续自我进化机制,使代理能迭代优化假设并积累知识,实现跨学科的高效科学发现,其易用性与性能在多个基准测试中均表现优异。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30524 2026-07-02 cs.SE 版本更新 50%

The Illusion of Agentic Complexity in README.md Generation: Evaluating Single-Agent vs. Multi-Agent RAG Systems

README.md生成中的代理复杂性幻觉:评估单代理与多代理RAG系统

Abu Saleh, Tesfay Welegebreal Tesfay, Phuong T. Nguyen, Juri Di Rocco, Muhammad Umar Zeshan, Davide Di Ruscio

专题命中 规划推理 :planning(abstract)

AI总结 通过对比单代理、多代理和开发者引导规划三种RAG架构生成GitHub仓库README文件,发现单代理管道在词汇质量相当的情况下,令牌消耗降低86%、速度提升一倍,而多代理系统结构一致性达98%但存在规划瓶颈,开发者引导规划获得最佳文档质量。

Comments The paper has been peer-reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02114 2026-07-02 physics.soc-ph 版本更新 50%

AI-Driven Stabilization in Power Grids through Controlling Line Admittances

通过控制线路导纳实现电网的AI驱动稳定

Sangjoon Park, Hoyun Choi, Yongsun Lee, Seungchan Jo, Jürgen Kurths, B. Kahng

专题命中 规划推理 :planning(abstract)

AI总结 提出自适应导纳控制器(AAC)算法,通过实时调整导纳调节器位置稳定电网,在真实英国电网上显著降低频率偏差并快速恢复运行,同时降低系统复杂性和成本。

Comments 13 pages, 10 figures

Journal ref Chaos, Solitons & Fractals 210, Part 2, 118672 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 5 篇

2604.16993 2026-07-02 cs.AI cs.CV cs.RO 版本更新 79%

Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification

规则导向的视觉语言导航:通过语义推理和几何校正弥合感知与合规性

Jiawen Wen, Penglei Sun, Wenjie Zhang, Suixuan Qiu, Weisheng Xu, Xiaofei Yang, Xiaowen Chu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Normal University(北京师范大学) Guangzhou University(广州大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 本文提出Rule-VLN,首个大规模城市规则合规导航基准,通过语义推理和几何校正模块提升导航安全性,实验表明该模块显著提升导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01654 2026-07-02 cs.CV cs.AI cs.MM 版本更新 57%

Moiré Video Authentication: A Physical Signature Against AI Video Generation

摩尔视频认证:一种对抗AI视频生成的物理签名

Yuan Qing, Kunyu Zheng, Lingxiao Li, Boqing Gong, Chang Xiao

机构 * Boston University(波士顿大学)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的视频认证方法,利用摩尔效应产生独特的视觉特征,通过分析视频中摩尔条纹的相位和位移关系,区分真实与AI生成视频。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/physical_video_signature/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 50%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 50%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19326 2026-07-02 cs.CV 版本更新 50%

MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation

MonoMSK: 单目3D肌肉骨骼动力学估计

Farnoosh Koleini, Hongfei Xue, Ahmed Helmy, Pu Wang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MonoMSK混合框架,结合数据驱动与物理仿真,从单目视频估计生物力学真实的3D人体运动(运动学与动力学),通过ODE仿真和逆动力学实现高精度运动与力估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 1 篇

2511.07397 2026-07-02 cs.CL 版本更新 57%

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

边说话边思考:面向响应式与智能对话语音代理的推理时知识迁移

Vidya Srinivas, Zachary Englhardt, Vikram Iyer, Shwetak Patel

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 提出对话填充方法,通过小型说话者模型即时生成上下文响应以隐藏推理模型延迟,并在推理中无缝整合流式知识,在保持毫秒级响应速度的同时将准确度差距缩小至前沿推理模型的6.3%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 3 篇

2510.14113 2026-07-02 cs.CL cs.AI cs.CR 版本更新 73%

Toward Cybersecurity-Expert Small Language Models

面向网络安全专家的小型语言模型

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche

机构 * IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00767 2026-07-02 cs.LG 版本更新 57%

ActivityNarrated: An Open-Ended Narrative Paradigm for Wearable Human Activity Understanding

ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式

Lala Shakti Swarup Ray, Mengxi Liu, Alcina Pinto, Deepika Gurung, Daniel Geissler, Paul Lukowoicz, Bo Zhou

机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21573 2026-07-02 cs.CV 版本更新 50%

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

重新思考视觉隐私:一种用于严重性评估的组合隐私风险框架与VLM

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Sai Praneeth Karimireddy, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Meta Superintelligence Labs(Meta超级智能实验室) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出组合隐私风险分类法(CPRT),将视觉属性按独立可识别性和组合危害潜力分级,并构建6.7K图像数据集,评估VLM在组合隐私风险评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 8 篇

2511.17731 2026-07-02 cs.CV cs.LG 版本更新 90%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24661 2026-07-02 cs.AI cs.CL 版本更新 81%

Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework

衡量LLM中的推理质量:一个多维行为框架

Ali Şenol, Garima Agrawal, Huan Liu

机构 * Department of Computer Engineering, Tarsus University(塔鲁斯大学计算机工程系) School of Computing and Augmented Intelligence (SCAI), Arizona State University (ASU)(计算与增强智能学院(SCAI),亚利桑那州立大学(ASU)) HumaConn AI Consulting(HumaConn AI咨询)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一个基于行为的多维框架,从正确性、一致性、鲁棒性、逻辑连贯性、效率和稳定性六个维度评估LLM推理质量,揭示仅靠准确率无法观察到的行为,并支持部署决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21013 2026-07-02 cs.LG cs.AI 版本更新 81%

Predicting LLM Reasoning Performance with Small Proxy Model

用小代理模型预测LLM推理性能

Woosung Koh, Juyoung Suk, Sungjun Han, Se-Young Yun, Jamin Shin

机构 * Trillion Labs KAIST AI(韩国科学技术院人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出rBridge方法,通过任务对齐加权负对数似然,使小模型(≤1B)有效预测大模型推理性能,成本降低超100倍,在1B-32B规模上实现最强相关性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 78%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 67%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03137 2026-07-02 cs.AI 版本更新 57%

Think-Before-Speak: From Internal Evaluation to Public Expression in Multi-Agent Social Simulation

Think-Before-Speak: 从内部评估到多智能体社会模拟中的公开表达

Kaiqi Yang, Tai-Quan Peng, Sanguk Lee, Hui Liu

机构 * Michigan State University(密歇根州立大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出TBS框架,通过分离智能体的内部推理与公开话语生成,模拟从内部评估到公开表达的路径,并在气候政策讨论中验证其机制敏感性。

Comments 8 pages of main content, 14 pages including references and appendices, 3 figures. Accepted to the KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏