arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-20 至 2026-07-20 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2607.15178 2026-07-20 cs.CL cs.AI 版本更新 73%

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

T^2MLR:具有时间中层循环的Transformer

Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

机构 * Princeton University(普林斯顿大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 7 篇

2510.22204 2026-07-20 cs.RO cs.AI 版本更新 79%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新 75%

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 62%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13545 2026-07-20 cs.AI cs.CL cs.CY 版本更新 62%

The AI Fiction Paradox

人工智能虚构悖论

Katherine Elkins

机构 * Integrated Program in Humane Studies, Kenyon College(肯尼恩学院人文学研究整合项目) AI CoLab, Kenyon College(肯尼恩学院人工智能协作实验室) Human-Centered AI Lab(以人为中心的人工智能实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨人工智能生成虚构内容的困境,指出叙事因果、信息重评和多尺度情感架构三大挑战,揭示AI生成虚构的难题及潜在风险。

Comments 15 pages, Presented at the MFS Cultural AI Conference, Purdue University, September 18, 2025. Accepted for publication as a collection of essays for a special issue of MFS Modern Fiction Studies on Cultural AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 62%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12711 2026-07-20 cs.AI cs.LO 版本更新 57%

MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

基于最大可满足性的反馈在数独中引导视觉语言模型

Pedro Orvalho, Guillem Alenyà, Felip Manyà

机构 * Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC)) Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究在数独中引导视觉语言模型的问题,提出通过MaxSAT预言机将形式约束推理集成到VLM求解过程的神经符号方法,经实验验证该方法能提高逻辑一致性和解决实例数量,增强视觉语言推理可靠性。

Comments Accepted at the 25th EPIA Conference on Artificial Intelligence, EPIA 2026. 16 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24819 2026-07-20 cs.SE cs.PL 版本更新 50%

A Roadmap for Tamed Interactions with Large Language Models

与大语言模型进行可控交互的路线图

Vincenzo Scotti, Jan Keim, Tobias Hey, Andreas Metzger, Anne Koziolek, Raffaela Mirandola

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对大语言模型交互可靠性等问题,提出LLM脚本语言LSL,将其交互构建为可分析程序,通过引入多种抽象支持规范开发,还能外化提示设计,减少隐式推理,为更易维护的提示系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 8 篇

2607.03651 2026-07-20 cs.LG math.OC 版本更新 85%

LLM-Guided Transportation Hub Capacity Planning with Textual Business Inputs

基于文本业务输入的大语言模型引导的交通枢纽容量规划

Xiaoyue Liu, Zheng Dong

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 研究提出用大语言模型代理依自然语言业务描述迭代提出枢纽容量决策的框架,核心机制是思维链推理协议,经反馈回路验证决策,在实际货运网络中表现优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00182 2026-07-20 cs.RO cs.AI 版本更新 83%

A Systematic Study of Large Language Models for Task and Motion Planning With PDDLStream

基于PDDLStream的任务与运动规划大语言模型的系统研究

Jorge Mendez-Mendez

机构 * Stony Brook University(石溪大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型在机器人任务与运动规划中的应用,开发16种用LLMs替代关键TAMP组件的算法,通过实验发现基于LLM的规划器成功率低、规划时间长,提供几何细节会增加任务规划错误,多数情况下直接LLM变体表现更好。

Comments 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 70%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15010 2026-07-20 cs.LG cs.AI cs.CL 版本更新 67%

What Is the Minimum Architecture for Prolepsis? Early Irrevocable Commitment Across Tasks in Small Transformers

什么是前瞻性架构的最小结构?小变压器中跨任务的早期不可撤销承诺

Éric Jacopin

机构 * Cosmic AI

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了变压器在何时做出决策以及为何无法纠正决策,提出前瞻性架构概念,通过实验验证了任务特定注意力头对决策的持续影响及架构设计对任务性能的影响。

Comments v2: corrects three citations; reconciles main-text/appendix numbers (the two Llama sweeps now labeled); the effective last-token site differs from Anthropic's newline (position-specificity replicates, site identity does not); adds an erratum on a CLT encoder-hook mismatch (detection-side only); softens novelty, necessity, and depth claims per COLM 2026 reviews; defines prolepsis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13669 2026-07-20 cs.AI 版本更新 57%

Agents-K1: Towards Agent-native Knowledge Orchestration

Agents-K1:迈向智能体原生的知识编排

Zongsheng Cao, Bihao Zhan, Jinxin Shi, Jiong Wang, Fangchen Yu, Zhijie Zhong, Yingnan Han, Zijie Guo, Tianshuo Peng, Zhuo Liu, Yi Xie, Xiang Zhuang, Shengji Tang, Yue Fan, Runmin Ma, Shiyang Feng, Xiangchao Yan, Anran Liu, Peng Ye, Wenlong Zhang, Xiaosong Wang, Shufei Zhang, Chunfeng Song, Fenghua Ling, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * PJLab(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Agents-K1管道,将原始文档转化为智能体原生科学知识图谱,通过多模态解析器、GRPO训练的4B信息抽取骨干和三源智能体接口,实现科学信息抽取、知识图谱构建和多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15356 2026-07-20 cs.AI 版本更新 57%

RAD: Retrieval High-quality Demonstrations to Enhance Decision-making

RAD:检索高质量示范以增强决策

Lu Guo, Yixiang Shan, Zhengbang Zhu, Qifan Liang, Lichang Song, Ting Long, Weinan Zhang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University, Changchun, China(吉林大学人工智能学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对离线强化学习泛化能力受限问题,提出RAD方法,通过引入检索机制,从离线数据集检索高回报可达状态作目标,利用生成模型生成子轨迹规划,经实验验证该方法在多基准测试中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09581 2026-07-20 cs.CV cs.SD 版本更新 50%

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

万舞者:一种用于分钟级连贯音乐到舞蹈生成的分层框架

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Ruoshi Zhang, Yi Lu, Gang Cheng, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :planning(abstract)

AI总结 针对从音乐生成舞蹈视频的挑战,提出万舞者分层框架,解耦过程为全局关键帧规划和局部时间细化,利用音乐上下文确保连贯,通过动态帧率自适应等创新,突破时长限制,在多舞蹈类型上表现出色,达新的技术水平。

Comments project: https://humanaigc.github.io/wan-dancer-project/, code: https://github.com/Wan-Video/Wan-Dancer, modelscope: https://www.modelscope.cn/models/Wan-AI/Wan-Dancer-14B, huggingface: https://huggingface.co/Wan-AI/Wan2.2-Animate-14B

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新 50%

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 规划推理 :reasoning(abstract)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视觉空间推理 4 篇

2607.11436 2026-07-20 cs.AI 版本更新 79%

The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

多模态焦点的潮起潮落:为基于视觉的语言模型推理调度视觉中继窗口

Wencheng Ye, Yi Bin, Yujuan Ding, Hongye Fang, Zheng Wang, Xing Xu, Jingkuan Song, Yun Zhang, Sirui Da, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Fashion and Textiles, The Hong Kong Polytechnic University(香港理工大学纺织及制衣学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型视觉证据不稳定问题,通过剖析其内部多模态注意力焦点的三阶段分布,提出TRACE框架,该框架能自适应控制推理,在多模型和多基准测试中显著提升基于证据的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10383 2026-07-20 cs.CV cs.AI cs.RO 版本更新 70%

ABot-N1: Toward a General Visual Language Navigation Foundation Model

ABot-N1:迈向通用视觉语言导航基础模型

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Yang Cai, Jingjing Ma, Shihui Su, Zixiao Tang, Linbo Zheng, Zedong Chu, Xiaolong Wu, Wenbin Tang, Mu Xu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02851 2026-07-20 cs.RO 版本更新 67%

EmbodiedDiffusion: End-to-End Traversability-Guided Visual Diffusion for Heterogeneous Robot Navigation

EmbodiedDiffusion:用于异构机器人导航的端到端可通行性引导视觉扩散

Iana Zhura, Sausar Karaf, Faryal Batool, Nipun Dhananjaya Weerakkodi Mudalige, Valerii Serpiva, Ali Alridha Abdulkarim, Aleksey Fedoseev, Didar Seyidov, Hajira Amjad, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科沃科学与技术研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 针对自主导航中视觉可通行性估计问题,EmbodiedDiffusion框架利用无规划器合成监督等,同时预测可通行性地图与生成可行轨迹,经训练提炼语义到轻量级模型,能快速适应新平台,在多机器人室内环境中实现高效导航与轨迹生成。

Comments This work has been submitted for publication and is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 50%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 测试时计算 2 篇

2607.10128 2026-07-20 cs.LG stat.ML 版本更新 57%

Energy-guided Recursive Model

能量引导递归模型

Yifei Zhao, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿研究院) School of Physics, University of Electronic Science and Technology of China(电子科技大学物理学院) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(电子科技大学量子物理与光子量子信息教育部重点实验室) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(四川省非经典信息科学基础学科研究中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究递归推理模型测试时扩展缺乏原则机制的问题,提出能量引导递归模型(ERM),利用霍普菲尔德能量定义选择器,与能量技术集成,在数独等问题上达最优解,优于其他模型,为有效推理提供途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09421 2026-07-20 cs.CL 版本更新 57%

What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents

技能应记住什么?语言模型代理中成本感知技能重写的质量-成本权衡

Qinghua Xing, Yinda Chen, Yaping Jin, Zhenhe Wu, Bohan Lin, Hang Zhou, Xinghao Chen, Hanting Chen, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies(华为技术有限公司) Tianjin University(天津大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究语言模型代理中技能重写的质量-成本权衡,提出信息保留策略,在SkillsBench上实现成本降低7%-14.7%且保持验证质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 复杂问题求解 1 篇

2503.12483 2026-07-20 cs.SE 版本更新 80%

MoT: Modularization-of-Thought Prompting for Effective Code Generation

MoT:用于有效代码生成的思维模块化提示

Ruwei Pan, Hongyu Zhang

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 推理评测 15 篇

2603.19464 2026-07-20 cs.RO 版本更新 85%

Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification

大语言模型能否证明机器人路径规划的最优性?一种用于研究级算法验证的基准测试

Zhengbang Yang, Md. Tasin Tazwar, Minghan Wei, Zhuangdi Zhu

机构 * George Mason University(乔治梅森大学) Florida Atlantic University(佛罗里达大西洋大学)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出首个评估大语言模型在机器人路径规划算法近似比证明能力的基准测试,包含34个研究级证明任务,揭示了LLM在缺乏领域知识时的局限性,并通过上下文补充分析改进推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-07-20 stat.ME cs.AI stat.AP stat.ML 版本更新 83%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08423 2026-07-20 cs.AI 版本更新 79%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16370 2026-07-20 cs.CL cs.AI cs.CV 版本更新 73%

Brain-CLIPLM: Semantic Compression for EEG-to-Text Decoding

Brain-CLIPLM: 用于EEG到文本解码的语义压缩

Xiaoli Yang, Huiyuan Tian, Yurui Li, Jianyu Zhang, Shijian Li, Gang Pan

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Brain-CLIPLM框架,通过语义锚点恢复和锚点引导的句子重建,解决EEG信号低信噪比和信息带宽限制的问题,实现了更高的文本检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19834 2026-07-20 cs.CV 版本更新 67%

KD-Judge: A Knowledge-Driven Automated Judge Framework for Functional Fitness Movements on Edge Devices

KD-Judge:一种基于知识的自动化评判框架,用于边缘设备上的功能性健身动作

Shaibal Saha, Fan Li, Yunge Li, Arun Iyengar, Lucas Alves, Lanyu Xu

机构 * Department of Computer Science and Engineering, Oakland University, Rochester Hills, USA(计算机科学与工程系,奥克兰大学,罗切斯特希尔,美国)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出KD-Judge,一种基于知识的自动化评判框架,用于在边缘设备上对功能性健身动作进行重复标准的自动评判,通过规则结构化和确定性规则系统提高效率和准确性。

Comments Accepted at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 62%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏