arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-23 至 2026-07-23 共收录 85 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 20 篇

2607.19433 2026-07-23 cs.AI cs.CR 新提交 57%

The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI

Chronos漏洞:智能AI中基于时间持久性和内存欺骗的分类法

Om Narayan, Ramkinker Singh, Praveen Baskar

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究人工智能中Chronos漏洞,形式化基于持久性攻击的威胁模型,指出传统端点内容过滤器不足,综合深度防御格局并分类新兴框架,应对智能体内存攻击等安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19429 2026-07-23 cs.LG 新提交 57%

Adaptive Multi-Expert Graph Transformer for Interpretable EEG-Based Diagnostics

用于基于脑电图的可解释诊断的自适应多专家图变换器

Maryam Rahimimovassagh, Md Elias Hossain, Ivan Garibay, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究基于EEG的诊断问题,提出空间多专家图变换器,将EEG记录建模为动态功能连接图序列,用wPLI估计连接性,经层次图编码和多专家架构实现亚型感知推理,实验证明该方法在异常检测上性能良好且具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19367 2026-07-23 cs.AI 新提交 57%

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19359 2026-07-23 cs.AI 新提交 57%

Profile-Graph Memory for LLM Agents: Implicit Cross-Entity Traversal through Narrative Profiles

用于大语言模型智能体的概要图内存:通过叙事概要进行隐式跨实体遍历

Shengtong Zhu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体长期记忆中多跳关联未被充分测量的问题,提出了MemHop基准和ProGraph两层内存架构,通过概要扩展与压缩残差实现跨实体遍历,提升了多跳推理及精确召回能力,在多个基准测试中表现优异并开源相关实现。

Comments 11 pages, 2 figures, 7 tables. Code and MemHop benchmark: https://github.com/ShengtongZhu/ProGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19349 2026-07-23 cs.AI 新提交 57%

FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads

FineServe:一个细粒度的数据集以及对全球大语言模型服务工作负载的特征描述

Tiancheng Zhang, Shaoyuan Huang, Mingyuan Wang, Yunfeng Zhao, Xiaofei Wang, Wenyu Wang

机构 * Tianjin University(天津大学) PPIO Cloud (Shanghai) Co., Ltd.(PPIO云(上海)有限公司)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 针对大语言模型服务中高效服务面临的挑战,提出FineServe数据集,能对异构模型和任务的服务动态进行细粒度特征描述。通过分析得出波动模式,开发工作负载生成器,为评估相关策略提供现实基础。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03447 2026-07-23 cs.SE cs.AI 版本更新 57%

Measuring LLM Trust Allocation Across Conflicting Software Artifacts

在冲突软件构件中衡量LLM的信任分配

Noshin Ulfat, Ahsanul Ameen Sabit, Soneya Binta Hossain

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) IQVIA Inc.(IQVIA公司)

专题命中 推理评测 :reasoning(abstract_cn);分类 cs.AI

AI总结 研究探讨LLM在处理冲突软件构件时的信任分配问题,提出TRACE框架评估不同构件的质量、不一致性和信任校准,发现模型在检测文档错误时表现优于实现错误,但对实现漂移而文档无误的情况检测率下降,且信任校准不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20284 2026-07-23 cs.CV 新提交 50%

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

用于遥感图像理解的多模态大语言模型:领域特定还是通用?

Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文针对遥感图像理解的多模态大语言模型展开研究,通过系统调查和评估,比较其与通用模型在不同任务上的表现,发现当前模型存在局限,进而给出未来方向,为开发相关模型提供系统参考。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 50%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 50%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新 50%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 50%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 14 篇

2607.20056 2026-07-23 cs.CL cs.AI 新提交 76%

Language-Specific versus Cross-Lingual Knowledge Graphs for Implicit Aspect Identification in Arabic: A Comparative Study of Reasoning and Adaptation Strategies

用于阿拉伯语隐式方面识别的特定语言与跨语言知识图谱:推理和适应策略的比较研究

Lujain A. Alawwad

机构 * Saudi Electronic University(沙特电子大学)

专题命中 其他推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究阿拉伯语隐式方面识别中特定语言与跨语言知识图谱策略,在混合管道中比较两种策略及生成提取器的零样本提示和特定任务微调两种适应策略,发现阿拉伯语本地KG效果更好,特定任务微调提升显著。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 71%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 其他推理 :reasoning(title)

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19847 2026-07-23 cs.LG cs.AI cs.CL cs.DB 新提交 67%

Auto-Fill: Learning to Predict Missing Values Accurately with Specialist Language Models

自动填充:使用专业语言模型准确预测缺失值

Yurong Liu, Yeye He, Haoyu Dong, Junjie Xing, Shi Han, Dongmei Zhang, Surajit Chaudhuri

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究表格数据缺失值预测问题,提出自动填充方法,通过后训练三个针对不同能力的专业小语言模型并结合校准集成机制,相比现有推理模型在保证高精度的同时大幅降低成本。

Comments VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19592 2026-07-23 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Knowledge-Centric Self-Improvement

以知识为中心的自我改进

Xuefei Julie Wang, Lauren Hyoseo Yoon, Chengrui Qu, Amanda Zichang Wang, Atharva Sehgal, Eric Mazumdar, Yisong Yue

机构 * Caltech(加州理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究以知识为中心的自我改进范式,通过简单协议让智能体尝试任务后为知识库贡献见解并提炼知识,提高了解决率、降低成本,且知识可转移,表明进步可由持久知识驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 62%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19674 2026-07-23 cs.CR cs.AI cs.LG 新提交 62%

FedLSG: LLM-Enhanced Semantic Calibration for Federated Graph Backdoor Defense

FedLSG:用于联邦图后门防御的大语言模型增强语义校准

Chenyu Zhou, Yabin Peng, Wei Huang, Kunlin Li, Shuaishuai Zhang, Xinyuan Miao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Institute of AI for Industries(人工智能产业研究院) Chinese Academy of Sciences(中国科学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图神经网络易受后门攻击问题,提出FedLSG框架,将大语言模型集成防御,通过图与行为到文本的转换及轻量级师生架构,在不损图完整性时显著提升对后门攻击的抵抗力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00821 2026-07-23 cs.AI cs.CL cs.IR 版本更新 62%

Fidelity Before Structure: Verbatim Chunks Beat Lossy Artifact Extraction in Long-Conversation LLM Memory

逐字块胜过提取的人工制品:长LLM对话中记忆表征的控制消融研究

Tao An

机构 * Hawaii Pacific University(夏威夷太平洋大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过控制消融实验,发现逐字对话块在长对话记忆检索中比LLM提取的结构化人工制品(事实、决策等)准确率高15.9-22.0点,原因是提取过程丢失了逐字细节,而结构化记忆应作为逐字文本的补充而非替代。

Comments v4: title and abstract aligned with ARR August 2026 submission; six confound controls; 34 pages, 6 figures. Code: https://github.com/tao-hpu/cog-canvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19699 2026-07-23 cs.CY cs.AI 新提交 57%

Did Alice Do Wrong? Cross-Cultural Differences in Student Perceptions of Generative AI Use in University Computing Education

爱丽丝做错了吗?大学计算机教育中生成式人工智能使用的学生认知的跨文化差异

Brian Harrington, Irina Zlotnikova, Gayathri Nadarajan, Samuel Ekundayo

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究加拿大和韩国大学生对生成式人工智能使用认知的跨文化差异,通过基于场景的调查分析学生对其道德性和规则遵守的判断,发现文化因素影响学生道德推理,强调教育中人工智能整合需文化响应,要制定细致指南并持续跨文化研究。

Journal ref ACM Transactions on Computing Education, Volume 26, Issue 1, Article No.: 15, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交 57%

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09988 2026-07-23 cs.IR cs.AI 版本更新 57%

An LLM-powered Agentic Recommendation System for Connected TV Content Discovery

一种用于智能电视内容发现的由大语言模型驱动的智能推荐系统

Lei Shi, Di Wang, Harry Tran, Helsing Xu, Yuchen Lu, Dhara Ghodasara, Wilson Chaney, Xueting Liao, Jerry Yu, Huayu Ding, Reza Mirghaderi, David Fan, Qi Guo, Chongguang He, Warren Wang, Warren Deng, Mingze Gao, Shike Mei, Shuo Tang, Zhe Zhang, Jianming He, Abhishek Kumar, Haotian Wu, Hamed Firooz, Li Li

机构 * Meta

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对推荐系统整合上下文信号的挑战,提出用于智能电视内容发现的大语言模型驱动的智能推荐系统,利用其推理能力处理多样信号,采用智能架构协调组件,克服大语言模型用于推荐的实际限制。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20170 2026-07-23 cs.CL 版本更新 57%

KoRe: Compact Knowledge Representations for Large Language Models

KoRe: 为大型语言模型设计的紧凑知识表示

Davide Cavicchini, Fausto Giunchiglia, Jacopo Staiano

机构 * University of Trento(特伦托大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出KoRe方法,通过将知识图谱的1跳子图编码为紧凑离散知识标记,并注入到LLM中,从而提升模型的知识推理能力并减少token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20050 2026-07-23 econ.GN cs.AI cs.GT q-fin.EC 版本更新 57%

Information Aggregation with AI Agents

利用AI代理的信息聚合

Spyros Galanis

机构 * Department of Economics, University of Durham(杜伦大学经济学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过交易和观察价格波动,探讨大型语言模型能否聚合分散的私人信息,发现信息聚合在信息结构复杂时显著下降,且更智能的AI代理在聚合和盈利方面表现更好。

Comments 62 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19810 2026-07-23 cs.SD 新提交 50%

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译

Rongshen He, Xinyu Liang, Dekun Chen, Jiaqi Li, Mingjie Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他推理 :reasoning(abstract)

AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。

Comments 29 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19703 2026-07-23 cs.SE 新提交 50%

Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development

架起行为与实现的桥梁:用于行为驱动开发的自动化Java胶水代码生成

Xinyu Shi, Zhou Yang, An Ran Chen

专题命中 其他推理 :reasoning(abstract)

AI总结 研究针对行为驱动开发中胶水代码开发维护难题,提出分层多智能体框架AutoGlue,遵循行为优先工作流程。经实验评估,相比少样本提示,其在代码生成指标上有显著提升,能有效连接行为规范与项目代码,支持软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏