arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 486 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 486 篇

2606.09148 2026-06-09 cs.CL 新提交 57%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08486 2026-06-09 cs.CL 新提交 57%

TRADE: Transducer-Augmented Decoder for Speech LLM

TRADE: 换能器增强的语音大语言模型解码器

Yun Tang, Shanil Puri, Shinji Watanabe, Subhabrata Mukherjee

机构 * Hippocratic AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出TRADE模型,通过换能器分支增强多模态大语言模型,实现帧同步对齐与语言推理结合,支持流式和非流式解码,在多个基准上取得低词错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08432 2026-06-09 cs.AI 新提交 57%

Trajectory-Refined Distillation

轨迹精炼蒸馏

Li Jiang, Haoran Xu, Yichuan Ding, Amy Zhang

机构 * McGill University(麦吉尔大学) Mila Quebec AI Institute(米拉魁北克人工智能研究所) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出轨迹精炼蒸馏(TRD),通过教师指导修正学生轨迹中的前缀错误,解决在线策略蒸馏中的前缀失败问题,提升大语言模型的单次准确率和推理覆盖。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08367 2026-06-09 cs.MA cs.AI 新提交 57%

Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy

Emergence World: 一个用于评估长时域多智能体自主性的平台

Deepak Akkil, Ravi Kokku, Karthik Vikram, Tamer Abuelsaad, Aditya Vempaty, Satya Nitta

机构 * Emergence AI

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一个持续运行的多智能体模拟平台,通过集成实时外部数据、120+工具和持久记忆系统,评估LLM代理在长时域(数周至数月)中的行为漂移、治理和跨模型影响等动态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07790 2026-06-09 cs.LG 新提交 57%

Byzantine Cheap Talk: Adversarial Resilience and Topology Effects in LLM Coordination Games

拜占庭廉价谈话:LLM协调博弈中的对抗韧性与拓扑效应

Aya El Mir, Martin Takáč, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究多智能体LLM在协调博弈中面对拜占庭攻击和通信拓扑限制的脆弱性,发现智能体无法集体适应背叛,且显式限制拓扑会破坏合作,而隐式限制则不影响。

Comments Accepted at NETYS 2026 (The International Conference on Networked Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07712 2026-06-09 cond-mat.mtrl-sci cs.AI 新提交 57%

MatMind: A Structure-Activity Knowledge-Driven Generative Foundation Model for Materials Science

MatMind:面向材料科学的结构-活性知识驱动生成基础模型

Zhan'ao Yao, Boxuan Zhang, Jingyuan Shu, Xiaoyu Wu, Rongyan Wang, Linjing Li, Dajun Zeng, Yudong Yao, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu

机构 * State Key Laboratory of High Performance Ceramics(高性能陶瓷国家重点实验室) Shanghai Institute of Ceramics, Chinese Academy of Sciences(中国科学院上海陶瓷研究所) Center of Materials Science and Optoelectronics Engineering, University of Chinese Academy of Sciences(中国科学院大学材料科学与光电子工程中心) School of Chemistry and Materials Science, Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所化学与材料科学学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) College of Medicine and Biological Information Engineering, Northeastern University(东北大学医学与生物信息工程学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出MatMind,一种基于大语言模型的晶体材料生成基础模型,通过结构-活性知识注入、双头架构和物理信息强化学习,在性质预测、无条件生成和条件生成任务上超越专用模型。

Comments 29 pages, 5 figures, including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07441 2026-06-08 cs.CL 新提交 57%

Sycophantic Praise: Evaluating Excessive Praise in Language Models

谄媚式赞美:评估语言模型中的过度赞美

Daniel Vennemeyer, Phan Anh Duong, Meryl Ye, Ruihong Huang, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学) Texas A&M University(德克萨斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出参数化框架衡量赞美是否过度,发现谄媚式赞美在社交和解释性领域远多于客观推理领域,且现有方法无法可靠测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06991 2026-06-08 cs.CV cs.AI 新提交 57%

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

不要暂停:面向在线视频理解的流式视频-语言同步

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出流式视频-语言同步(SVLS)范式,通过帧驱动转换控制器和流式令牌调节器实现视频帧与语言生成的细粒度同步,在不中断感知的情况下进行实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06865 2026-06-08 cs.CL 新提交 57%

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

大型语言模型是否适合图计算?进展与展望

Yuting Zhang, Yi Han, Kai Wang, Wei Ni, Angela Bonifati, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Edith Cowan University(埃迪斯科文大学) Lyon 1 University(里昂第一大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文通过角色分类法综述LLM在图计算中的应用,分析作为执行者和规划者的两种范式,指出LLM适用于简单小规模任务,但在大规模和精确性要求高的任务中不可靠,并总结数据集和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12970 2026-08-14 cs.SE 新提交 50%

Requirements-Augmented Generation for Trustworthy Acceptance Testing of LLM-Based Software

面向基于大语言模型的软件的可信验收测试的需求增强生成技术

Fanyu Wang, Chetan Arora, Zhenping Xie, Yonghui Liu, Kla Tantithamthavorn, Aldeida Aleti, Siwei Jiang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对基于大语言模型的软件的验收测试缺口,提出需求增强生成技术与置信度校准级联判定方法,经工业案例验证可提升预言机质量、准确率与成本效率,具备工业可行性。

Comments Accepted at ASE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10758 2026-08-12 cs.CV 新提交 50%

Where To Look? : Causal Tracing of Vision Encoders in VLM

看向何处?:视觉语言模型中视觉编码器的因果追踪

Naren Kumar S, Tirth Bhatt, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。

Comments 10 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-12 cs.CV cs.SC 新提交 50%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 50%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08340 2026-08-11 cs.DC 新提交 50%

OpRAG: A Resource-Deterministic Runtime for GPU-Backed Multi-Stage RAG Workflows

OpRAG:面向GPU支持的多阶段RAG工作流的资源确定性运行时

Arup Kumar Sarker, Mills Staylor, Aymen Alsaadi, Gregor von Laszewski, Shantenu Jha, Geoffrey Fox

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出OpRAG,一种面向GPU多阶段RAG的资源确定性分布式运行时,通过优化编排层降低非模型开销,在多模型多基准测试中显著提升RAG端到端性能。

Comments 14 pages, 6 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08097 2026-08-11 cs.DC 新提交 50%

OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetching

OasisKV:通过前瞻稀疏预取将解码中KV缓存扩展至HBM之外

Can Xiao, Sukmin Cho, Junbong We, Zhixiong Niu, Jianyi Cheng, Yiren Zhao, Youngjin Kwon, Yongqiang Xiong, Rui Ma, Junyi Liu

专题命中 其他推理 :reasoning(abstract)

AI总结 针对LLM推理中HBM容量受限问题,提出以内存为中心的OasisKV系统,通过前瞻稀疏预取技术解耦KV缓存存储与HBM,在精度损失极小的情况下显著提升推理吞吐量并降低内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07482 2026-08-11 cs.HC 新提交 50%

From Human-Centered Design to Human-AI Collaboration: Why the Future of HCI Still Starts With People

从以用户为中心的设计到人机协作:人机交互的未来为何仍以人作为起点

Issam Alzouby

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出GenAI应作为人类协同思考伙伴而非HCD方法替代品,指出HCI未来需聚焦保留人类能动性、批判性思维与责任的人机协作。

Comments 4 pages, 1 figure. Accepted to the CHIWORK 2026 Workshop: Interrogating GenAI Augmentation for CHIworkers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04843 2026-08-06 cs.IR 新提交 50%

MemoryCPT: An End-to-End Agent Memory Framework for Cost-Performance Trade-off

MemoryCPT:用于成本-性能权衡的端到端智能体记忆框架

Songxin Lei, Kun Ouyang, Weilin Ruan, Yuqian Wu, Zhijiang Guo, Yushi Sun, Fugee Tsung

专题命中 其他推理 :reasoning(abstract)

AI总结 MemoryCPT是一种端到端可训练的智能体记忆框架,通过QAD和QAR阶段优化记忆处理,在LoCoMo和LongMemEval数据集上实现了更优的成本-性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04626 2026-08-06 cs.CR 新提交 50%

Blockchain Empowered Trustworthy Agent Networks: Foundations, Taxonomy, and Future Directions

区块链赋能的可信智能体网络:基础、分类与未来方向

Liehuang Zhu, Yuhang Li, Tianxing Wang, Zhihao Chen, Ke Li, Hongyi Liu, Yajie Wang, Lei Xu, Peng Jiang, Zijian Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文综述从经典多智能体系统到开放智能体网络的演化,构建五维信任分类,明确区块链作为共享信任层为可信智能体网络提供多类支撑机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 50%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04020 2026-08-06 cs.CY cs.GT 新提交 50%

Artificial Institutions: How Institutional Design Shapes LLM Simulations

人工制度:制度设计如何塑造大语言模型(LLM)模拟

Maxim Chupilkin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文研究LLM智能体构建的人工社会,通过控制变量实验发现,五种市场制度的规则差异会显著改变市场结果,证明制度架构对人工社会模拟的重要影响。

Comments 19 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03232 2026-08-05 cs.CR 新提交 50%

MalTotal: Cost-Effective and Language-Agnostic Malicious Code Poisoning Detection for Millions of Repositories

MalTotal:面向数百万代码仓库的高性价比、语言无关型恶意代码投毒检测方法

Jian Zhao, Shenao Wang, Qingyang Wu, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出MalTotal框架,可跨5种主流语言检测恶意代码,F1值达93.1%,成本大幅降低,在12万个GitHub仓库中发现564个未知恶意仓库,适用于大规模多语言场景。

Comments Accepted by ISSTA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03016 2026-08-05 cs.CV 新提交 50%

Clinically-Grounded Hierarchical Classification for Consistent Chest X-ray Interpretation

基于临床依据的分层分类用于一致性胸部X射线影像解读

Jong Hak Moon, Minjun Kim, Minjun Kim

机构 * Yeji X(艺智X)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究针对胸部X射线解读的层级特性,提出CHASE框架,通过三级分类与多层级优化,提升了预测的一致性与性能。

Comments MICCAI 2026 Accepted. First & Corresponding author: Jong Hak Moon (jh.moon@yejix.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02791 2026-08-05 cs.CV 新提交 50%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01747 2026-08-04 eess.SP 新提交 50%

Ten Years of Deep Learning for Wireless Communications: From Learned Blocks to Deployable Wireless Intelligence

十年深度学习在无线通信中的应用:从学习模块到可部署的无线智能

Hao Ye, Geoffrey Ye Li, Biing-Hwang Juang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文梳理了十年间深度学习在无线通信领域从替代孤立模块到开发无线智能的三次转变,指出未来无线AI发展需结合物理基础、智能体能力与标准化机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01964 2026-08-04 cs.CV 新提交 50%

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

LongHorizon-Harness:推进面向真实世界任务的长时程智能体

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出LongHorizon-Harness框架,通过MEA循环等设计解决长时程智能体的状态追踪与错误传播问题,在多个基准测试中显著提升了Qwen、Claude等模型的表现。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01906 2026-08-04 cs.CV 新提交 50%

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery

结合先进深度学习技术的优势,从无人机影像中评估灾后建筑物损毁情况

Huy Quang Ung, Guillaume Habault, Roberto Legaspi, Hao Niu, Lian Cao, Masato Taya

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出将CV模型与LVLM结合的混合框架,在RescueNet、FloodNet基准上评估,可准确统计灾后建筑物损毁情况,性能优于单独基准模型且仅需少量标注数据,相关资源公开。

Comments Accepted at ECMLPKDD 2026, 31 pages (including appendix), 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01785 2026-08-04 cs.DC 新提交 50%

HorizonServe: Coordinating Request Scheduling with GPU Sharing for Omni-Model Serving

HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统

Yuning Zhang, Dong Yuan

专题命中 其他推理 :reasoning(abstract)

AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01639 2026-08-04 cs.CR cs.OS 新提交 50%

Mutate to Bypass: Autonomous Endpoint Evasion via Knowledge-Driven Multi-Agent Orchestration

变异规避:基于知识驱动多智能体编排的自主端点规避

Weifeng Yuan, Wenbo Guo, Qingyun Du, Jun Chen, Feng Dong, Haoyu Wang, Yang Liu

专题命中 其他推理 :reasoning(abstract)

AI总结 研究针对商用EDR系统的自动化弹性评估难题,提出AutoBypass多智能体框架,经实验可高比例绕过多款商用EDR,还能提升开源模型的规避成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01526 2026-08-04 cs.NI 新提交 50%

An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age

面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界

Siddhant Ray, Nick Feamster, Junchen Jiang

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27923 2026-07-31 cs.SE 新提交 50%

The Case for Vibe Modeling: A Missing Step in AI-Based Trustworthy Software Development

氛围建模的必要性:基于AI的可信软件开发中缺失的一环

Shalini Chakraborty, Michael Mittermaier, Judith Michael

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏