arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1933 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1933 篇

2608.11512 2026-08-13 cs.CY 新提交 67%

Cheap, Fallible Cognition and the Political Economy of Expertise

廉价、易出错的认知与专业知识的政治经济学

Christophe Kolb, Jim Caron

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文构建基于任务与制度的框架,引入任务脆弱性指数等,分析生成式AI对劳动力市场的影响,指出其命运是制度均衡,而非机械失业或自动充裕。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 67%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交 67%

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09376 2026-08-11 cs.DB 新提交 67%

"Will This Data Break My Task?" - Interactive Synthesis of Task-Aware Data Unit Tests

“这些数据会破坏我的任务吗?”——面向任务感知的数据单元测试的交互式综合

Hao Chen, Arnab Phani, Sebastian Schelter

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对现有数据单元测试框架忽略下游任务代码语义的问题,提出复合AI系统PrismaDV,联合分析数据与任务代码生成任务感知数据单元测试,通过交互式界面完成验证与优化。

Comments Accepted as a demo paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09055 2026-08-11 cs.GT cs.CR 新提交 67%

Repeated-Game Security for Restaking-Based Verifiable Inference

基于再质押的可验证推理的重复博弈安全性

Zhenhang Shang, Yingzhe Yu, Kani Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对基于再质押的可验证推理协议,发现其单轮罚没条件高估安全性,提出结合历史挑战、声誉加权罚没与质押归属的机制,可降低重复博弈偏差利润,减少审计率。

Comments Length: 29 pages total (15 pages main text, plus appendix and references). Figures: 5. Artifact: https://anonymous.4open.science/r/Repeated-Slashing-8031/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 67%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08751 2026-08-11 cs.DB 新提交 67%

InSituANN: Revisiting IVF for PCIe-Efficient Billion-Scale Vector Search

InSituANN:为PCIe高效的十亿级向量搜索重新审视IVF

Yuemeng Xu, Zongxi Liu, Junyu Long, Yiming Huang, Jiarui Guo, Yangyujia Wang, Jiachen Xu, Dongyuan Yu, Zongwei Lv, Tong Yang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 InSituANN是一种基于IVF的ANNS引擎,将基础向量存于主机内存、就地执行精细搜索,在单个商用GPU上实现十亿级向量搜索,大幅提升吞吐量并开源。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08425 2026-08-11 cs.NI cs.DC 新提交 67%

PSP: Low-Overhead Packet-Level Load Balancing for Stale-State and Bandwidth-Asymmetric Networks

PSP:面向 stale 状态与带宽非对称网络的低开销报文级负载均衡

Jiaqi Liu, Chunyang Zhang, Heng Pan, Yanbiao Li

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对数据中心网络微突发与高并发问题,提出概率状态比例(PSP)报文级负载均衡算法,其性能优于 JSQ、随机调度,与 Top-k 相当且硬件成本更低,实现性能、稳定性与开销的平衡。

Comments 12 pages, 10 figures, 5 tables. Accepted by IEEE LCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08340 2026-08-11 cs.DC 新提交 67%

OpRAG: A Resource-Deterministic Runtime for GPU-Backed Multi-Stage RAG Workflows

OpRAG:面向GPU支持的多阶段RAG工作流的资源确定性运行时

Arup Kumar Sarker, Mills Staylor, Aymen Alsaadi, Gregor von Laszewski, Shantenu Jha, Geoffrey Fox

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出OpRAG,一种面向GPU多阶段RAG的资源确定性分布式运行时,通过优化编排层降低非模型开销,在多模型多基准测试中显著提升RAG端到端性能。

Comments 14 pages, 6 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07971 2026-08-11 cs.DC 新提交 67%

ElastiCo: Elastic Configuration and Interference-Aware Orchestration for GPU Clusters

ElastiCo:面向GPU集群的弹性配置与感知干扰的编排

Jinghao Wang, Yihang Zhou, Xiaoyang Sun, Chunming Hu, Tianyu Wo, Xu Wang, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ElastiCo是一种基于Kubernetes的弹性共置框架,通过资源形态转换、弹性影子定价、感知干扰共置三种机制,实现训练与推理工作负载安全共享GPU,显著降低平均JCT、提升集群吞吐量与GPU利用率。

Comments 27 pages, 9 figures, 9 tables. Submitted to Performance Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05967 2026-08-07 cs.MM 新提交 67%

M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝

Taolin Zhang, Weizi shao, Zijie Zhou, Chen Chen, Daiyang Yu, Tingyuan Hu, Chengyu Wang, Xiaofeng He

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05917 2026-08-07 cs.SE 新提交 67%

Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness

跳出自修复陷阱:通过双上下文感知改进测试预言生成

Kefan Li, Hongyue Yu, Yuan Yuan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对迭代自修复引发的自修复陷阱问题,提出非迭代高效框架DCAware,结合结构化静态上下文与动态状态,在低计算成本下提升测试预言的故障检测效果

Comments Accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04630 2026-08-06 eess.SP 新提交 67%

Generalizable and Computational Efficient Channel Extrapolation for 6G: A Configurable AI-Driven Framework Built from a Modular Perspective

面向6G的可泛化且计算高效的信道外推:一种从模块化视角构建的可配置AI驱动框架

Yuan Gao, Xinyi Wu, Jiang Jun, Yi Yu, Yanliang Jin, Shunqing Zhang, Zhu Han, Shugong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对6G信道外推泛化差、复杂度高的问题,提出三阶段模块化可配置AI框架,降低了信道外推误差与复杂度,性能优于混合专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04450 2026-08-06 cs.DC 新提交 67%

CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?

CommBench:大语言模型能编写正确且高效的GPU通信代码吗?

Shuang Ma, Yuyi Li, Yihan Zhang, Hezhi Xie, Danyang Chen, Shuyang Ji, Ziming Mao, Cheng Ji, Ansha Prashanth, Wenting Yang, Yiran Wang, Chihan Cui, Pei Yu Lin, Ion Stoica, Yang Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出GPU通信编程综合基准CommBench,评估发现最强代码生成模型GPT-5.5仅在30.7%任务中实现正确高效的GPU通信代码,凸显LLMs与专家水平的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04416 2026-08-06 cs.HC 新提交 67%

Preference-Driven Online Adaptation for Personalized Interaction Initiation in Proactive AI Assistants

主动式AI助手中个性化交互发起的偏好驱动在线适应

Yufeng Wang, Wei Zhang, Zhiquan Wen, Jinwu Hu, Linhui Xiao, Tianlu Pan, Qingfang Zheng, Mingkui Tan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对主动式AI助手个性化交互时机难确定的问题,提出EOPA方法,在ProPerSim基准上较最强基线提升F1分数19.80个百分点,降低推理延迟与平均每日适应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03614 2026-08-05 eess.SP 新提交 67%

Test-Time Scalable AI-RAN: Inference Time Allocation for Cell-Free MIMO

测试时可扩展AI-RAN:无小区MIMO的推理时间分配

Seonghoon Yoo, Sangwoo Park, Seok-Hwan Park, Joonhyuk Kang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对无小区MIMO系统,提出通用框架以分配测试时可扩展AI-RAN各模块的最优推理时间资源,实验验证其可充分挖掘该系统的性能潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02608 2026-08-05 cs.DC 新提交 67%

Separating Intelligence from Inference: A Standard for Edge-Native AI Computing

将智能与推理分离:边缘原生AI计算的标准

Venkat Vinjam, Krishnaiah Narukulla

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出将AI的训练(智能)与推理分离的原则,设计了两类边缘设备及相关架构栈,可大幅降低大型语言模型推理的能源消耗与碳排放。

Comments 23 pages, preprint, Separating Intelligence from Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02336 2026-08-04 cs.CR 新提交 67%

Lost in Permissions: Exploring the Microsoft 365 App Ecosystem

在权限中迷失:探索Microsoft 365应用生态系统

Vincenzo Longo, Alberto Verna, Nikhil Jha, Marco Mellia

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文对Microsoft 365应用生态系统开展隐私安全测量,爬取8000余个应用,发现权限披露不一致、过度特权访问普遍,提出的主题感知异常检测框架可识别异常应用,为管理员提供安全见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01672 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Learning What to Remember: Test-Time Training via Context Distillation

学习该记住什么:基于上下文蒸馏的测试时训练

Zixuan Wang, Xingyu Dang, Rui-Jie Zhu, Zixin Wen, Hengyu Fu, Wenhao Chai, Jason D. Lee

机构 * Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有测试时训练未考虑保留信息未来效用的问题,提出TTCD框架及IP-TTCD变体,实验显示其在长上下文语言建模任务中性能优于多个基准方法,可助力架构持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01638 2026-08-04 cs.CV 新提交 67%

Dynamic Resolution Routing for Efficient Egocentric Grounding

面向高效自我中心 grounding 的动态分辨率路由

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01189 2026-08-04 cs.SE 新提交 67%

MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment

MADE:用于自主模型部署的信念驱动双智能体协调机制

Yicheng Liu, Bolin Zhang, Weiran Liu, Yakun Zhang, Yangqin Jiang, Zhiying Tu, Dianhui Chu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00650 2026-08-04 cs.DB 新提交 67%

TEngineDB-V: An OLAP-Native Vector Search System for Large-$k$ Workloads at Tencent

TEngineDB-V:腾讯面向大k workloads的原生OLAP向量搜索系统

Xufei Wu, Pengcheng Zhang, Yitong Song, Xiaobo Zhang, Anqi Liang, Kai Wang, Jijun Du, Yidi Xiong, Guangxu Cheng, Zhe Chen, Peng Chen, Guoliang Li, Xuanhe Zhou, Fan Wu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出TEngineDB-V,一款腾讯的原生OLAP向量搜索系统,通过全局分块解耦索引等技术解决大k向量搜索问题,实验显示其性能较竞品最高提升145倍,适配百亿级生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00458 2026-08-04 cs.MA 新提交 67%

BANDMAS: Causality-Inspired Semantic Packet Scheduling for Bandwidth-Efficient Multi-Agent Collaboration

BANDMAS:面向带宽高效多智能体协作的因果启发式语义分组调度

Jiangwen Dong, Wanyu Lin

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体协作中通信流量大、开销高的问题,提出BANDMAS框架,通过因果启发式语义分组调度减少应用层流量,在三类数据集上实现了显著的流量降低并取得最优任务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 67%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28853 2026-08-03 cs.HC 新提交 67%

Spatial Visual Analytics for Multi-Document Summary Verification

面向多文档摘要验证的空间视觉分析技术

Jiahao Xu, Wei Liu, Yang Liu, Eric Krokos, Kirsten Whitley, Xuan Wang, Rebecca Faust, Chris North

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对多文档摘要验证难题,提出SVS视觉分析系统,含两种二维布局,实验表明其可提升验证准确性、降低工作量,SUMMARY-GUIDED布局综合表现最优。

Comments Accepted to IEEE VIS 2026; 13 pages, including appendices (11-page paper plus 2-page appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 67%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 67%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 67%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26836 2026-07-30 cs.CR 新提交 67%

Before Agents Speak: Pre-hoc Failure Risk Inference in Multi-Agent Systems

智能体交流前:多智能体系统中的事前失败风险推断

Shi Lin, Chenpei Wang, Peng Qian, Dezhang Kong, Minghao Li, Yufeng Li, Xun Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本研究针对多智能体系统中幻觉级联失败的问题,提出事前风险推断框架HalluProp,通过建模内在幻觉风险与传播机制实现早期诊断,性能优于事后方法,可提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏