arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1048 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1048 篇

2504.21286 2026-07-10 cond-mat.mtrl-sci 版本更新 50%

NEP89: Universal neuroevolution potential for inorganic and organic materials across 89 elements

NEP89:89种元素的无机和有机材料通用神经进化潜力

Ting Liang, Ke Xu, Eric Lindgren, Zherui Chen, Rui Zhao, Jiahui Liu, Esmée Berger, Benrui Tang, Bohan Zhang, Yanzhou Wang, Keke Song, Penghua Ying, Nan Xu, Haikuan Dong, Shunda Chen, Paul Erhart, Zheyong Fan, Tapio Ala-Nissila, Jianbin Xu

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究针对机器学习原子间势的局限,提出神经进化势架构的NEP89模型,通过特定方法构建训练数据集。该模型精度高且计算高效,能实现大规模原子模拟,适用于多种场景并支持微调,为材料研究提供有力工具。

Comments 5 figures in the main text; Supplementary Information is available on the Nature Computational Science website

Journal ref Nature Computational Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22149 2026-07-09 quant-ph cs.AR 版本更新 50%

Low Latency GNN Accelerator for Quantum Error Correction

低延迟图神经网络加速器用于量子纠错

Alessio Cicero, Luigi Altamura, Moritz Lange, Mats Granath, Pedro Trancoso

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出基于FPGA的图神经网络解码器加速器,通过硬件优化在1微秒内实现更低的逻辑错误率,提升量子纠错精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14412 2026-07-09 cs.CV 版本更新 50%

G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening

G-ZAP:一种通用的零样本框架用于任意尺度的全色融合

Zhiqi Yang, Shan Yin, Jingze Liang, Liang-Jian Deng

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出G-ZAP框架,通过多尺度半监督训练方案实现跨分辨率、跨场景和跨传感器的泛化能力,在多个真实世界数据集上取得SOTA结果,支持权重重用以提高实际部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新 50%

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18884 2026-07-09 cs.NE 版本更新 50%

MEGO: Learning Mixture-of-Experts for General-Purpose Binary Optimization

MEGO:学习用于通用二进制优化的专家混合模型

Shengcai Liu, Zhiyuan Wang, Yew-Soon Ong, Xin Yao, Ke Tang

专题命中 效率与部署 :foundation model(abstract)

AI总结 研究针对离散优化问题,提出MEGO这一通用神经优化器,它由无需领域知识训练的专家混合模型构成,通过路由策略解决新问题。在多类问题上展现强大泛化能力,优于现有优化器,还提供了量化问题相似性及分类的新方法。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27932 2026-07-08 cs.CV 版本更新 50%

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

动态聚类数据采样用于高效且长尾感知的视觉-语言预训练

Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出动态聚类采样方法DynamiCS,通过动态调整数据分布平衡语义长尾概念,降低训练成本并提升长尾概念表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13649 2026-07-07 cs.CV 版本更新 50%

Distribution Matching Distillation Meets Reinforcement Learning

分布匹配蒸馏与强化学习的结合

Dengyang Jiang, Dongyang Liu, Zanyi Wang, Qilong Wu, Liuzhuozheng Li, Hengzhuang Li, Xin Jin, David Liu, Changsheng Lu, Zhen Li, Bo Zhang, Mengmeng Wang, Steven Hoi, Peng Gao, Harry Yang

机构 * HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) SIAT, CAS(中国科学院深圳先进技术研究院) Shanghai AI Lab(上海人工智能实验室) ZJUT(浙江工业大学) CUHK(香港中文大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出DMDR框架,结合奖励倾斜分布匹配与动态蒸馏策略,通过联合优化提升生成质量与可控性,优于多步生成模型。

Comments [ECCV 26] The synergy of reinforcement learning and distribution matching distillation. See more: https://github.com/vvvvvjdy/dmdr

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23033 2026-07-07 cs.CV cs.NE 版本更新 50%

Adaptive Time-step Training for Enhancing Spike-Based Neural Radiance Fields

用于增强基于脉冲的神经辐射场的自适应时间步长训练

Ranxi Lin, Canming Yao, Jiayi Li, Weihang Liu, Xin Lou, Pingqiang Zhou

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院)

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究针对基于脉冲的神经辐射场模型固定推理时间步长效率低的问题,提出PATA框架,通过参数化目标推理时间步长并两阶段训练,结合多种策略降低推理成本并保持渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08766 2026-07-03 cs.CR 版本更新 50%

Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction

跟随我的眼睛:基于VLM的扫视路径预测的后门攻击

Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

专题命中 效率与部署 :post-training(abstract)

AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22032 2026-07-03 cs.CV 版本更新 50%

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

Drive-JEPA:视频JEPA结合多模态轨迹蒸馏实现端到端驾驶

Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng Lu

机构 * Virginia Tech(弗吉尼亚理工学院) Purdue University(普渡大学) XPENG Motors(小鹏汽车) Nanjing University(南京大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出Drive-JEPA框架,结合视频联合嵌入预测架构(V-JEPA)与多模态轨迹蒸馏,通过自监督视频预训练和动量感知选择机制提升端到端驾驶的规划性能,在NAVSIM上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27757 2026-07-02 cs.CV cs.RO 版本更新 50%

E-TIDE: Fast, Structure-Preserving Motion Forecasting from Event Sequences

E-TIDE:从事件序列中快速、结构保持的运动预测

Biswadeep Sen, Benoit R. Cottereau, Nicolas Cuperlier, Terence Sim

机构 * National University of Singapore(新加坡国立大学) IPAL CNRS IRL 2955 CerCo, CNRS UMR 5549, Université de Toulouse(CerCo, CNRS UMR 5549, 图卢兹大学) ETIS UMR8051, CY Cergy Paris Université, ENSEA, CNRS(ETIS UMR8051, CY塞尔吉巴黎大学, ENSEA, 法国国家科学研究中心)

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出E-TIDE,一种轻量级端到端架构,用于高效预测事件张量,通过高效时空交互设计捕捉时间依赖性,实现低计算复杂度下的高性能运动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16249 2026-07-02 cs.CV 版本更新 50%

AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware

AFFMAE: 在桌面硬件上实现高分辨率显微图像分割的可扩展视觉预训练

David Smerkous, Zian Wang, Behzad Najafian

机构 * Department of Laboratory Medicine & Pathology, University of Washington(华盛顿大学检验医学与病理学系) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) Electrical Engineering & Computer Science, Oregon State University(俄勒冈州立大学电气工程与计算机科学系)

专题命中 效率与部署 :pretraining(abstract)

AI总结 提出AFFMAE框架,通过自适应离网格令牌合并实现分层预训练,在桌面硬件上以2倍预训练速度和减半内存达到与MAE相当的显微分割性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15702 2026-07-02 cs.CV 版本更新 50%

End-to-End Training for Autoregressive Video Diffusion via Self-Resampling

通过自重采样实现自回归视频扩散的端到端训练

Yuwei Guo, Ceyuan Yang, Hao He, Yang Zhao, Meng Wei, Zhenheng Yang, Weilin Huang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance Seed(字节跳动Seed) ByteDance(字节跳动)

专题命中 效率与部署 :post-training(abstract)

AI总结 提出自回归视频扩散模型的端到端训练框架Resampling Forcing,通过自重采样模拟推理错误,结合稀疏因果掩码和动态历史路由,实现长视频生成的时间一致性。

Comments Project Page: https://guoyww.github.io/projects/resampling-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24607 2026-07-01 physics.ins-det hep-ex 版本更新 50%

Physics at the Edge: Benchmarking Quantisation Techniques and the Edge TPU for Neutrino Interaction Recognition

边缘物理:用于中微子相互作用识别的量化技术与Edge TPU基准测试

Stefano Vergani, Hilary Utaegbulam, Michael Wang, Leigh H. Whitehead, Arden Tsang, Lorenzo Uboldi

专题命中 效率与部署 :post-training(abstract)

AI总结 本文对卷积神经网络应用于中微子相互作用识别的不同量化技术进行了全面基准测试,在Edge TPU上部署模型,发现Inception V3精度几乎无损失,边缘TPU能效比CPU和GPU低数个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19964 2026-06-25 cs.CV 版本更新 50%

2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction

2K Retrofit: 熵引导的高效稀疏细化用于高分辨率3D几何预测

Tianbao Zhang, Zhenyu Liang, Zhenbo Song, Nana Wang, Xiaomei Zhang, Xudong Cai, Zheng Zhu, Kejian Wu, Gang Wang, Zhaoxin Fan

机构 * BUAA(北京航空航天大学) SJTU(上海交通大学) GigaAI XREAL NUST(南京理工大学) RUC(清华大学) NUDT(国防科技大学) UCAS(中国科学技术大学) BIBMS(北京工业大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出2K Retrofit框架,通过快速粗预测和基于熵的稀疏细化,在不修改基础模型的情况下实现高效2K分辨率几何预测,达到SOTA精度和速度。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19257 2026-06-24 cs.RO 版本更新 50%

PRISM-SLAM: Probabilistic Ray-Grounded Inference for Scale-aware Metric SLAM

PRISM-SLAM: 面向尺度感知度量SLAM的概率射线基础推理

Eunsoo Im, Gyeonggwan Lee, Seunghwan Hong, Junghun Suh

机构 * KakaoMobility, South Korea(韩国 KakaoMobility)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出PRISM-SLAM框架,通过将视觉基础模型先验集成到贝叶斯因子图中,利用Plücker射线距离因子和动态场景不确定性门控机制,实现无尺度漂移的实时单目度量SLAM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11121 2026-06-24 cs.CV eess.IV 版本更新 50%

Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior

生成式流形蒸馏:将恢复轨迹与自然图像先验对齐

Yuyang Hu, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio

机构 * Google(谷歌) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出生成式流形蒸馏(GMD),通过几何流形对齐实现无配对域自适应,利用冻结文本到图像基础模型的流匹配动力学将离流形恢复投影到自然图像流形,并引入质量门控滤波器和源锚定轨迹正则化,无需架构修改或推理延迟即可提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10416 2026-06-19 cs.RO 版本更新 50%

TASC: Task-Aware Shared Control for Relational Telemanipulation

TASC:面向关系遥操作的任务感知共享控制

Ze Fu, Pinhao Song, Yutong Hu, Renaud Detry

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(KU莱顿机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(KU莱顿电气工程系,语音与图像处理研究单位)

专题命中 效率与部署 :language model(abstract)

AI总结 提出TASC框架,通过视觉构建开放词汇交互图推断任务级用户意图,并基于空间约束提供共享控制辅助,提升关系遥操作效率与泛化能力。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20302 2026-06-18 cs.CV 版本更新 50%

CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation

CrossEarth-Gate:基于Fisher引导的自适应调优引擎用于高效跨域遥感语义分割

Shilei Cao, Ziyang Gong, Hehai Lin, Yang Liu, Jiashun Cheng, Xiaoxing Hu, Haoyuan Liang, Guowen Li, Chengwei Qin, Hong Cheng, Xue Yang, Juepeng Zheng, Haohuan Fu

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出CrossEarth-Gate,通过Fisher信息引导的自适应模块选择机制,动态激活最关键的跨域模块,在18个跨域基准中16个达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09373 2026-06-17 cs.CV 版本更新 50%

FUSER: Feed-Forward MUltiview 3D Registration Transformer and SE(3)$^N$ Diffusion Refinement

FUSER: 前馈多视图3D配准Transformer与SE(3)^N扩散精化

Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出FUSER,首个前馈多视图配准Transformer,在统一潜在空间中直接预测全局位姿,避免成对匹配;并引入SE(3)^N扩散精化框架FUSER-DF以校正估计。

Comments Accepted to CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07879 2026-06-16 cs.SD eess.AS 版本更新 50%

LISTEN: Lightweight Industrial Sound-representable Transformer for Edge Notification

LISTEN:面向边缘通知的轻量级工业声音可表示Transformer

Changheon Han, Yun Seok Kang, Yuseop Sim, Hyung Wook Park, Martin Byung-Guk Jun

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) Department of Mechanical Engineering, UNIST(UNIST机械工程系)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出轻量级工业声音基础模型LISTEN,通过知识蒸馏从大模型IMPACT压缩,仅用少量数据微调即可在边缘设备上实现实时机器监控,性能接近大模型。

Journal ref Advanced Engineering Informatics, Volume 76, Part A, 2026, 104944

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21632 2026-06-15 cs.ET 版本更新 50%

Position: Sustainable Open-Source AI Requires Tracking the Cumulative Footprint of Derivatives

立场:可持续的开源AI需要追踪衍生物的累积足迹

Shaina Raza, Iuliia Zarubiieva, Ahmed Y. Radwan, Nathaniel Lesperance, Deval Pandya, Sedef Akinli Kocak, Graham W. Taylor

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文主张开源AI的可持续性不能仅依赖计算效率,而需通过数据与影响核算(DIA)框架追踪模型衍生物链的累积环境足迹,实现生态级问责。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13289 2026-06-15 eess.SP 版本更新 50%

Semantic Communication for the Internet of Underwater Things: Architectures, Applications, Challenges, and Future Directions

水下物联网的语义通信:架构、应用、挑战与未来方向

Ruhul Amin Khalil, Asiya Jehangir, Hanane Lamaazi, Saddaf Rubab, Nasir Saeed

专题命中 效率与部署 :language model(abstract)

AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。

Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13631 2026-06-11 stat.CO 版本更新 50%

ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections

ProjGuard:通过低维投影实现计算机使用代理的安全监控

Kebin Contreras, Carlos Hinojosa, Jorge Bacca, Bernard Ghanem

专题命中 效率与部署 :language model(abstract)

AI总结 ProjGuard通过行为轨迹监控实现计算机使用代理的安全防护,利用轻量级风险信号提前预警潜在危险,结合辅助视觉语言模型进行针对性修正,提升任务完成率并降低安全风险。

Comments The manuscript was submitted under an inappropriate category. In addition, substantial updates and improvements are currently being made to the document. To avoid confusion and ensure that readers access the most accurate version of the work, we request withdrawal of the current manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21413 2026-06-11 cs.DB 版本更新 50%

RUBICON: Agentic AI for Messy Enterprise Data

RUBICON: 面向混乱企业数据的代理型人工智能

Fabian Wenz, Felix Treutwein, Kai Arenja, Çagatay Demiralp, Michael Stonebraker

专题命中 效率与部署 :LLM(abstract)

AI总结 针对企业数据异构、访问受限的特点,提出RUBICON系统,采用结构化查询接口和以表为中心的集成层,替代纯文本大语言模型管线,在基准测试中实现100%端到端准确率,并显著降低延迟和成本。

Comments 4 pages, 1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19210 2026-06-10 cs.CV 版本更新 50%

Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP

对比谱校正:面向CLIP零样本对抗鲁棒性的测试时防御

Sen Nie, Jie Zhang, Zhuo Wang, Shiguang Shan, Xilin Chen

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出对比谱校正(CSR)方法,利用对抗样本在频率衰减下的特征不一致性,通过谱引导对比目标优化校正扰动,在16个分类基准上平均提升18.1%的强攻击鲁棒性,且推理开销低。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00967 2026-06-09 cs.CV 版本更新 50%

MedSyn2: Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

通过文本和语义定义的分割提示灵活控制3D CT生成

Weicheng Dai, Chenyu Wang, Binxu Li, Shantanu Ghosh, Afrooz Zandifar, Christina LeBedis, Kayhan Batmanghelich

机构 * Boston University School of Engineering(波士顿大学工程学院) Stanford University(斯坦福大学) University of Pittsburgh Medical Center(匹兹堡大学医学中心) Boston University School of Medicine(波士顿大学医学院)

专题命中 效率与部署 :prompting(abstract)

AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24890 2026-06-09 cs.CV 版本更新 50%

QuoVLA: Quotient Space for Vision-Language-Action Models

QuoVLA:视觉-语言-动作模型的商空间

Xuan Wang, Yinan Wu, Haoran Duan, Jungong Han

机构 * Department of Automation(自动化系)

专题命中 效率与部署 :language model(abstract)

AI总结 针对VLA模型预训练VLM潜在表示动作信息不足的观点,提出商空间框架QuoVLA,通过量化模块和双分支设计压缩潜在表示为动作充分表示,在多个基准上提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏