arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 116 篇

2604.10496 2026-08-18 cs.LG 版本更新 77%

CodeQuant: Unified Clustering and Quantization for Enhanced Outlier Smoothing in Low-Precision Mixture-of-Experts

CodeQuant: 一种统一的聚类和量化方法以提升低精度混合专家模型中的异常值平滑

Xiangyang Yin, Xingyu Liu, Tianhua Xia, Bo Bao, Vithursan Thangarasa, Valavan Manohararajah, Eric Sather, Sai Qian Zhang

机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学库朗数学科学研究所) Tandon School of Engineering, New York University(纽约大学坦登工程学院) Cerebras Systems Inc.(Cerebras系统公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出CodeQuant,通过可学习旋转平滑激活异常值并吸收权重异常值到细调的聚类中心,提升低精度混合专家模型的准确性与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09105 2026-08-18 cs.AI 版本更新 77%

SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling

SMA:谁说的?半黑盒RAG控制中的成员泄露审计

Shixuan Sun, Siyuan Liang, Jianjie Huang, Jingzhi Li, Xiaochun Cao

机构 * Sun Yat-Sen University(孙中山大学) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Science(中国科学院大学) Zhongguancun Academy(中关村学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15913 2026-08-18 cs.CR 新提交 75%

Conjunctive Poisoning in AI Supply-Chain Applications

AI供应链应用中的联合中毒攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本研究提出AI供应链中的联合中毒攻击,通过包装器与元数据的交互改变模型行为,提出TIF-BAH防御,揭示AI部署中存在未被现有防御覆盖的部署时行为风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16514 2026-08-18 cs.CV cs.AI cs.CL cs.HC cs.MM 新提交 73%

Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans

匹配结果,不同注视:中央凹多模态大语言模型(MLLM)的搜索方式与人类的对比

Mohamed Amine Kerkouri, Marouane Tliba, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * F-initiatives(F计划) Université Sorbonne Paris Nord(巴黎北索邦大学) Northwestern University(西北大学) IULM university(IULM大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究对比三款通用MLLM与人类在目标导向视觉搜索中的表现,发现模型在决策和目标获取上优于人类,但注视过程与人类不同,现有指标无法验证类人视觉,零样本模型不适用于过程层面问题。

Comments Paper accepted at 3rd HCV workshop at ECCV 2026. 12 pages main text, 16 pages supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14614 2026-08-18 cs.LG cs.AI cs.AR 新提交 73%

DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

DumpsterCluster:从“废品回收”到在60美元级GPU上部署LLaMA-70B

Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Quettaflop AI

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文搭建了二手GPU组成的DumpsterCluster,可在60美元级GPU上支撑LLaMA-70B推理,经济优势显著,但需结合低价电力与清洁能源以保障可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12276 2026-08-18 cs.AI cs.CL 版本更新 73%

Agentic Test-Time Scaling for WebAgents

代理测试时缩放 for WebAgents

Nicholas Lee, Lutfi Eren Erdogan, Chris Joseph John, Surya Krishnapillai, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 CATTS 通过动态分配计算资源提升代理在 WebArena-Lite 和 GoBrowse 的性能,比 React 提高 9.1%,且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15962 2026-08-18 cs.CL cs.CV 新提交 72%

SEER: Long-Context Reasoning via Selective Visual-Text Compression

SEER:基于选择性视觉-文本压缩的长上下文推理

Jiawei Xu, Zhilin Zhai, Jinrui Fang, Ruohan Xu, Mingfei Lu, Yi Zhang, Guanchu Wang, Tianlong Chen, Ying Ding

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Cambridge(剑桥大学) University of Technology Sydney(悉尼科技大学) The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :language model(abstract,comments);large language model(abstract);分类 cs.CL

AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。

Comments COLM 2026, Third Conference on Language Modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15075 2026-08-18 cs.CV 新提交 71%

SA-GEM: Scale-Adaptive and Geospatial Evidence-Modulated Token Pruning for Efficient Remote Sensing Large Vision-Language Models

SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝

Kexin Ma, Jing Xiao, Bowen Xing, Liang Liao, Chia-Wen Lin

专题命中 效率与部署 :language model(title)

AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16763 2026-08-18 cs.AI 新提交 70%

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架

Ruoqi Shu, Xuhui Wang, Isaac Wang, Yanming Mai, Bo Wan

机构 * BMO Financial Group(蒙特利尔银行金融集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。

Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15857 2026-08-18 cs.AI 新提交 70%

RAGas: Retrieval-Augmented Gas Optimization for Smart Contracts with Continuous Knowledge Integration

RAGas:结合持续知识整合的智能合约检索增强型 Gas 优化

Yishun Wang, Wenjin Yi, Wenkai Li, Zongwei Li, Xiaoqi Li

机构 * School of Cyberspace Security, Hainan University(海南大学网络空间安全学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对智能合约 Gas 优化的需求,研究人员提出 RAGas 三阶段检索增强型生成框架,分析导致 Gas 过度使用的反模式,实验显示其可降低多达 11% 的 Gas 使用量,且检测精度和召回率较高。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15018 2026-08-18 cs.AI 新提交 70%

S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices

S2-MoE:在边缘设备上实现混合专家模型的高效自推测解码

Haochen Huang, Shengxuan Qiu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S2-MoE是面向边缘设备MoE推理的高效自推测解码框架,通过路由感知自适应扩展、复用感知门控等设计,使MoE推理在边缘设备上最高获5.3倍加速,平均约2.0倍。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 70%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14586 2026-08-18 cs.DC cs.AI 新提交 70%

Efficient Block-Layer Parallel Inference for Vision-Language-Action on Hybrid Architectures

面向混合架构的视觉-语言-动作(VLA)高效块级并行推理

Haibo HU, Lianming Huang, Qiao Li, Nan Guan, Chun Jason Xue

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对VLA模型部署于车载平台的延迟与内存压力问题,提出混合CPU-GPU推理框架,通过块级划分实现资源调度,在Bench2Drive数据集及实车部署中均取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12385 2026-08-18 cs.AI 版本更新 70%

Decode-Branch Transformers: Decoupling the Primary Prefill Path from Additional Decode Computation

双流式Transformer:将主预填路径与额外解码计算解耦

Liming Liu, Mingze Wang, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出双流式Transformer,将主预填路径与额外解码计算解耦,通过共享权重与缓存降低推理成本,在多架构与数据配置下实现更低验证损失,且可灵活分配MoE专家预算。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01926 2026-08-18 cs.CL 版本更新 70%

Mitigating Bias in Locally Constrained Decoding via Tractable Proposals

通过可处理提议缓解局部约束解码中的偏差

Meihua Dang, Linxin Song, Honghua Zhang, Jieyu Zhao, Guy Van den Broeck, Stefano Ermon

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对局部约束解码中因短视掩码导致的采样偏差,提出基于张量化有限自动机的全局约束解码提议和概率全局约束解码提议,结合序贯蒙特卡洛方法实现无偏采样,在函数调用、关键词生成和SQL生成任务中显著减少所需粒子数并加速收敛。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03897 2026-08-18 cs.LG stat.ME stat.ML 版本更新 70%

Leveraging Generative Artificial Intelligence for Causal Inference with Unstructured Data

生成式人工智能驱动的推断

Kosuke Imai, Kentaro Nakamura

机构 * Harvard University(哈佛大学) John F. Kennedy School of Government(约翰·F·肯尼迪政府学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究人员提出GPI统计框架,利用开源GenAI模型提取非结构化数据的低维表示,无需微调生成模型,通过三个应用验证其可用于因果与预测推断,开源软件包可实现该框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 67%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与部署 :SFT(abstract,abstract_cn)

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14835 2026-08-18 cs.CV 新提交 67%

OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

OvDSGG:端到端开放词汇动态场景图生成

John Helsby, Yi Yang, Bodo Rosenhahn, Michael Ying Yang

机构 * Meta University of Bath(巴斯大学) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 OvDSGG是首个开放词汇DSGG的端到端框架,通过空间主干、时间主干及相关模块实现开放词汇识别,在开放词汇指标上显著优于基线,封闭集性能仍具竞争力,且构建了对应基准并公开代码。

Comments ECCVW'26 CONTEXTUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14828 2026-08-18 cs.AI cs.CL cs.LG 新提交 67%

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

MINT:用于平衡多目标对齐的最小选择偏好蒸馏

Tony Tu, Sayan Chakraborty, Ruomeng Xu, Tony Qin, Austin Tian

机构 * Georgia Institute of Technology(佐治亚理工学院) Zillow Group(齐洛集团)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对多目标对齐的不平衡问题,提出MINT方法,通过按最弱目标排名候选替代加权和排名,在情感支持等任务中显著提升双目标表现并降低不平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15999 2026-08-18 econ.GN cs.CY q-fin.EC 版本更新 67%

U.S. Technological Containment and the Rise of China's Open AI Ecosystem

美国政策无意中加速了中国开放AI生态系统

Wang Jin, Nadav Kunievsky, Bowen Lou, Tianshu Sun, James Evans

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究发现,美国旨在遏制中国AI发展的出口管制等政策,反而促使中国转向开放AI生态系统,通过开源模型和社区建设加速创新,对全球AI领导地位产生意外影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26469 2026-08-18 cs.SE 版本更新 67%

An Empirical Study of Speculative Decoding on Software Engineering Tasks

对软件工程任务中投机解码的实证研究

Yijia Li, Junkai Chen, Xing Hu, Xin Xia

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16240 2026-08-18 cs.DS cs.CC 版本更新 67%

Submodular Maximization under Supermodular Constraint: Greedy Guarantees

在超模约束下进行子模最大化:贪心保证

Ajitesh Srivastava, Shanghua Teng

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 在超模约束下,通过贪心算法和二分查找实现子模函数最大化,提供双标准近似方法,优于其他贪心启发法。

Comments 12 pages, 6 figures. Fixed typos. Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26) Fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-18 cs.CL cs.LG 新提交 62%

RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14728 2026-08-18 cs.LG cs.AI 新提交 62%

Tail-Aware Top-$k$ On-Policy Distillation

感知长尾的Top-k在线策略蒸馏

Huipeng Huang, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有Top-k在线策略蒸馏丢弃长尾概率信号的问题,提出TA-OPD方法,通过引入携带长尾概率的长尾词优化,在常见基准上使Avg@8最高提升8.05个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-18 cs.LG cs.AI cs.ET 版本更新 62%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21933 2026-08-18 cs.CV cs.AI cs.LG 版本更新 62%

Camera-Agnostic Pruning of 3D Gaussian Splats via Descriptor-Based Beta Evidence

基于描述符的Beta证据的3D高斯点集剪枝

Peter Fasogbon, Ugurcan Budak, Patrice Rondao Alface, Hamed Rezazadegan Tavakoli

机构 * Nokia Technologies(诺基亚技术)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需相机参数的3D高斯点集剪枝方法,通过属性衍生的邻域描述符进行一阶剪枝,引入混合描述符框架并建立Beta证据模型以评估点集可靠性。

Comments 16 pages, 3 figures, 3 tables. Accepted for publication in the Proceedings of the British Machine Vision Conference (BMVC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16873 2026-08-18 cs.LG 新提交 57%

An Analytical-Prior Framework for Data-Efficient Prediction of Sound-Reduction Frequencies in Rectangular Side-Branch Helmholtz Resonators

用于矩形侧支亥姆霍兹消声器降噪频率数据高效预测的分析先验框架

Jiaming Li

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本研究提出分析先验学习框架,复用低成本分析模型提升有限高保真模拟数据下的预测效率,在矩形侧支亥姆霍兹消声器降噪频率预测中,其性能优于直接学习方法,可满足不同部署需求。

Comments 13 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15972 2026-08-18 cs.CV cs.AI 新提交 57%

CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications

CM-MAE:面向视觉-无线应用的物理引导跨模态自监督学习框架

Yubo Zhang, Yiyao Liu

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出CM-MAE框架,通过软对比对齐损失等技术实现视觉-无线跨场景表征迁移,在DeepSense 6G数据集上提升了跨场景任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏