arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1009 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1009 篇

2601.22876 2026-08-03 cs.LG 版本更新 77%

Matterhorn: Masked Time-to-First-Spike Encoding by Reassigning the Silent State for Sparse and Energy-Efficient Spiking Transformers

Matterhorn: 一种高效的类脑稀疏脉冲变压器架构与掩码时间到首次脉冲编码

Zhanglu Yan, Kaiwen Tang, Zixuan Zhu, Zhenyu Bai, Qianhui Liu, Yongxin Zhu, Weng-Fai Wong

机构 * Department of computer science, National University of Singapore(新加坡国立大学计算机科学系) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) Shanghai Advanced Research Institute, Chinese Academy of Science(中国科学院上海先进研究院) University of Chinese Academy of Sciences, Beijing(中国科学院大学北京校区)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Matterhorn通过引入掩码时间到首次脉冲编码和类比计算在内存技术,实现高效稀疏脉冲变压器架构,提升能效并达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24845 2026-07-31 cs.IR cs.AI 版本更新 77%

REPREC: Representation Driven Parameter-Efficient Recommendation System

REPREC:表示驱动的参数高效推荐系统

Harshini Kavuru, Dwipam Katariya, Giri Iyengar, Pranab Mohanty, Kalanand Mishra, Raghu Machiraju

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的序列推荐,提出REPREC轻量级框架,通过轻量级用户表示对齐和MLP注入器映射用户嵌入,在多基准数据集实验中优于LoRA,能保持性能并降低训练时间,平衡推荐质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03168 2026-07-28 cs.CV cs.LG 版本更新 77%

Farm-LightSeek: An Edge-centric Multimodal Agricultural IoT Data Analytics Framework with Lightweight LLMs

Farm-LightSeek:一种以边缘为中心的多模态农业物联网数据分析框架,集成轻量级语言模型

Dawen Jiang, Zhishu Shen, Qiushi Zheng, Tiehua Zhang, Wei Xiang, Jiong Jin

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Engineering, Swinburne University of Technology(斯威本科技大学工程学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Computing, Engineering and Mathematical Sciences, La Trobe University(拉筹伯大学计算、工程与数学科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对智能农业面临的挑战,提出Farm-LightSeek框架,将大语言模型与边缘计算集成。通过传感器收集多源数据,在边缘节点进行跨模态推理等。创新包括闭环架构等,实验表明该框架在关键任务中性能可靠,推动了智能实时农业及两者深度集成。

Comments Accepted by IEEE Internet of Things Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14661 2026-07-21 cs.AI 版本更新 77%

SmartRAG: Native Graph-Based RAG for Mobile Device

SmartRAG:用于移动设备的基于原生图的RAG

Zhihan Jiang, Meng Li, Shenghao Liu, Keran Li, Ruiben Zhou, Wei Wang, Xianjun Deng, Shuai Wang, Haipeng Dai

机构 * Nanjing University(南京大学) HUST(华中科技大学) Southeast University(东南大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对移动设备部署大语言模型的问题,提出SmartRAG框架,围绕四个模块组织智能助手,核心是可持续学习的EvoNER,知识存于MRGraph,通过混合管道检索,实验表明其在多跳推理性能上有竞争力且能在普通智能手机上运行。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25059 2026-07-14 cs.CR cs.AI 版本更新 77%

What Does It Mean to Break a Distillation Defense?

打破蒸馏防御意味着什么?

Lena Libon, Pura Peetathawatchai, Michael Aerni, Daniel Paleka, Florian Tramèr

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出一个三维威胁模型框架(查询预算、数据预算、接口配置),用于评估针对黑盒LLM的输出扰动蒸馏防御,并通过反蒸馏采样案例表明防御有效性依赖于威胁模型假设。

Comments 29 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02999 2026-07-09 cs.CR cs.AI 版本更新 77%

NonTextual Target Attack

非文本目标攻击

Xinzhe Huang, Wenjing Hu, Tianhang Zheng, Kedong Xiu, Hongsheng Hu, Xiaojun Jia, Di Wang, Zhan Qin, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone, Binjiang Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区,滨江区块链与数据安全研究院) School of Cyberspace Security, Nanjing University of Science and Technology(网络安全学院,南京理工大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,新加坡国立大学) King Abdullah University of Science and Technology (KAUST)(卡布斯科学与技术大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有大语言模型越狱攻击的局限,提出非文本目标攻击NTA,通过非文本约束目标最大化不安全概率,分解目标便于优化,扩展攻击空间,在AdvBench上对安全对齐的大语言模型仅100次迭代,平均成功率达96.8%,性能远超现有攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03677 2026-07-07 cs.LG 版本更新 77%

Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe

Uni-OPD:基于双视角方案的统一策略内蒸馏框架

Wenjin Hou, Shangpin Peng, Weinong Wang, Zheng Ruan, Yue Zhang, Zhenglin Zhou, Mingqi Gao, Yifei Chen, Kaiqi Wang, Hongming Yang, Chengquan Zhang, Zhuotao Tian, Han Hu, Yi Yang, Fei Wu, Hehe Fan

机构 * Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院) LLM Department, Tencent(腾讯大模型部门)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07397 2026-07-02 cs.CL 版本更新 77%

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

边说话边思考:面向响应式与智能对话语音代理的推理时知识迁移

Vidya Srinivas, Zachary Englhardt, Vikram Iyer, Shwetak Patel

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);small language model(abstract);分类 cs.CL

AI总结 提出对话填充方法,通过小型说话者模型即时生成上下文响应以隐藏推理模型延迟,并在推理中无缝整合流式知识,在保持毫秒级响应速度的同时将准确度差距缩小至前沿推理模型的6.3%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10355 2026-06-29 cs.LG 版本更新 77%

TreeLoRA: Efficient Continual Learning via Layer-Wise LoRAs Guided by a Hierarchical Gradient-Similarity Tree

TreeLoRA:通过层级梯度相似性树引导的逐层LoRA实现高效持续学习

Yu-Yang Qian, Yuan-Ze Xu, Zhen-Yu Zhang, Peng Zhao, Zhi-Hua Zhou

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TreeLoRA方法,利用层级梯度相似性构建逐层适配器,结合bandit技术高效探索任务结构,并通过稀疏梯度更新优化参数,实现大预训练模型的高效持续学习。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04767 2026-06-24 cs.LG 版本更新 77%

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs

ParallelBench: 理解扩散大语言模型中并行解码的权衡

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjae Lee, Yuchen Zeng, Shuibai Zhang, Coleman Hooper, Yuezhou Hu, Hyung Il Koo, Nam Ik Cho, Kangwook Lee

机构 * FuriosaAI UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) UC Berkeley(加州大学伯克利分校) Seoul National University(首尔国立大学) KRAFTON Ludo Robotics Project(Ludo机器人项目)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 针对扩散LLM并行解码导致生成质量下降的问题,通过信息论分析和合成实验揭示其根本限制,并提出首个专门基准ParallelBench,系统评估发现并行解码在现实任务中质量损失严重,且现有策略无法根据任务难度调整并行度。

Comments Accepted at ICLR 2026. Project Page: https://parallelbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04694 2026-06-11 cs.CL 版本更新 77%

DuDi: Dual-Signal Distillation with Cross-Lingual Verbalizer

DuDi: 跨语言动词化的双信号蒸馏

Patomporn Payoungkhamdee, Tinnakit Udsa, Jian Gang Ngui, Sarana Nutanong, Alham Fikri Aji, Peerat Limkonchotiwat

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) AI Singapore(AI新加坡) MBZUAI

专题命中 效率与部署 :language model(abstract);small language model(abstract);SLM(abstract_cn);分类 cs.CL

AI总结 提出DuDi框架,通过结合序列级和词元级信号以及跨语言动词化器,提升小语言模型在多语言(尤其是东南亚语言)上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08501 2026-06-11 cs.CL 版本更新 77%

Fanar-Sadiq: A Multi-Agent Architecture for Grounded Islamic QA

Fanar-Sadiq:一种用于基于经典伊斯兰问答的多智能体架构

Ummar Abbas, Mourad Ouzzani, Mohamed Y. Eltabakh, Omar Sinan, Gagan Bhatia, Hamdy Mubarak, Majd Hawasly, Mohammed Qusay Hashim, Kareem Darwish, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) HBKU(哈马德本·卡尔白大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型在伊斯兰问答中易产生幻觉和错误归因的问题,提出基于多智能体工具增强架构的Fanar-Sadiq系统,通过意图感知路由、检索增强教法回答、精确经文引用和确定性计算器,在公开基准上实现高效准确的伊斯兰问答。

Comments Islamic QA; Religious NLP; Retrieval-Augmented Generation; Multi-Agent LLMs; Tool-Augmented Reasoning; Faithful Generation; Fiqh Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 76%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 效率与部署 :pretraining(title);分类 cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14257 2026-07-24 cs.CL cs.AI 版本更新 76%

Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs

以学生为中心的蒸馏缩小了小型和大型语言模型之间的智能差距

Yuanjie Lyu, Chengyu Wang, Jun Huang, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究旨在缩小大小语言模型智能差距,提出SCoRe框架,让学生生成训练轨迹,教师纠正最早错误,经微调与短视距强化学习,提升学生解决问题能力,在12个基准测试中,70亿参数学生模型缩小了与720亿参数教师模型的性能差距

Comments Accepted to ICML 2026. The title has been changed from "From Correction to Mastery: Reinforced Distillation of Large Language Model Agents" to "Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs"; the camera-ready version has been uploaded

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19064 2026-07-23 cs.CV cs.AI cs.LG cs.MM eess.IV 版本更新 76%

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

机构 * Microsoft Mage Team(微软Mage团队)

专题命中 效率与部署 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22448 2026-07-10 cs.LG cs.CL 版本更新 76%

HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning

HeaPA:用于大语言模型强化学习的难度感知堆采样和策略内查询增强

Weiqi Wang, Xin Liu, Binxuan Huang, Hejie Cui, Rongzhi Zhang, Changlong Yu, Shuowei Jin, Jingfeng Yang, Qingyu Yin, Zhengyang Wang, Zheng Li, Yifan Gao, Priyanka Nigam, Bing Yin, Lihong Li, Yangqiu Song

机构 * Stores Foundational AI, Amazon Inc.(亚马逊公司基础人工智能部) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.LG

AI总结 研究大语言模型强化学习中提示采样问题,提出HeaPA方法,通过难度感知堆采样和策略内查询增强,维持动态提示池,跟踪能力前沿,在多数据集和基准测试中提升准确率,减少计算量,尤其在中大型模型规模下效果显著。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24827 2026-07-07 cs.LG cs.AI 版本更新 76%

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量

Bojie Li

机构 * Pine AI

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08683 2026-06-08 cs.SD cs.AI cs.LG eess.AS 版本更新 76%

Benchmarking Language Modeling for Lossless Compression of Full-Fidelity Audio

全保真音频无损压缩的语言建模基准测试

Phillip Long, Zachary Novack, Chris Donahue

机构 * University of California, San Diego, Computer Science and Engineering Department(加州大学圣地亚哥分校计算机科学与工程系) Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机科学学院)

专题命中 效率与部署 :language model(title);分类 cs.AI、cs.LG

AI总结 提出字节级分词方案Trilobyte,将词汇量从指数级降至常数级,首次实现24位音频的LM无损压缩,并在8位和16位下超越FLAC。

Comments Accepted at Interspeech 2026, 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 75%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04884 2026-08-07 cs.CV 版本更新 75%

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

浑元OCR-1.5:让轻量级OCR视觉语言模型更快更好

Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Large Language Model Department, Tencent(腾讯大语言模型部) Nankai University(南开大学)

专题命中 效率与部署 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究改进轻量级端到端OCR视觉语言模型。基于HunyuanOCR-1.0架构,用DFlash提升效率,提出Agentic Data Flow增强能力,在多任务表现出色,还将发布模型权重和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 75%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25928 2026-08-05 cs.SE 版本更新 75%

TheBotCompany: Self-Organizing Multi-agent Systems for Continuous Software Development

自主多智能体系统用于连续软件开发

Wenhan Lyu, Yue Xiao, Yixuan Zhang, Yifan Sun

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TheBotCompany框架,通过三阶段状态机、自组织智能体团队和异步人类监督,实现持续软件开发的自动化与长期进展。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11456 2026-08-05 cs.DC 版本更新 75%

AuroraRL: Fast, Fault-Tolerant, and Cost-Efficient Reinforcement Learning over Decentralized Network

在通用网络上进行强化学习:通过无损稀疏delta克服带宽障碍

Chaoyi Ruan, Geng Luo, Xinyi Wan, Long Zhao, Qinghe Wang, Jiaan Zhu, Duling Xu, Guanbin Xu, Dehui Wei, Xiang Liu, Cheng Li, Haifeng Sun, Liang Luo, Congcong Miao, Jialin Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract)

AI总结 SparrowRL 通过在通用网络上实现无损稀疏 delta 更新,显著提高了 RL 训练的吞吐量和效率,降低了成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03532 2026-08-04 cs.CL cs.AI cs.LG 版本更新 75%

LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering

LangFIR: 从单语数据中发现稀疏语言特定特征以实现语言引导

Sing Hieng Wong, Hassan Sajjad, A. B. Siddique

机构 * University of Kentucky(肯塔基大学) Dalhousie University(达尔豪斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LangFIR通过仅使用少量单语数据和随机令牌序列,发现稀疏语言特定特征,从而在多语言生成控制中实现高准确率,优于单语基线和依赖平行数据的方法。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02457 2026-08-04 cs.CV 版本更新 75%

PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding

PatchAlign3D: 本地特征对齐用于密集3D形状理解

Souhail Hadgi, Bingchen Gong, Ramana Sundararaman, Emery Pierson, Lei Li, Peter Wonka, Maks Ovsjanikov

机构 * École polytechnique(巴黎政治学院) University of Virginia(弗吉尼亚大学) KAUST(王国立阿联酋科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 PatchAlign3D通过点云直接生成语言对齐的片段特征,实现高效零样本3D部分分割,优于传统渲染方法。

Comments CVPR 2026. Project website: https://souhail-hadgi.github.io/patchalign3dsite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07867 2026-07-22 cond-mat.stat-mech cond-mat.dis-nn 版本更新 75%

Stochastic Thermodynamics for Autoregressive Generative Models: A Non-Markovian Perspective

自回归生成模型的随机热力学:非马尔可夫视角

Takahiro Sagawa

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文从非马尔可夫视角出发,建立自回归生成模型的随机热力学框架,提出熵产概念,通过采样轨迹高效估计熵产,探讨了在大语言模型中的应用及非马尔可夫过程的不可逆性量化。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20689 2026-07-16 cs.CL cs.AI cs.IR cs.LG 版本更新 75%

DIVE: Embedding Compression via Self-Limiting Gradient Updates

DIVE: 通过自限制梯度更新实现嵌入压缩

Dongfang Zhao

机构 * University of Washington Tacoma School of Engineering and Technology(华盛顿大学塔可姆分校工程与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DIVE方法,通过自限制的三元组损失和头级NT-Xent对比损失解决嵌入压缩中因标注数据稀缺导致的过拟合问题,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01923 2026-07-16 cs.CY econ.GN q-fin.EC 版本更新 75%

The Efficiency Costs of Information Assurance in AI-Enabled Labor Markets: Evidence from LinkedIn's Policy Changes

人工智能驱动的劳动力市场中信息保障的效率成本:来自领英政策变化的证据

Lei Chen, Chaoyue Gao, Alvin Leung, Gavin Wang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究人工智能训练中限制用户数据访问对劳动力市场的影响,利用领英政策变化及双重差分设计,发现限制增加劳动力市场摩擦,完整政策周期有类似模式,为人工智能治理及数据访问经济后果讨论提供证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 75%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 75%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏