arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 50 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 50 篇

2608.11657 2026-08-13 cs.CL cs.AI nlin.CG 新提交 93%

Semantic Lenia: Emergence of Homeostatic Solitons within the Semantic Space of Large Language Models

语义LENIA:大语言模型语义空间内的稳态孤子涌现

Yoshihiko Kayama

机构 * BAIKA Women’s University(梅田花女子大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Semantic Lenia人工生命框架,将LLM推理转化为宏观logit空间的连续动力系统,通过非线性稳态反馈回路平衡语义吸引与句法排斥,在混沌边缘涌现自主语义孤子,建立机器认知的物理标度律。

Comments 17 pages, 5 figures. Code, datasets, and interactive phase diagrams are available at https://y-kayama.github.io/semantic-lenia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05639 2026-08-13 cs.AR 版本更新 91%

TokenStack: A Heterogeneous HBM-PIM Architecture and Runtime for Efficient LLM Inference

TokenStack:一种异构HBM-PIM架构和运行时,用于高效的LLM推理

Zhuoran Li, Zhuohang Bian, Zihao Huang, Yibo Zhao, Xueqi Li, Guangyu Sun, Youwei Zhuo

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TokenStack通过异构HBM-PIM架构优化KV缓存,提升LLM推理效率,实现1.62倍吞吐量和1.70倍服务能力提升,同时降低能耗30-47%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09321 2026-08-13 cs.CR 版本更新 91%

SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails

SpatialJB: 文本分布艺术如何成为LLM防护机制的'突破密钥'

Zhiyi Mou, Jingyuan Yang, Zeheng Qian, Wangze Ni, Tianfang Xiao, Ning Liu, Chen Zhang, Zhan Qin, Kui Ren

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SpatialJB通过破坏LLM输出生成过程,利用空间结构扰动突破现有防护机制,实验显示其高效性,同时提出基础防御策略以应对此类攻击。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11981 2026-08-13 cs.CL 新提交 91%

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

小型语言模型(SLM)的可信性基准测试:预训练模型与压缩模型的对比

Haokun Lin, Kaijie Zhu, Haobo Xu, Yichen Wu, Zhichao Lu, Qingfu Zhang, Zhenan Sun

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :SLM(title_cn,summary_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究评估SLM的可信性,发现量化压缩预训练模型比剪枝更能保留可信性,且量化压缩可靠大模型得到的SLM比从头训练的小型模型更优,知识蒸馏可进一步提升其可靠性。

Comments Published in IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 88%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01637 2026-08-13 cs.LG 88%

Chance-Constrained Inference for Hallucination Risk Control in Large Language Models

针对大语言模型幻觉风险的置信约束推断

Sreenivasan Mohandas

机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,海得拉巴,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究提出置信约束推断方法,通过限制幻觉发生的概率,实现大语言模型在部署时的风险控制,实验显示其在风险控制、输入检测和重复使用中的有效性。

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12253 2026-08-13 cs.CL cs.AI cs.LG 新提交 88%

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL

单个冻结模拟器不够:多智能体强化学习中的模拟器崩溃问题

Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu, Derek Chong, Abe Hou, Dilara Soylu, Sergey Levine, Christopher D. Manning, Weiyan Shi

机构 * Northeastern University(东北大学) New York University(纽约大学) UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对人机交互多智能体强化学习中单个LLM模拟器导致的策略泛化缺陷,提出Verbalized Sampling和Co-Training两种方案,在多轮基准测试和真实用户研究中显著提升了性能,发布了开源框架SCOPE。

Comments 41 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11361 2026-08-13 cs.LG cs.CL cs.PF 新提交 87%

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

生命周期最优分词:词汇表大小作为与部署 regime 相关的基础设施参数

Rima Mittal, Ankit Gubrani, Satyanarayana Kakollu

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现 LLM 分词器的最优词汇表大小随部署 regime 变化,提出生命周期部署成本模型,经实验证实其与训练最优值差异最高达 16 倍,且最优范围内质量损失极小,为 LLM 部署提供词汇表容量规划指导。

Comments 6 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11343 2026-08-13 cs.AI cs.CV cs.IR cs.LG 新提交 87%

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比

Archan Dutta, Vyanktesh Kanungo

机构 * Westcliff University(韦克利夫大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11249 2026-08-13 cs.CL cs.AI cs.IT cs.LG math.IT 新提交 86%

Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

扩散到压缩:利用扩散语言模型进行无损压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对无损文本压缩的吞吐量瓶颈,首次引入扩散语言模型(DLM)替代自回归LLM,设计策略解决算法挑战,在enwik8数据集上推进了无损文本压缩的现有技术水平。

Comments 18 pages, 11 figures, 2 tables. Main paper: 9 pages (7 pages text + 2 pages references). Includes 9 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11788 2026-08-13 cs.CL cs.AI 新提交 84%

TELLME: Test-Enhanced Learning for Language Model Enrichment

TELLME:面向语言模型增强的测试增强学习

Minjun Kim, Inho Won, Hyeonseok Lim, MinKyu Kim, Junghun Yuk, Wooyoung Go, Jongyoul Park, Jungyeul Park, KyungTae Lim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University of Science and Technology(首尔科学技术大学) National Security Research Institute(国家安全研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TELLME方法,将测试增强学习(TEL)原理与持续预训练(CPT)结合,缓解大语言模型领域自适应中数据与成本问题,在金融领域表现优于现有方法,长期记忆保留提升显著。

Comments Findings of the Association for Computational Linguistics: EACL 2026

Journal ref Findings of the Association for Computational Linguistics: EACL 2026, pages 1655-1677

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12239 2026-08-13 cs.CV cs.AI cs.MM 新提交 84%

HAMP-LIC: Hessian-Aware Mixed-Precision Post-Training Quantization for Learned Image Compression

HAMP-LIC:面向学习型图像压缩的 Hessian 感知混合精度后训练量化

Yuefeng Zhang

机构 * Beijing Institute of Computer Technology and Application(北京计算机技术及应用研究所) School of Elite Engineering, Northwestern Polytechnical University(西北工业大学精英工程学院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 本文针对学习型图像压缩模型低比特部署的效率与精度问题,提出带四阶段优化的 HAMP-LIC 框架,实现最高4.85倍模型压缩且仅0.59%率失真损失,性能优于现有方法并消除跨平台编解码误差。

Comments Learned image compression, post-training quantization, mixed-precision quantization, Hessian-based sensitivity analysis, model compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15100 2026-08-13 cs.CL cs.AI 版本更新 82%

Commonsense on Demand: Generating and Selectively Integrating Commonsense Knowledge for Natural Language Inference

填补空白:常识知识生成对自然语言推理是否有帮助?

Chathuri Jayaweera, Brianna Yanqui, Bonnie J. Dorr

机构 * University of Florida(佛罗里达大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型通过生成常识公理提升自然语言推理性能的效果,并发现选择性知识访问能有效提高准确率并减少对中性类别的偏见。

Comments 12 pages, 7 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12026 2026-08-13 cs.LG 新提交 81%

SoftWater: Class-Aware Rate Allocation for Softmax Quantization

SoftWater:面向Softmax量化的类别感知速率分配

Joao V. Cavalcanti, Ashia C. Wilson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 针对小型LLM的Softmax层量化问题,提出类别感知速率分配方法SoftWater,在多模型上优于现有量化器,可大幅降低输出层KL散度,使输出层量化的困惑度损失可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11785 2026-08-13 cs.LG 新提交 81%

TradingMoE: Routing the Right Experts in Evolving Markets

TradingMoE:在动态市场中路由合适的专家

Chang Zhou, Xingtong Yu, Minbin Huang, Zhennan Wu, Yuan Fang, Hong Cheng, Xinming Zhang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学) Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TradingMoE是面向交易的稀疏MoE,通过Query-Key路由与稀疏专家选择更新机制优化专家选择,在股票和加密货币市场较22个基准提升累计收益超30%,且仅向前部署时优势仍存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 80%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11820 2026-08-13 cs.CV 新提交 80%

TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖

Shuangqing Zhang, Lei-Lei Ma, Zhao Wang, Wen Dong, Xinyi Xu, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12259 2026-08-13 cs.LG q-fin.ST 新提交 79%

Calibration Bets on the Past: Post-Training Quantization for Financial Time-Series Forecasting

对过去的校准赌注:面向金融时间序列预测的训练后量化

Junyi Ye, Ivy Gateri Wanjiku

机构 * School of Computing, Montclair State University(蒙特克莱尔州立大学计算机学院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 该研究针对S&P 500的波动率预测,探究PTQ中激活校准对4位量化的影响,发现百分位校准可缓解4位量化的性能下降,为金融预测的低精度部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11937 2026-08-13 cs.LG 新提交 79%

Distillation of Foundation Models for Time-dependent PDEs

面向时变偏微分方程的基础模型蒸馏

Daniel Musekamp, Boshra Ariguib, Andrei Manolache, Mathias Niepert

机构 * University of Stuttgart(斯图加特大学) University of Cologne(科隆大学) Bitdefender(比特 Defender(比特Defender,一家网络安全公司))

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出面向时变PDE的知识蒸馏框架TREX,将预训练基础模型的预测能力迁移至紧凑高效的学生模型,在多PDE基准上实现精度相当或超越教师模型,且参数大幅减少、推理速度显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11676 2026-08-13 cs.AI 新提交 79%

XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication

XBridge:面向异构大语言模型通信的实体锚定隐空间桥接器

Wooseong Yang, Wei-Chieh Huang, Weizhi Zhang, Yu Wang, Philip S. Yu, Junhyun Lee

机构 * Hankuk University of Foreign Studies(韩国外国语大学) Noah’s Farm(诺亚农场) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Capital One AI Foundations(Capital One AI 基金会)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 XBridge是免解码的异构大语言模型通信协议,通过词汇锚定映射和隐空间丰富桥接器解决跨架构通信的实体身份丢失问题,在多模型、多基准测试中表现优于现有方法,参数开销低。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11235 2026-08-13 cs.AI 新提交 79%

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

CORA-Diff:面向高效扩散语言模型推理的置信导向残差接受

Yifan Wu, Yufeng Zhang, Kenli Li

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的CORA-Diff方法,利用原生置信度与持久性门控识别残差位置,在多基准测试中显著降低扩散语言模型推理的重复计算,同时保持任务性能。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/wyffffff/cora-diff-llada

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11211 2026-08-13 cs.CV cs.AI 版本更新 79%

A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters

通过非线性多适配器的视觉-语言模型实现简单的效率增量学习框架

Haihua Luo, Xuming Ran, Jiangrong Shen, Timo Hämäläinen, Zhonghua Chen, Qi Xu, Fengyu Cong

机构 * Faculty of Information Technology, University of Jyväskylä(信息科技学院,于韦斯屈耶大学) National University of Singapore(新加坡国立大学) Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能实验室,浙江大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SimE框架,利用视觉-语言模型与适配器提升增量学习效率,发现适配器连接数与模型能力呈非线性关系,实验表明在TinyImageNet和CIFAR-100上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18191 2026-08-13 cs.LG 版本更新 79%

Accelerating Time Series Foundation Models with Speculative Decoding

通过投机解码加速时间序列基础模型

Pranav Subbaraman, Fang Sun, Jinxi Yu, Yue Yao, Huacong Tang, Xiao Luo, Yizhou Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 通过投机解码技术提升时间序列预测模型的推理效率,无需修改现有架构即可加速部署系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11829 2026-08-13 cs.LG cs.CL 新提交 79%

Towards Understanding On-Policy Distillation through the Lens of Test-Time Scaling

从测试时缩放的视角理解在线策略蒸馏

Xinmu Ge, Zizhuo Zhang, Yu Huang, Jianing Zhu, Lin Yuan, Wanli Gu, Weichang Wu, Weiran Huang, Xiaolu Zhang, Bo Han, Jun Zhou, Jiangchao Yao

机构 * Hong Kong Baptist University(香港浸会大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 该研究从测试时缩放视角分析OPD,发现其主要提升采样效率而非扩展推理能力边界,属于“虚假蒸馏”。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11551 2026-08-13 cs.IT math.IT 新提交 78%

Semantic Error Control Coding with Foundation Models for Future Communications

面向未来通信的、基于基础模型的语义差错控制编码

Chentao Yue, Gaoyang Pang, Branka Vucetic, Yonghui Li

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出基于基础模型的语义差错控制编码(SECC)框架,将信源语义结构融入编解码,在AWGN信道上较传统解码获数分贝编码增益,错误率低于正态近似界,同时指出相关开放挑战。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12236 2026-08-13 cs.RO cs.AI cs.LG 版本更新 76%

TMRL: Diffusion Timestep-Modulated Pretraining Enables Exploration for Efficient Policy Finetuning

TMRL: 差分时间步调节预训练实现高效策略微调的探索

Matthew M. Hong, Jesse Zhang, Anusha Nagabandi, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Amazon FAR(亚马逊FAR)

专题命中 效率与部署 :pretraining(title);分类 cs.AI、cs.LG

AI总结 本文提出TMRL框架,通过结合行为克隆预训练与强化学习微调,解决预训练中动作分布狭窄的问题,提升机器人策略微调的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11593 2026-08-13 cs.SD eess.AS 新提交 75%

Luna-TTS Family Technical Report

Luna-TTS 系列技术报告

Feng Yin, Shuai Shi, Junjie Zheng, Kechenying Zhou, Yiqiu Wang, Chenyang He, Qiuhua Jiang, Mengxiao Bi, Yanmin Qian, Mingxin Chen, Xun Gong, Tianteng Gu, Bing Han, Peng Jiang, Chenda Li, Haiyang Sun, Han Wang, Wei Wang, Yi Wang, Leying Zhang, Wangyou Zhang, Chushu Zhou

机构 * VUI Labs Research(VUI实验室研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 该研究提出基于扩散语言模型的 Luna-TTS 系列 TTS 系统,含非自回归与实时自回归变体,在多数据集上的语音识别、相似度及情感控制等指标优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12286 2026-08-13 math-ph math.MP 新提交 75%

PatternFormer: Learning Multiple Solution Patterns in Reaction--Diffusion Systems

PatternFormer:学习反应-扩散系统中的多种解模式

Zhipeng Chang, Wenpeng Yin, Wenrui Hao

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究提出基于大语言模型的PatternFormer框架,可学习非线性偏微分方程的多种解,在非线性椭圆问题和Gray-Scott问题上表现优异,还可微调以构建解景观通用基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 73%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11663 2026-08-13 cs.CV 新提交 71%

Zero-OVCD: Bridging Training-Free Foundation Models and Pseudo-Label Learning for Open-Vocabulary Change Detection

Zero-OVCD:连接无训练基础模型与伪标签学习的开放词汇变化检测方法

Daifeng Peng, Yuanke Peng, Haiyan Guan

机构 * School of Remote Sensing and Geomatics Engineering, Nanjing University of Information Science and Technology(南京信息工程大学遥感与测绘工程学院)

专题命中 效率与部署 :foundation model(title)

AI总结 本文提出Zero-OVCD框架,结合无训练基础模型推理与感知噪声的伪标签学习,在多个遥感变化检测数据集上显著提升了开放词汇变化检测性能,且无需目标域像素级标注。

Comments 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏