arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 49 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2604.27789 2026-05-01 cs.SE cs.AI 92%

Test Before You Deploy: Governing Updates in the LLM Supply Chain

部署前测试:在LLM供应链中管理更新

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。

Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27082 2026-05-01 cs.AI cs.LG cs.SE 92%

When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems

当你的LLM到达生命周期终点时:一种在生产系统中自信模型迁移的框架

Emma Casey, David Roberts, David Sim, Ian Beaver

机构 * Verint Systems Inc(Verint系统公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于在底层模型生命周期终点或需替换时迁移生产基于大型语言模型(LLM)的系统。核心贡献是通过贝叶斯统计方法校准自动评估指标与人类判断,即使手动评估数据有限也能实现自信的模型比较。

Comments 12 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28056 2026-05-01 cs.AI 92%

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

RHyVE:基于能力的验证与阶段感知部署用于LLM生成的奖励假说

Feiyu Wu, Xu Zheng, Zhuocheng Wang, Yi ming Dai, Hui Li

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出RHyVE框架,通过能力感知验证和阶段感知部署提升LLM生成奖励假说的可靠性,实验显示在低能力阶段奖励排名不可靠,但经过任务依赖阈值后变得有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19221 2026-05-01 cs.AI cs.SD eess.AS 92%

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

UAF:面向全双工语音交互的统一音频前端LLM

Yadong Li, Guoxin Wu, Haiping Hou, Biye Li

机构 * Alibaba Inc.(阿里巴巴公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UAF,一种统一音频前端LLM,通过将多种语音前端任务统一为序列预测问题,提升全双工语音交互的响应速度和中断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27384 2026-05-01 cs.AR 91%

RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write

RCW-CIM: 一种基于数字计算-in-内存的LLM加速器及读-计算/写架构

Yan-Cheng Guo, Tian-Sheuan Chang, Jian-Wei Su

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RCW-CIM架构,通过减少权重更新延迟和非线性操作融合,实现LLM加速,使Llama2-7B模型解码延迟降低21.59%,并提升能效。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10140 2026-05-01 cs.SE cs.AI cs.MA 91%

Can Large Language Models Implement Agent-Based Models? An ODD-based Replication Study

大型语言模型能否实现基于主体的模型?基于ODD的复制研究

Nuno Fachada, Daniel Fernandes, Carlos M. Fernandes, João P. Matos-Carvalho

机构 * Lusófona University(卢塞佛纳大学) INESC INOV-Lab(INESC INOV实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文评估17种LLM在ODD到代码转换任务中的表现,探讨LLM能否可靠实现基于主体的模型并支持复制、验证与验证。

Comments The peer-reviewed version of this paper is published in Ecological Modelling at https://doi.org/10.1016/j.ecolmodel.2026.111624. This version is typeset by the author and differs only in pagination and typographical detail

Journal ref Ecological Modelling, 517, 111624, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25326 2026-05-01 cs.AR cs.AI 91%

AHASD: Asynchronous Heterogeneous Architecture for LLM Adaptive Drafting Speculative Decoding on Mobile Devices

AHASD:异步异构架构用于移动设备上的LLM自适应草案推测解码

Ma Zirui, Fan Zhihua, Li Wenxing, Wu Haibin, Zhang Fulin, Ye Xiaochun, Li Wenming

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AHASD提出一种异步异构架构,通过任务级DLM-TLM解耦和熵历史感知草案控制,提升移动设备上LLM自适应草案推测解码的吞吐量和能效。

Comments 7 pages, 9 figures, accepted by DAC 2026, repo: https://github.com/MAdrid1011/AHASD

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28018 2026-05-01 cs.CE cs.AI 90%

Design Structure Matrix Modularization with Large Language Models

基于大语言模型的Design Structure Matrix模块化设计

Shuo Jiang, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27536 2026-05-01 cs.AI 90%

Belief-Guided Inference Control for Large Language Model Services via Verifiable Observations

基于可验证观测的信念引导推理控制:通过可验证观测实现大语言模型服务

Wenhao Yuan, Chenchen Lin, Jian Chen, Jinfeng Xu, Shuo Yang, Edith Cheuk Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Veroic框架,通过构建轻量级可验证观测通道,利用聚合的异质质量信号形成信念状态,以实现更优的质量-成本权衡、更强的风险估计和更稳健的长期推理控制。

Comments Accepted by KnowFM@ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27747 2026-05-01 cs.IR cs.AI 90%

Position-Aware Drafting for Inference Acceleration in LLM-Based Generative List-Wise Recommendation

基于位置感知的drafting用于LLM生成列表式推荐的推理加速

Jiaju Chen, Chongming Gao, Chenxiao Fan, Haoyan Liu, Qingpeng Cai, Peng Jiang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PAD-Rec,通过引入位置感知drafting机制,提升生成式推荐的推理效率,实验显示在四个真实数据集上达到3.1倍的时钟速度提升,并保持推荐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09718 2026-05-01 cs.DC cs.AI cs.PL 90%

Agentic Compilation: Mitigating the LLM Rerun Crisis for Minimized-Inference-Cost Web Automation

代理编译:缓解LLM重跑危机以实现最小化推理成本的网络自动化

Jagadeesh Chundru

机构 * Selfotix

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出编译与执行架构,通过分离LLM推理与浏览器执行,将每项工作流的推理成本降至0.1美元以下,实现零样本编译成功率80-94%,并证明确定性编译可经济可行地实现大规模自动化。

Comments 12 pages, 4 figures, 2 tables. v2: Expanded literature review and clarified architecture limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08101 2026-05-01 cs.CR 89%

LLM-Assisted Web Measurements

基于大型语言模型的网络测量

Simone Bozzolan, Stefano Calzavara, Lorenzo Cazzaro

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨利用大型语言模型进行定向网络测量,通过构建定制数据集评估不同模型性能,提出两步方法提升测量效率,并验证LLM在安全隐私趋势分析中的有效性。

Comments 23 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27296 2026-05-01 cs.SE cs.CL 89%

To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

要进行差异生成还是不进行差异生成?面向高效LLM代码编辑的结构感知和自适应输出格式

Wei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BlockDiff和FuncDiff两种结构感知差异格式及AdaEdit策略,通过减少生成复杂度提升长代码编辑效率,准确度与全代码生成相当,降低30%以上延迟和成本。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27032 2026-05-01 cs.SE cs.LG 89%

LLM-Guided Runtime Parameter Optimization for Energy-Efficient Model Inference

基于大语言模型的运行时参数优化以实现高效模型推理

Katelyn Crumpacker, Dimitrios Nikolopoulos

机构 * Virginia Polytechnic and State University(弗吉尼亚理工大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种结合人类反馈和大语言模型的运行时参数优化方法,以提高模型推理的能效,通过迭代优化快速找到高效参数配置。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27115 2026-05-01 cs.CL 88%

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

机构 * BRAC University(布拉格大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27002 2026-05-01 cs.CR 88%

Membership Inference Attacks Against Video Large Language Models

针对视频大语言模型的成员推断攻击

Wei Song, Yuxin Cao, Ziqi Ding, Yi Liu, Gelei Deng, Yuekang Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了针对视频大语言模型的黑盒成员推断攻击,通过温度扰动生成与视频感知难度特征结合,验证了视频大语言模型对隐私风险的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27844 2026-05-01 cs.DC cs.CL 87%

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

ZipCCL: 通信集体的高效无损数据压缩以加速大语言模型训练

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ZipCCL,通过理论编码、GPU优化内核和自适应策略,实现通信数据的无损压缩,减少通信时间并提升训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02277 2026-05-01 cs.LG cs.AI 87%

Junk DNA Hypothesis: Pruning Small Pre-Trained Weights Irreversibly and Monotonically Impairs "Difficult" Downstream Tasks in LLMs

垃圾DNA假说:修剪小的预训练权重不可逆且单调地损害LLM中的“困难”下游任务

Lu Yin, Ajay Jaiswal, Shiwei Liu, Souvik Kundu, Zhangyang Wang

机构 * University of Surrey Eindhoven University of Technology University of Texas at Austin Intel Labs University of Oxford

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出垃圾DNA假说,指出LLM预训练权重中存在关键知识,修剪小权重会单调损害困难下游任务性能,且即使允许持续训练也无法弥补损失。

Comments Published at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17175 2026-05-01 cs.LG cs.AI q-bio.BM 87%

RosettaSearch: Multi-Objective Inference-Time Search for Protein Sequence Design

RosettaSearch:蛋白质序列设计的多目标推理时间搜索

Meghana Kshirsagar, Allen Nie, Ching-An Cheng, Fanglei Xue, Rahul Dodhia, Juan Lavista Ferres, Kevin K. Yang, Frank DiMaio

机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) Microsoft Research New England(微软新英格兰研究) Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22099 2026-05-01 cs.LG cs.AI 85%

Decomposed Trust: Privacy, Adversarial Robustness, Ethics, and Fairness in Low-Rank LLMs

分解信任:低秩大语言模型中的隐私、对抗鲁棒性、伦理与公平性

Daniel Agyei Asante, Md Mokarram Chowdhury, Yang Li

机构 * Department of Computer Science, Iowa State University, United States(爱荷华州立大学计算机科学系) Meta, United States(Meta)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究低秩因子化对大语言模型信任性的影响,发现其在隐私保护上有所保留,但会削弱对话中个人身份信息的保护,同时增强对抗鲁棒性,但伦理和公平性有所下降。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 85%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14067 2026-05-01 cs.CL cs.AI cs.LG 85%

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Efficient-DLM:从自回归到扩散语言模型,以及速度上的突破

Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

机构 * Georgia Tech(佐治亚理工学院) University of Chicago(芝加哥大学) University of Hong Kong(香港大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Efficient-DLM方法,通过改进自回归到扩散语言模型的转换,提升生成速度并保持任务准确性,实验显示其在精度和效率上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27861 2026-05-01 cs.CR cs.CL cs.LG 82%

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27096 2026-05-01 cs.AI 81%

Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI

思考并运行:通过自我修复多智能体AI实现自主ML流水线生成

Adela Bara, Gabriela Dobrita, Simona-Vasilica Oprea

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种统一的多智能体架构,实现从数据集和自然语言目标自动生成端到端机器学习流水线,提升效率、鲁棒性和可解释性。通过五智能体系统处理数据剖析、意图解析、微服务推荐、DAG构建与执行,并结合代码基础的RAG、可解释混合推荐、自我修复机制和自适应学习,实现了84.7%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08332 2026-05-01 cs.AI 81%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27084 2026-05-01 cs.NI 80%

BLINC: Context-Specific Causal Learning for Automated RAN Configuration

BLINC:基于上下文的因果学习用于自动无线接入网配置

Reshma Prasad, Michele Polese, Tommaso Melodia

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 BLINC通过整合电信领域知识,利用贝叶斯网络框架实现无线接入网配置的自动优化,提升吞吐量63.5%,降低误块率19.7%。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27911 2026-05-01 cs.LG cs.ET cs.NE 79%

Physical Foundation Models: Fixed hardware implementations of large-scale neural networks

物理基础模型:大规模神经网络的固定硬件实现

Logan G Wright, Tianyu Wang, Tatsuhiro Onodera, Peter L. McMahon

机构 * Department of Applied Physics, Yale University, New Haven, CT 06520, USA(耶鲁大学应用物理系) School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) Department of Electrical and Computer Engineering, Boston University, Boston, MA 02215, USA(波士顿大学电气与计算机工程系) NTT Physics and Informatics Laboratories, NTT Research, Inc., Sunnyvale, CA 94085, USA(NTT物理与信息学实验室,NTT研究公司) Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文探讨了物理基础模型(PFMs)的概念,提出通过物理设计实现神经网络,以提升能效、速度和参数密度,适用于大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27667 2026-05-01 cs.RO cs.LG 79%

Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?

表基础模型能否指导机器人策略学习中的探索?

Buqing Ou, Frederike Dümbgen

机构 * Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) Inria, Département d’informatique de l’ENS, CNRS, PSL Research University(法国国家科学研究中心(CNRS)、巴黎综合理工学院(ENS)和PSL研究大学的Inria)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TFM-S3方法,通过结合局部和全局搜索提升机器人策略学习的全局探索效率,实验显示其在连续控制基准上加速收敛并提升性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27124 2026-05-01 cs.LG q-bio.QM 79%

Better Models, Faster Training: Sigmoid Attention for single-cell Foundation Models

更好的模型,更快的训练:Sigmoid 注意力用于单细胞基础模型

Vijay Sadashivaiah, Georgios Dasoulas, Judith Mueller, Soumya Ghosh

机构 * Merck & Co., Inc.(默克公司)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出Sigmoid注意力机制,通过改进表示学习、加速训练和提升稳定性,在单细胞数据集上实现了更优的细胞类型分离和更低的验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25711 2026-05-01 cs.SE cs.AI 77%

Learning Generalizable Multimodal Representations for Software Vulnerability Detection

学习通用的多模态表示以进行软件漏洞检测

Zeming Dong, Yuejun Guo, Qiang Hu, Yao Zhang, Maxime Cordy, Hao Liu, Mike Papadakis, Yongqiang Lyu

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Tianjin University(天津大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出MultiVul框架,通过双相似性学习和一致性正则化对代码和注释进行多模态对齐,提升漏洞检测的泛化能力,实验表明在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏