arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-09 至 2026-06-09 共收录 719 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 56 篇

2606.07996 2026-06-09 cs.CL cs.AI 新提交 94%

MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models

MC-PDD: 面向黑盒大语言模型的掩码语料级预训练数据检测

Kaixin Lan, Mu You, Tao Fang, Binkai Ou, Lidia S. Chao, Derek F. Wong

机构 * University of Macau(澳门大学) Macau Millennium College(澳门万人大学) BoardWare Information System Limited(博纬信息系统有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 提出MC-PDD方法,通过掩码特定token并利用LLM预测缺失内容,比较候选语料与参考非成员语料的预测命中率差异,以黑盒方式检测预训练数据,性能与现有方法相当。

Comments The manuscript consists of 10 pages formatted in the IEEE/ACM two-column style

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09697 2026-06-09 cs.CL 新提交 92%

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

PsychoSafe:在大语言模型中引发基于心理学的拒绝

Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学) University of Hamburg(汉堡大学) University of Lübeck(吕贝克大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出PsychoSafe框架,将LLM的拒绝行为重构为基于证据干预策略的结构化支持性沟通,通过构建5个心理风险领域的8019个提示-响应对,对Qwen 3.5 27B进行提示和参数高效微调,在拒绝质量上比通用基线提升28.1%,同时保持非拒绝任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19082 2026-06-09 cs.AI cs.CL cs.GT cs.LG cs.MA 版本更新 92%

Payoff scaling shapes cooperation in LLM agents across languages

收益规模塑造跨语言LLM代理的合作行为

Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。

Comments 44 pages, 17 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18428 2026-06-09 cs.AI 版本更新 91%

AlphaOPT: Formulating Optimization Programs with Self-Improving LLM Experience Library

AlphaOPT: 利用自改进LLM经验库构建优化问题

Minwei Kong, Ao Qu, Xiaotong Guo, Wenbin Ouyang, Chonghe Jiang, Han Zheng, Yining Ma, Dingyi Zhuang, Yuhan Tang, Junyi Li, Shenhao Wang, Haris Koutsopoulos, Hai Wang, Cathy Wu, Jinhua Zhao

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学) Northeastern University(东北大学) Singapore Management University(新加坡管理学院)

专题命中 预训练与数据 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出AlphaOPT,一种自改进经验库,使LLM能从有限监督中学习优化建模知识,通过库学习和库演化两阶段循环,逐步提升性能,在多个基准上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06360 2026-06-09 cs.AI 版本更新 90%

An Infectious Disease Spread Simulation Based on Large Language Model Decision Making

基于大语言模型决策的传染病传播模拟

Yonchanok Khaokaew, Ruochen Kong, Andreas Zufle, Hao Xue, Taylor Anderson, Chandini Raina MacIntyre, Matthew Scotch, Flora D. Salim, David J Heslop

机构 * Computer Science and Engineering Faculty of Engineering(计算机科学与工程系) The University of New South Wales(新南威尔士大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) George Mason University(乔治·马歇尔大学) The Kirby Institute Faculty of Medicine & Health(Kirby研究所医学院与健康学院) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一个空间显式的基于智能体的模拟框架,利用大语言模型生成自我报告流感样疾病的决策,并整合到基于人口普查的合成人群中,以捕捉社会与地理异质性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07587 2026-06-09 cs.LG 新提交 90%

The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers

路由平台:理解并突破LLM路由器的准确性极限

Yifan Lu, Qiyue Zhang, Shenrun Zhang, Zhibo Yu, Zhuang Wang, Hanjie Chen, Jiarong Xing

机构 * Rice University(莱斯大学) Amazon(亚马逊)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 研究发现多种LLM路由方法存在“路由平台”现象,即准确性趋同且远低于理想路由器,主要原因是可预测性瓶颈;通过增大训练数据、更强编码器和端到端微调可突破平台。

Comments 23 Pages, 12 Tables, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02873 2026-06-09 cs.LG cs.AI 版本更新 90%

Toward autocorrection of chemical process flowsheets using large language models

利用大型语言模型实现化工流程图的自动纠错

Lukas Schulze Balhorn, Marc Caballero, Artur M. Schweidtmann

机构 * Process Intelligence Research Group, Department of Chemical Engineering, Delft University of Technology(过程智能研究组,化学工程系,代尔夫特理工大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种基于大型语言模型的生成式AI方法,自动识别化工流程图中的错误并给出修正建议,在合成数据集上达到80%的top-1准确率。

Journal ref Computer Aided Chemical Engineering, Volume 53, 2024, Pages 3109-3114

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 89%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30407 2026-06-09 cs.CL cs.AI cs.IR cs.LG 版本更新 89%

Exploring Autonomous Agentic Data Engineering for Model Specialization

探索用于模型专业化的自主智能体数据工程

Yujie Luo, Xiangyuan Ru, Jingsheng Zheng, Jingjing Wang, Yuqi Zhu, Jintian Zhang, Runnan Fang, Kewei Xu, Ye Liu, Zheng Wei, Jiang Bian, Zang Li, Shumin Deng

机构 * Zhejiang University(浙江大学) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07002 2026-06-09 cs.CL 版本更新 89%

Automated Attribution Graph Interpretation via Probe Prompting

通过探针提示实现自动化归因图解释

Giuseppe Birardi, Gonçalo Paulo

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出探针提示方法,利用跨提示激活签名将归因图特征分组为概念对齐的超节点,并通过因果干预验证标签,在Gemma-2-2B上实现100%的预测转向行为。

Comments 35 pages, 24 figures, 18 tables. Code and interactive demo available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14147 2026-06-09 cs.AI cs.LG 版本更新 88%

An Alternative Trajectory for Generative AI

生成AI的另一种轨迹

Margarita Belova, Yuval Kansal, Yihao Liang, Jiaxin Xiao, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21747 2026-06-09 cs.CV 版本更新 88%

MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding

MotionGPT-2:用于运动生成与理解的通用运动-语言模型

Yuan Wang, Di Huang, Yaqi Zhang, Wanli Ouyang, Jile Jiao, Xuetao Feng, Dan Xu, Shixiang Tang

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Intime Department Store(Intime百货) Deepeleph HKUST(香港科技大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出MotionGPT-2,一种统一的大规模运动-语言模型,通过预训练大语言模型支持多模态控制条件,实现运动生成、描述和补全等多种任务,并引入Part-Aware VQVAE实现细粒度身体和手部运动表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07590 2026-06-09 cs.CV cs.AI 新提交 88%

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

SlideCheck: 通过数据集分布引导病理基础模型的自监督预训练

Mingyi He, Xinyi Guo, Xitong Ling, Weiming Chen, Jiawen Li, Lianghui Zhu, Minxi Ouyang, Mingxi Fu, Yizhi Wang, Tian Guan

机构 * Beijing University of Chemical Technology(北京化工大学) South China Normal University(华南师范大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI

AI总结 提出SlideCheck工具,利用冻结病理基础模型的特征,通过双头MLP评分异常和恶性证据,引导自监督预训练数据筛选,实验表明数据分布影响模型下游性能。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14752 2026-06-09 cs.LG 版本更新 88%

LLMSynthor: Macro-Aligned Micro-Records Synthesis with Large Language Models

LLMSynthor: 使用大语言模型进行宏观对齐的微观记录合成

Yihong Tang, Menglin Kong, Junlin He, Tong Nie, Wei Ma, Lijun Sun

机构 * McGill University(麦吉尔大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出LLMSynthor方法,利用大语言模型作为非参数copula,通过迭代生成与目标宏观统计一致的微观记录,解决大规模细粒度数据收集困难的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07522 2026-06-09 cs.CL cs.LG cs.SI 新提交 88%

Community-Specific Slang and Entity Detection via Semantic Shift in Fine-Tuned Language Models

通过微调语言模型中的语义偏移检测社区特定俚语和实体

Julia Kruk, Sanchita Porwal, Amitrajit Bhattacharjee, Mansi Phute

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出无监督方法,通过测量词在微调前后的语义偏移幅度,从在线社区文本中自动识别俚语、独特实体和民俗用语。

Comments 6 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09338 2026-06-09 cs.CL 新提交 85%

Multi-Hop Knowledge Composition is Bound by Pretraining Exposure

多跳知识组合受限于预训练暴露

Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière

机构 * Inria, Paris, France(法国国家信息与自动化研究所(巴黎)) Inria, Chile(法国国家信息与自动化研究所(智利)) Dept. of Computer Science, Universidad de Chile(智利大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,即使单跳准确率达97%,大语言模型仍无法进行隐式多跳推理,原因是预训练中缺乏组合上下文,而非知识缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07692 2026-06-09 cs.LG cs.AI cs.ET 新提交 84%

BCG-FM: A Foundation Model for Ambient Cardiac Health Sensing

BCG-FM:一种用于环境心脏健康感知的基础模型

Magnus Ruud Kjaer, Haejun Han, Ashish Neupane, David Q. Sun

机构 * Department of Computer Science and Engineering, University of California, San Diego(1 加州大学圣迭戈分校计算机科学与工程系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出首个环境机械生物信号基础模型BCG-FM,利用床垫压电传感器无感采集心冲击图,通过14.6万人的275万小时数据预训练,在生物年龄估计上达到3.26年MAE,并实现15种健康状态的临床相关判别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08306 2026-06-09 cs.LG cs.SI 新提交 83%

Towards Graph Foundation Models for Dynamics in Complex Networked Systems: Lessons from Super-Spreader Identification in Multilayer Networks

面向复杂网络系统中动力学的图基础模型:来自多层网络超级传播者识别的教训

Michał Czuba, Mateusz Stolarski, Adam Piróg, Piotr Bielak, Piotr Bródka

机构 * Department of Artificial Intelligence, Wroc{\l}aw University of Science and Technology, Wroc{\l}aw, Poland(人工智能系,沃斯拉夫科技大学,沃斯拉夫,波兰)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出图基础模型在动力学中需具备归纳跨网络泛化能力,通过仅基于合成多层网络训练的ts-net模型,在真实多层网络上实现零样本泛化,并优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07725 2026-06-09 physics.geo-ph cs.LG 新提交 83%

GNSS-FM: A Self-Supervised Foundation Model for Daily GNSS Displacement Time Series

GNSS-FM:用于日常GNSS位移时间序列的自监督基础模型

Nick Teutschmann, Laura Crocetti, Fanny Lehmann, Leonardo Trentini, Benedikt Soja

机构 * Institute of Geodesy and Photogrammetry, ETH Zurich(大地测量与摄影测量研究所,苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出GNSS-FM自监督基础模型,通过双流输入和掩码潜在预测预训练,在位移预测和地震阶跃定位任务上优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08920 2026-06-09 q-bio.BM cs.AI 版本更新 83%

AMix-1: A Pathway to Test-Time Scalable Protein Foundation Model

AMix-1: 迈向测试时可扩展的蛋白质基础模型

Changze Lv, Jiang Zhou, Siyu Long, Lihao Wang, Jiangtao Feng, Dongyu Xue, Yu Pei, Hao Wang, Zherui Zhang, Yuchen Cai, Zhiqiang Gao, Ziyuan Ma, Jiakai Hu, Chaochen Gao, Jingjing Gong, Yuxuan Song, Shuyi Zhang, Xiaoqing Zheng, Deyi Xiong, Lei Bai, Wanli Ouyang, Ya-Qin Zhang, Wei-Ying Ma, Bowen Zhou, Hao Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Generative Symbolic Intelligence Lab (GenSI), Tsinghua University(生成符号智能实验室(GenSI),清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Georgia Institute of Technology(佐治亚理工学院) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出基于贝叶斯流网络的蛋白质基础模型AMix-1,通过预训练缩放律、涌现能力分析、上下文学习机制和测试时缩放算法,实现1.7B参数模型,并设计出活性提高50倍的AmeR变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08960 2026-06-09 cs.CR cs.AI cs.LG cs.MA 新提交 82%

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

通过对抗性黑客-修复者循环强化智能体基准测试

Ziqian Zhong, Ivgeni Segal, Ivan Bercovich, Shashwat Saxena, Kexun Zhang, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Fewshot Corp(Fewshot公司) Independent Researcher(独立研究员)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01736 2026-06-09 cs.CL cs.AI 版本更新 82%

Argument Collapse: LLMs Flatten Long-Form Public Debate

论点坍缩:LLMs 扁平化长篇公共辩论

Yekyung Kim, Yapei Chang, Chau Minh Pham, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型在生成公共辩论文本时导致论点坍缩的现象,即不同模型生成的论文在主要论点、子论点和段落结构上趋于收敛,通过对比人类与LLM生成文本发现LLM的论点多样性显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08715 2026-06-09 cs.CL 新提交 81%

Operationalizing Linguistic Methods through Prompt-Engineering Skills: An Automatic Chinese Web Neologism Detection Pipeline

通过提示工程技能操作化语言学方法:一种自动中文网络新词检测流水线

Yufeng Wu, Meichun Liu

机构 * City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出一种自动中文网络新词检测方法,将传统语言学识别原则转化为提示工程技能,通过四阶段流水线从2.67亿文档中检测出4853个新词,并揭示候选覆盖和LLM语义判断为瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02424 2026-06-09 cond-mat.mtrl-sci cs.AI 版本更新 81%

A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design

大规模纳米晶体数据库:对齐合成与性质实现生成式逆向设计

Kai Gu, Yingping Liang, Senliang Peng, Aotian Guo, Haizheng Zhong, Ying Fu

机构 * MIIT Key Laboratory for Low-Dimensional Quantum Structure and Devices, School of Materials Sciences & Engineering, Beijing Institute of Technology(信息产业部低维量子结构与器件重点实验室,材料科学与工程学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 构建大规模对齐的纳米晶体合成-性质数据库,开发基于大语言模型的NanoExtractor提取文献数据,并利用NanoDesigner实现生成式逆向设计,成功设计PbSe和MgF2纳米晶体的合成路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09145 2026-06-09 cs.CR 新提交 80%

PrivCode++: Latent-Conditioned Differentially Private Code Generation for Comprehensive Guarantees

PrivCode++: 潜在条件差分隐私代码生成以实现全面保障

Zheng Liu, Chen Gong, Terry Yue Zhuo, Zhou Yang, Kecen Li, Wenlong Meng, Xinwen Hou, Yu Liu, Xiaochen Li

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对指令-代码对微调的大语言模型可能泄露敏感数据的问题,提出PrivCode-Plus,首个在微调中同时保护提示和代码的差分隐私代码生成方法,通过两阶段DP框架和无隐私潜在条件模块实现高效合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07732 2026-06-09 cs.SE 新提交 80%

The Windows IOCTL Census: A Corpus-Scale, Multi-Architecture Database of the Driver Control-Code Surface

Windows IOCTL 普查:驱动程序控制码界面的语料规模、多架构数据库

Michael J. Bommarito

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 通过确定性、架构无关的静态分析,构建了27,087个签名Windows驱动程序的IOCTL控制码分发表数据库,覆盖x86和x64,并利用LLM对可达处理程序进行排序。

Comments 15 pages, 4 figures, 4 tables. Companion structural-tier dataset: huggingface.co/datasets/mjbommar/ioctl-census

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-06-09 cs.DB cs.DS cs.IR 版本更新 80%

jXBW: A Compressed Index for Structure-Aware JSONL Retrieval in Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07066 2026-06-09 cs.CL 新提交 79%

Modeling semantic association in self-paced reading with language model embeddings

使用语言模型嵌入建模自定步速阅读中的语义关联

Sara Møller Østergaard, Kenneth Enevoldsen, Afra Alishahi, Bruno Nicenboim

机构 * Department of Computational Cognitive Science, Tilburg University(蒂尔堡大学计算认知科学系) Center for Humanities Computing, Aarhus University(奥胡斯大学人文计算中心)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究使用语言模型嵌入的十种实现方式量化语义关联,通过贝叶斯模型分析其对N400和自定步速阅读时间的影响,发现句子嵌入能可靠捕捉超出词可预测性的语义关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09658 2026-06-09 cs.LG cs.AI 新提交 79%

Muon Learns More Robust and Transferable Features than Adam

Muon 比 Adam 学习更鲁棒和可迁移的特征

Tianyu Ruan, Fengzhuo Zhang, Shuche Wang, Shihua Zhang

机构 * Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过鲁棒性和可迁移性视角,证明 Muon 优化器相比 Adam 和 SGD 能学习到更鲁棒、更可迁移的特征,并通过理论分析支持了经验发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09511 2026-06-09 cs.CV 新提交 78%

Securing Self-supervised Data Curation for Foundation Models Robustness

保障基础模型鲁棒性的自监督数据筛选

Sandeep Gupta, Roberto Passerone

机构 * Queen's University Belfast(贝尔法斯特女王大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 针对自监督数据筛选面临的数据投毒风险,提出基于ImageBind和传统分类器的主动防御机制PDD,在多种攻击下有效检测中毒数据,SVM-PDD表现最优。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏