arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2606.07732 2026-06-09 cs.SE 新提交 80%

The Windows IOCTL Census: A Corpus-Scale, Multi-Architecture Database of the Driver Control-Code Surface

Windows IOCTL 普查:驱动程序控制码界面的语料规模、多架构数据库

Michael J. Bommarito

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 通过确定性、架构无关的静态分析,构建了27,087个签名Windows驱动程序的IOCTL控制码分发表数据库,覆盖x86和x64,并利用LLM对可达处理程序进行排序。

Comments 15 pages, 4 figures, 4 tables. Companion structural-tier dataset: huggingface.co/datasets/mjbommar/ioctl-census

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-06-09 cs.DB cs.DS cs.IR 版本更新 80%

jXBW: A Compressed Index for Structure-Aware JSONL Retrieval in Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06425 2026-06-05 cs.SI 80%

Annotation of Positive vs Negative User Interactions for Social Sign Prediction

社交关系符号预测中积极与消极用户交互的标注

Biancamaria Bombino, Chiara Boldrini, Andrea Passarella, Marco Conti

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出利用大语言模型零样本识别交互中的个人赞扬和攻击作为关系信号,以改进社交关系符号预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17016 2026-05-26 cs.SE 80%

HELO-APR: Enhancing Low-Resource Program Repair through Cross-Lingual Knowledge Transfer

HELO-APR:通过跨语言知识迁移增强低资源程序修复

Zhipeng Wang, Boyang Yang, Yidong Wan, Liuye Guo, You Lv, Tao Zheng, Zhuowei Wang, Tieke He

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出HELO-APR框架,通过从高资源语言合成低资源语言修复数据并采用课程学习策略,显著提升低资源语言的自动程序修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23820 2026-05-25 cs.CY cs.SI 80%

Inferential Privacy Leakage in Anonymized Conversational AI Logs

匿名化对话式AI日志中的推断隐私泄露

S M Mehedi Zaman, Kiran Garimella

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过分析来自四个全球南方国家1000多名用户的ChatGPT对话历史,测量了显式披露和推断性隐私泄露,发现即使移除显式个人身份信息,大型语言模型仍能以高F1分数推断用户年龄、性别和国家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21242 2026-05-21 cs.RO 80%

To Select or not to Select, that is the Question: Distilling Robot Skill Prediction into a Small Ensemble

选择还是不选择,这是个问题:将机器人技能预测蒸馏成一个小集成

Haechan Mark Bong, Simon Roy, Euhid Aman, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机工程与软件工程系) MILA(蒙特利尔人工智能研究所) National Taiwan University of Science and Technology (NTUST)(台湾科技大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文研究了机器人技能预测问题,通过合成数据集和微调句子编码器,提出了一种小规模专用模型,在零样本提示下优于大型通用LLM,在机器人队伍任务路由中表现更佳。

Journal ref ICRA 2026 Workshop on Synthetic Data for Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20602 2026-05-21 cs.CL cs.AI cs.LG 80%

Self-Training Doesn't Flatten Language -- It Restructures It: Surface Markers Amplify While Deep Syntax Dies

自我训练不使语言扁平化——它重构了它:表面标记增强而深层语法消失

Ming Liu

机构 * Amazon(亚马逊)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过实验发现自我训练过程并非使语言扁平化,而是重构了语言结构,表面标记增强而深层语法结构消失,并提出了结构性深度假说来解释这一现象。

Comments 19 pages (14 main + 5 appendix), 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17846 2026-05-19 eess.AS 80%

UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations

UrduSpeech: 一个包含12维副语言标注的156小时乌尔都语语音语料库

Attia Nafees ul Haq, Zeyu Zhu, Jingbin Hu, ChunJiang He, Lei Xie

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出UrduSpeech语料库,包含156小时乌尔都语语音和12维副语言标注,通过LLM驱动的流程处理多种类别,如新闻、戏剧和罕见文学形式,并发布了一个9小时的基准集,用于评估语音质量。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10825 2026-05-12 cs.NI 80%

Large Spectrum Models (LSMs): Decoder-Only Transformer-Powered Spectrum Activity Forecasting via Tokenized RF Data

大规模频谱模型(LSMs):通过令牌化射频数据的解码器-only变换器进行频谱活动预测

Mohammad Mosiur Lunar, Mehmet C. Vuran

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出大规模频谱模型(LSMs),通过令牌化射频数据利用大规模语言模型架构进行频谱预测,展示了LSMs在频谱预测中的有效性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 80%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25906 2026-04-29 cs.IR 80%

Make Any Collection Navigable: Methods for Constructing and Evaluating Hypergraph of Text

使任意集合可导航:构建和评估文本超图的方法

Dean E. Alvarez, ChengXiang Zhai

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文提出构建和评估文本超图的方法,引入了努力比率指标,实验表明简单TF-IDF基线在该指标上可与基于LLM的方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 80%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15813 2026-04-20 cs.DB 80%

Exploring Agentic Visual Analytics: A Co-Evolutionary Framework of Roles and Workflows

探索代理式可视化分析:角色与工作流的共进化框架

Tianqi Luo, Leixian Shen, Yuyu Luo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过调研55个代理式可视化分析系统,提出一个共进化框架,分析代理自主性与人类角色转变之间的关系,并提出设计指南和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13489 2026-04-16 astro-ph.GA astro-ph.IM 80%

A Unified HI Rotation Curve Corpus for Computational Astrophysics: 438 Galaxies from SPARC, THINGS, LITTLE THINGS, and WALLABY DR2

为计算天文学构建统一的HI旋转曲线数据集:来自SPARC、THINGS、LITTLE THINGS和WALLABY DR2的438个星系

David C. Flynn

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一个统一的HI旋转曲线数据集,包含423个星系的8963个空间分辨测量,用于传统分析和LLM检索增强生成。

Comments 18 pages, 3 figures, 3 tables. Data available at https://zenodo.org/records/19563417. Submitted to Astronomy and Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 80%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07147 2026-04-09 cs.CL cs.AI cs.LG 80%

Dynamic Context Evolution for Scalable Synthetic Data Generation

动态上下文演化用于可扩展的合成数据生成

Ryan Lingo, Rajeev Chhajer

机构 * Honda Research Institute, USA, Inc.(本田研究所美国公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态上下文演化(DCE)框架,通过尾部采样、语义记忆和自适应提示演化机制,有效缓解跨批次模式崩溃问题,提升生成多样性与概念结构 richness。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20009 2026-03-24 cs.CL cs.AI cs.LG 80%

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

LinguaMap:哪些LLM层说你的语言以及如何调节它们?

J. Ben Tamo, Daniel Carlander-Reuterfelt, Jonathan Rubin, Dezhi Hong, Mingxian Wang, Oleg Poliannikov

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 80%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13220 2026-03-16 cs.MA 80%

A Generative Model of Conspicuous Consumption and Status Signaling

conspicuous 消费与地位信号的生成模型

Logan Cross, Jordi Grau-Moya, William A. Cunningham, Alexander Sasha Vezhnevets, Joel Z. Leibo

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出基于适当性理论的生成模型,通过模拟LLM代理群体的社会互动,揭示了社会观察与预测模式完成的反馈循环如何驱动地位符号的内生生成,展示了消费行为与地位信号的动态关系。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09800 2026-03-12 cs.IR cs.AI cs.CL cs.LG hep-ex 80%

MITRA: An AI Assistant for Knowledge Retrieval in Physics Collaborations

MITRA:一种用于物理学协作中知识检索的AI助手

Abhishikth Mallampalli, Sridhara Dasu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MITRA是一种基于RAG的AI助手,通过本地化框架实现物理学协作中的高效知识检索与生成。

Comments Accepted at NeurIPS 2025 Machine Learning for the Physical Sciences workshop and Lepton Photon conference 2025 (Computing AI/ML track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02888 2026-03-05 cs.LG cs.AI cs.CL 80%

When Your Own Output Becomes Your Training Data: Noise-to-Meaning Loops and a Formal RSI Trigger

当你的输出成为你的训练数据:噪声到意义的循环及形式RSI触发

Rintaro Ando

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出N2M-RSI模型,展示AI代理通过自反馈和信息整合阈值可无限增加内部复杂性,并探讨了代理群交互的超线性效应。

Comments Withdrawn due to a critical error discovered in the mathematical derivation and proof of Theorem 2 (Unbounded Growth) and related Lemma 2 (Compression gain lower bound). This flaw invalidates the paper's main conclusion that N2M-RSI guarantees unbounded growth, requiring a fundamental revision of the theoretical framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02081 2026-03-03 cs.DB cs.AI cs.CL cs.LG cs.MA 80%

GenDB: The Next Generation of Query Processing -- Synthesized, Not Engineered

GenDB:查询处理的下一代——合成而非工程

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GenDB利用大语言模型合成查询执行代码,以替代传统复杂的查询处理引擎,实现更高效和定制化的查询处理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00193 2026-03-03 q-bio.QM 80%

Multimodal Alignment Improves Generalizability of Genomic Biomarker Prediction in Computational Pathology

多模态对齐提升了计算病理学中基因组生物标志物预测的泛化能力

Ekaterina Redekop, Eric Zimmermann, Ava P Amini, Alex X Lu, Neil Tenenholtz, James Brian Hall, Lorin Crawford, Kristen A Severson

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 MARBLE通过多模态对比预训练策略,将组织病理学图像与基因组生物标志物的表示对齐,提升计算病理学中基因组生物标志物预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 80%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18137 2026-02-23 cs.CL cs.AI cs.LG 80%

Agentic Adversarial QA for Improving Domain-Specific LLMs

代理对抗问答:提升领域特定大语言模型

Vincent Grari, Ciprian Tomoiaga, Sylvain Lamprier, Tatsunori Hashimoto, Marcin Detyniecki

机构 * Stanford University(斯坦福大学) Polish Academy of Science, IBS PAN, Warsaw, Poland(波兰科学院、IBS PAN、华沙、波兰)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种对抗性问题生成框架,通过生成语义具有挑战性的问题来提升领域特定大语言模型的适应能力。

Comments 9 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11164 2026-02-13 cs.LG cs.AI cs.CL 80%

Automated Optimization Modeling via a Localizable Error-Driven Perspective

通过可定位的误差驱动视角实现自动化优化建模

Weiting Liu, Han Wu, Yufei Kuang, Xiongwei Han, Tao Zhong, Jianfeng Feng, Wenlian Lu

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MIND通过可定位的误差驱动视角,改进自动化优化建模方法,提升训练后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05879 2026-02-06 cs.CL cs.AI cs.LG 80%

EuroLLM-22B: Technical Report

EuroLLM-22B:技术报告

Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

机构 * Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院与里斯本大学)) Instituto de Telecomunicações(电信研究院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣艾尔布兰理工大学、巴黎萨克雷大学) Acolad Carnegie Mellon University(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Diabolocom Aveni OutSystems Sword Health Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Artefact Research Center(Artefact研究机构) TransPerfect

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EuroLLM-22B是一款覆盖24种欧盟语言及11种额外语言的大型语言模型,通过多语言基准测试展现强推理、指令遵循和翻译能力,提供基础模型、指令微调模型及预训练代码库以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04937 2026-02-06 cs.LG cs.AI cs.CL 80%

Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization

线性模型合并解锁了简单且可扩展的多模态数据混合优化

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23407 2026-01-26 cs.LG cs.AI cs.CL 80%

Theoretical Foundations of Scaling Law in Familial Models

家族模型中的缩放定律理论基础

Huan Song, Qingfei Zhao, Ting Long, Shuyu Tian, Hongjun An, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出家族模型的缩放定律理论,通过引入粒度变量扩展传统缩放定律,证明在不牺牲计算最优性的情况下可实现多次部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 80%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏