arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 43 篇

2603.21140 2026-03-24 cs.AI 90%

ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation

ORACLE:通过约束引导的合成数据激发方法优化大语言模型的推理能力

Zhuojie Yang, Wentao Wan, Keze Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ORACLE通过结合生成式模型与符号监督,实现对多步骤推理数据的细粒度验证,提升大语言模型的推理能力,在六个基准测试中表现优异。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21584 2026-03-24 cs.LG cs.CV 88%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06264 2026-03-24 cs.CL cs.CY 87%

Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion

注意鸿沟:LLM对齐与亚洲公众意见的陷阱

Hari Shankar, Vedanta S P, Sriharini Margapuri, Debjani Mazumder, Ponnurangam Kumaraguru, Abhijnan Chakraborty

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM在多语言多文化环境中的对齐问题,发现其在宗教观点尤其是少数群体方面存在偏差,提出轻量干预无法消除文化鸿沟,强调需系统性地区审计确保公平部署。

Comments 13 pages, including AAAI Paper Checklist. Accepted in Proceedings of the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20632 2026-03-24 cs.LG 87%

Optimal low-rank stochastic gradient estimation for LLM training

最优低秩随机梯度估计用于大语言模型训练

Zehao Li, Tao Ren, Zishi Zhang, Xi Chen, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Stern School of Business, New York University(纽约大学 Stern 商学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种低秩矩阵估计器,通过随机低维子空间投影减少内存占用并控制均方误差,实验证明在RoBERTa-large微调和LLaMA-20M/60M/100M预训练中均取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05721 2026-03-24 cs.CL 87%

What Are They Filtering Out? An Experimental Benchmark of Filtering Strategies for Harm Reduction in Pretraining Datasets

他们是在过滤什么?一种减少预训练数据集有害内容的过滤策略实验基准

Marco Antonio Stranisci, Christian Hardmeier

机构 * University of Turin(都灵大学) aequa-tech IT University of Copenhagen(哥本哈根技术大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实验评估了数据过滤策略对减少有害内容的影响,发现其副作用是加剧了对弱势群体的歧视性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG 87%

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22186 2026-03-24 cs.CL cs.AI 86%

Enhancing Document-Level Machine Translation via Filtered Synthetic Corpora and Two-Stage LLM Adaptation

通过过滤后的合成语料库和两阶段LLM适应增强文档级机器翻译

Ireh Kim, Tesia Sker, Chanwoo Kim

机构 * 1 Department of Artificial Intelligence Korea University, Seoul, South Korea

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过过滤后的合成语料库和两阶段LLM适应方法,解决文档级机器翻译中平行数据稀缺和生成幻觉问题,提升翻译质量。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21415 2026-03-24 cs.AI cs.CR cs.LG 86%

Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures

指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据

Gregory M. Ruddell

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。

Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03385 2026-03-24 cs.LG math.PR 85%

SIGMA: Scalable Spectral Insights for LLM Model Collapse

SIGMA:用于LLM模型崩溃的可扩展频谱洞察

Yi Gu, Lingyou Pang, Xiangkun Ye, Tianyu Wang, Jianyu Lin, Carey E. Priebe, Alexander Aue

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计学系) Department of Mathematics, Northwestern University(西北大学数学系) Boston University(波士顿大学) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出SIGMA框架,通过频谱分析嵌入Gram矩阵来检测LLM模型崩溃,提供数学基础的度量方法,并实现大规模模型的可扩展监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20969 2026-03-24 cs.LG cs.CL 84%

Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge

理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理

Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis

机构 * University of Southern California(南加州大学) University of British Columbia(不列颠哥伦比亚大学) Flatiron Institute(Flatiron研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20466 2026-03-24 cs.CL cs.AI 84%

Diffutron: A Masked Diffusion Language Model for Turkish Language

Diffutron:一种针对土耳其语言的掩码扩散语言模型

Şuayp Talha Kocabay, Talha Rüzgar Akkuş

机构 * Hugging Face

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Diffutron,一种专为土耳其语言设计的掩码扩散语言模型,通过高效训练流程和分阶段指令微调,实现了紧凑模型在土耳其语言生成任务中的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21847 2026-03-24 cs.CL 83%

Riding Brainwaves in LLM Space: Understanding Activation Patterns Using Individual Neural Signatures

在LLM空间中骑行脑波:利用个体神经特征理解激活模式

Ajan Subramanian, Sumukh Bettadapura, Rohan Sathish

机构 * Kubo Technologies

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究通过训练个性化线性探针,发现冻结的LLM表示能编码个体特定的EEG信号,且在高伽马功率上表现显著优于群体探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 83%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20732 2026-03-24 cs.CL 83%

MzansiText and MzansiLM: An Open Corpus and Decoder-Only Language Model for South African Languages

MzansiText 和 MzansiLM:一种面向南非语言的开放语料库和解码器-only 语言模型

Anri Lombard, Simbarashe Mawere, Temi Aina, Ethan Wolff, Sbonelo Gumede, Elan Novick, Francois Meyer, Jan Buys

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍MzansiText和MzansiLM,针对南非11种官方语言中的9种低资源语言,通过任务特定微调在自然语言理解与生成任务中取得显著成果,但小规模下少量推理仍具挑战性。

Comments 15 pages, 11 tables, appendix included. Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22275 2026-03-24 cs.CV 82%

Repurposing Geometric Foundation Models for Multi-view Diffusion

将几何基础模型重新利用于多视图扩散

Wooseok Jang, Seonghu Jeon, Jisang Han, Jinhyeok Choi, Minkyung Kwon, Seungryong Kim, Saining Xie, Sainan Liu

机构 * KAIST AI(韩国科学技术院人工智能实验室) New York University(纽约大学) Intel Labs(英特尔实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出Geometric Latent Diffusion框架,利用几何一致的特征空间作为多视图扩散的潜在空间,提升多视角生成的几何一致性和图像质量。

Comments project website: https://cvlab-kaist.github.io/GLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20348 2026-03-24 cs.CV 82%

Toward a Multi-View Brain Network Foundation Model: Cross-View Consistency Learning Across Arbitrary Atlases

迈向多视角脑网络基础模型:跨视角一致性学习在任意脑图谱上的应用

Jiaxing Xu, Jingying Ma, Xin Lin, Yuxiao Liu, Kai He, Qika Lin, Yiping Ke, Yang Li, Dinggang Shen, Mengling Feng

机构 * Saw Swee Hock School of Public Health at National University of Singapore(国立新加坡大学 Saw Swee Hock 公共卫生学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学 生物医学工程学院及先进医学材料与设备国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 计算与数据科学学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室) Shanghai United Imaging Intelligence(上海联合影像智能有限公司) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出MV-BrainFM多视角脑网络基础模型,通过跨视角一致性学习在任意脑图谱上学习通用且可扩展的表示,提升跨图谱的鲁棒性和一致性,实验表明其在20000+受试者数据集上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04865 2026-03-24 cs.LG cs.PL 81%

Agnostics: Learning to Code in Any Programming Language via Reinforcement with a Universal Learning Environment

Agnostics: 通过通用学习环境的强化学习实现任何编程语言的代码学习

Aleksander Boruch-Gruszecki, Yangtian Zi, Zixuan Wu, Tejas Oberoi, Carolyn Jane Anderson, Joydeep Biswas, Arjun Guha

机构 * Northeastern University(东北大学) University of Texas(德克萨斯大学) Wellesley College(韦尔斯利学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Agnostics通过通用学习环境的强化学习,实现任何编程语言的代码学习,提升低资源语言模型性能并简化训练流程。

Comments 30 pages, 19 figures. Accepted at ICLR 2026. For data, code, artifacts, see https://agnostics.abgru.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21658 2026-03-24 cs.CL cs.LG 81%

A Comparative Analysis of LLM Memorization at Statistical and Internal Levels: Cross-Model Commonalities and Model-Specific Signatures

大语言模型在统计和内部层面的记忆比较分析:跨模型共性与模型特有特征

Bowen Chen, Namgi Han, Yusuke Miyao

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系) Research and Development Center for Large Language Models, National Institute of Informatics(信息学研究院大语言模型研究与开发中心)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文通过分析多个模型系列的记忆行为,揭示了记忆率与模型规模的对数线性关系及序列压缩,同时发现不同模型在内部层面存在独特的解码过程和重要头部分布特征。

Comments 8 pages of main content, in conference submission, other contents are references and extra appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20009 2026-03-24 cs.CL cs.AI cs.LG 80%

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

LinguaMap:哪些LLM层说你的语言以及如何调节它们?

J. Ben Tamo, Daniel Carlander-Reuterfelt, Jonathan Rubin, Dezhi Hong, Mingxian Wang, Oleg Poliannikov

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01591 2026-03-24 eess.IV cs.AI cs.CV 79%

Imaging foundation model for universal enhancement of non-ideal measurement CT

用于非理想测量CT通用增强的成像基础模型

Rongjun Ge, Yuxin Liu, Zhan Wu, Shangwen Yang, Yuan Gao, Chenyu You, Ge Wang, Shuo Li, Yuting He, Yang Chen

机构 * School of Instrument Science and Engineering, Southeast University, China(东南大学仪器科学与工程学院, 中国) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院, 中国) Department of Radiology, Nanjing Drum Tower Hospital, Affiliated Hospital of Medical School, Nanjing University(南京鼓楼医院放射科, 南京大学附属医院) Shandong Fundamental Research Center for Computer Science, Qilu University of Technology (Shandong Academy of Sciences), China(山东省计算机科学基础研究中心, 青鲁科技大学(山东科学院), 中国) Department of Electrical & Computer Engineering, Yale University, USA(耶鲁大学电气与计算机工程系, 美国) Department of Biomedical Engineering, Rensselaer Polytechnic Institute, USA(雷士拉尔理工学院生物医学工程系, 美国) Department of Computer and Data Sciences, Case Western Reserve University, USA(凯斯西储大学计算机与数据科学系, 美国) Department of Biomedical Engineering, Case Western Reserve University, USA(凯斯西储大学生物医学工程系, 美国)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出TAMP模型,通过多尺度集成Transformer架构,提升非理想测量CT图像质量,适用于多种临床场景,实验验证其在医学影像中的有效性。

Comments This paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19575 2026-03-24 cs.CV 78%

MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation

MagicSeg: 通过反事实扩散模型自动生成实现开放世界分割预训练

Kaixin Cai, Pengzhen Ren, Jianhua Han, Yi Zhu, Hang Xu, Jianzhuang Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) PengCheng Laboratory(鹏城实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MagicSeg通过反事实扩散模型自动生成数据集,提升开放世界语义分割性能,实验在PASCAL VOC等数据集上取得SOTA结果。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21571 2026-03-24 cs.CL 77%

DATASHI: A Parallel English-Tashlhiyt Corpus for Orthography Normalization and Low-Resource Language Processing

DATASHI:一个平行的英语-塔希利耶特语语料库用于正字法规范化和低资源语言处理

Nasser-Eddine Monir, Zakaria Baou

机构 * Université de Lorraine, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化技术研究院、LORIA实验室) ISIMA, Université Clermont Auvergne(克莱蒙特奥弗涅大学ISIMA)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 DATASHI提供了一个包含5000对句子的平行语料库,包含1500个经过专家标准化和非标准用户生成的句子,用于研究正字法多样性及规范化,支持NLP任务并为多模态对齐提供基础。

Comments This paper has been accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 75%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 预训练与数据 :instruction tuning(abstract);pretraining(abstract);prompting(abstract)

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22053 2026-03-24 cs.SD cs.LG 74%

AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference

AnimalCLAP:基于物种分类的语言-音频预训练用于物种识别和特征推断

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 AnimalCLAP通过整合生物层级信息,利用新的数据集和模型提升物种识别和特征推断性能,优于CLAP模型。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20235 2026-03-24 cs.CY cs.AI cs.HC 72%

Writing literature reviews with AI: principles, hurdles and some lessons learned

用AI撰写文献综述:原则、障碍与一些经验教训

Saadi Lahlou, Annabelle Gouttebroze, Atrina Oraee, Julian Madera

机构 * London School of Economics and Political Science(伦敦政治经济学院) Paris Institute for Advanced Study(巴黎高级研究学院)

专题命中 预训练与数据 :LLM(abstract,comments);prompting(abstract);分类 cs.AI

AI总结 本文通过比较不同AI辅助程度下的文献综述,揭示了AI生成内容的偏见、主流化倾向及局限性,强调了在使用AI撰写综述时需注意的防范措施。

Comments 31 pages and 193 pages of Appendices, including 6 different versions of the literature review, and complete chat with the LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22260 2026-03-24 cs.CL 70%

Greater accessibility can amplify discrimination in generative AI

更大的可及性可能放大生成AI中的歧视

Carolin Holtermann, Minh Duc Bui, Kaitlyn Zhou, Valentin Hofmann, Katharina von der Wense, Anne Lauscher

机构 * Trustworthy AI Lab, University of Hamburg(可信AI实验室,汉堡大学) NALA Group, JGU Mainz(NALA集团,吉森大学) Cornell University(康奈尔大学) Together AI Allen Institute for AI(人工智能研究院) CU Boulder(博尔德大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现语音交互虽提升可及性,但会因语音携带身份线索而加剧性别偏见,提出通过音调调节可缓解歧视问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21862 2026-03-24 cs.LG 70%

Holistic Scaling Laws for Optimal Mixture-of-Experts Architecture Optimization

整体缩放定律用于最优专家混合架构优化

Weilin Wan, Jingtao Han, Weizhong Zhang, Cheng Jin

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Hi Lab, Xiaohongshu Inc.(小红书公司Hi实验室) Project Numina(项目Numina) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种框架,通过联合约束三元组和代数约束,优化专家混合架构,实现鲁棒的缩放定律,为大规模计算预算提供完整最优架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21630 2026-03-24 cs.AI 70%

EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises

EnterpriseLab:企业中开发和部署代理的全栈平台

Ankush Agarwal, Harsh Vishwakarma, Suraj Nagaje, Chaitanya Devaguptapu

机构 * Fujitsu Research India(富士通印度研究)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 本文提出EnterpriseLab,一个统一开发和部署企业代理的全栈平台,通过模块化环境、自动化数据生成和集成训练管道,提升企业代理的能力与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21529 2026-03-24 cs.CL 70%

SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification

SynSym:一种用于精神病症状识别的合成数据生成框架

Migyeong Kang, Jihyun Kim, Hyolim Jeon, Sunwoo Hwang, Jihyun An, Yonghoon Kim, Haewoon Kwak, Jisun An, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) Samsung Medical Center(三星医疗中心) Indiana University(印第安纳大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SynSym框架,通过生成高质量训练样本提升症状识别模型的泛化能力,实验表明合成数据能与真实数据表现相当,并通过微调进一步提升性能。

URL PDF HTML 收藏
2505.11404 2026-03-24 cs.CV cs.AI 70%

Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner

Patho-R1: 基于多模态强化学习的病理专家推理器

Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) University of Toronto(多伦多大学) Business School, Sichuan University(四川大学商学院) Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏