arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2508.18609 2026-04-23 cs.CL cs.AI cs.LG 92%

Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models

任务分层的知识扩展规律用于训练后量化的大语言模型

Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20168 2026-04-23 cs.CL 90%

Duluth at SemEval-2026 Task 6: DeBERTa with LLM-Augmented Data for Unmasking Political Question Evasions

德鲁特在SemEval-2026任务6:DeBERTa与LLM增强数据用于揭示政治问题回避

Shujauddin Syed, Ted Pedersen

机构 * Department of Computer Science(计算机科学系) University of Minnesota Duluth(明尼苏达大学杜鲁斯)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出德鲁特在SemEval-2026任务6上的方法,使用DeBERTa-V3-base结合焦点损失和布尔话语特征,通过LLM增强数据提升政治问题回避识别的宏F1值达0.76。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 89%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19783 2026-04-23 cs.CL 87%

How Much Does Persuasion Strategy Matter? LLM-Annotated Evidence from Charitable Donation Dialogues

说服策略有多重要?来自慈善捐赠对话的LLM注释证据

Tatiana Petrova, Stanislav Sokol, Radu State

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠性与信任跨学科研究中心)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析10600个对话中的说服策略,发现仅 guilt induction 与较低的捐款率相关,而 reciprocity 是最强的正相关因素,表明单纯策略识别不足以解释说服效果。

Comments 8 pages, 2 figures, 5 tables. Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20549 2026-04-23 cs.CL cs.AI 84%

Toward Cross-Lingual Quality Classifiers for Multilingual Pretraining Data Selection

迈向多语言预训练数据选择的跨语言质量分类器

Yassine Turki, Vinko Sabolčec, Bettina Messmer, Martin Jaggi

机构 * Machine Learning Optimization Lab(机器学习优化实验室) Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过跨语言迁移、第三四分位采样和保留率调整策略,提升多语言数据筛选效果,证明大规模多语言池化在稳定性与准确率上优于单语基线,尤其对低资源语言有显著提升。

Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM @ ICLR 2026). 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12036 2026-04-23 cs.CL 84%

Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models

Composition-RL:为大型语言模型的强化学习编纂可验证提示

Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) HY, Tencent(HY,腾讯) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 Composition-RL通过自动组合多个问题生成新可验证问题,提升有限提示的利用效率,实验表明其能提升推理能力并支持跨领域强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02132 2026-04-23 cs.CL cs.LG 84%

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models

模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征

Michael Li, Nishant Subramani

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI 83%

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 81%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00414 2026-04-23 cs.AI cs.CL 81%

Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training

认知内核-Pro:深度研究代理及代理基础模型训练的框架

Tianqing Fang, Zhisong Zhang, Xiaoyang Wang, Rui Wang, Can Qin, Yuxuan Wan, Jun-Yu Ma, Ce Zhang, Jiaqi Chen, Xiyun Li, Yonglin Wang, Jingchen Ni, Tianshi Zheng, Chun Chen, Wenhao Yu, Zhenwen Liang, Hongming Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Cognitive Kernel-Pro框架,旨在通过开放源代码和免费资源促进高级AI代理的开发与评估,重点研究高质量训练数据的构建及代理测试时的反思与投票策略,实现了在GAIA上的领先性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06803 2026-04-23 cs.CL cs.AI cs.CE 79%

Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams

通过SysML生成动态系统模型:从无结构自然语言文本自动生成动态系统计算模型

Matthew Anderson Hendricks, Alice Cicirello

机构 * Department of Engineering, University of Cambridge, Trumpington Street, Cambridge, UK(剑桥大学工程系,特鲁布里奇顿街,剑桥,英国)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用领域和专家知识,通过SysML图自动从相关文档和输入文档生成动态系统计算模型,提升工程动态系统设计和部署效率。

Comments v3 - typos and imprecisions corrected, and added clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20392 2026-04-23 cs.CV 78%

Self-supervised pretraining for an iterative image size agnostic vision transformer

面向迭代图像尺寸无关视觉变换器的自监督预训练

Nedyalko Prisadnikov, Danda Pani Paudel, Yuqian Fu, Luc Van Gool

机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯",保加利亚)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于DINO自蒸馏目标的新型序列到全局自监督学习框架,通过高效积分图像补丁提取方法实现图像尺寸无关的视觉编码器大规模预训练,取得ImageNet-1K和下游分类任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV 67%

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19328 2026-04-23 cs.LG 57%

Understanding the Staged Dynamics of Transformers in Learning Latent Structure

理解变换器在学习潜在结构中的分阶段动态

Rohan Saha, Farzane Aminmansour, Alona Fyshe

机构 * Department of Computing Science, University of Alberta, Edmonton, Canada(计算科学系,阿尔伯塔大学,爱德蒙顿,加拿大) Department of Psychology, University of Alberta, Edmonton, Canada(心理学系,阿尔伯塔大学,爱德蒙顿,加拿大)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文通过Alchemy基准测试,研究了变换器在学习潜在结构中的分阶段动态,发现模型在不同任务中逐步学习不同结构组件,并揭示了层间可塑性窗口对训练过程的影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09283 2026-04-23 cs.CV 50%

From Ideal to Real: Stable Video Object Removal under Imperfect Conditions

从理想到现实:在不完美条件下实现稳定的视频对象移除

Jiagao Hu, Yuxuan Chen, Fuhao Li, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出SVOR框架,通过MUSE、DA-Seg和双阶段训练解决视频对象移除中的阴影、运动突变和掩码缺陷问题,实现更稳定的移除效果。

Comments Project Page: https://xiaomi-research.github.io/svor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 50%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 预训练与数据 :language model(abstract)

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14649 2026-04-23 cs.CV 50%

DetailCLIP: Injecting Image Details into CLIP's Feature Space

DetailCLIP: 将图像细节注入CLIP的特征空间

Zilun Zhang, Cuifeng Shen, Yuan Shen, Xinyu Zhou, Huixin Xiong, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Megvii(科大讯飞) Om AI Research(Om人工智能研究院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出DetailCLIP框架,通过生成高分辨率图像的单一特征表示,保留多尺度细节并共享CLIP的语义空间,提升遥感文本-图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 16 篇

2604.14116 2026-04-23 cs.AI cs.CL 92%

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX:通过代理驱动的树形探索自动化LLM微调

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16676 2026-04-23 cs.LG cs.CL 92%

WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling

WISCA:一种轻量级模型转换方法,通过权重缩放提高LLM训练

Jiacheng Li, Jianchao Tan, Zhidong Yang, Pingwei Sun, Feiye Huo, Jiayu Qin, Xiangyu Zhang, Maoxin He, Yerui Sun, Yuchen Xie, Guangming Tan, Weile Jia, Xunliang Cai, Tong Zhao

机构 * Meituan, Beijing, China(美团,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) Xiamen University, Xiamen, China(厦门大学,厦门,中国)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 WISCA通过优化神经网络权重模式提升LLM训练效率和模型质量,实验显示在GQA架构和LoRA微调任务中显著提升收敛质量。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12078 2026-04-23 cs.CL cs.IR 92%

Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization

通过上下文老虎机优化用户资料以实现检索增强的LLM个性化

Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu, Haolun Wu

机构 * McGill University(麦吉尔大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Université de Montréal(蒙特利尔大学) Salesforce(Salesforce公司) HEC Montréal(蒙特利尔HEC商学院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PURPLE框架,通过上下文老虎机优化用户资料,利用Plackett-Luce模型捕捉复杂依赖,提升LLM个性化效果。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20835 2026-04-23 cs.CL 91%

Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL

并行SFT:改进代码RL的零样本跨编程语言转移

Zhaofeng Wu, Shiqi Wang, Boya Peng, Anuj Goyal, Melanie Kambadur, Sebastian Ruder, Yoon Kim, Chloe Bi

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出零样本跨编程语言转移任务,通过并行SFT策略提升代码RL在不同语言间的迁移能力,发现通用化SFT初始化能提升模型泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15153 2026-04-23 cs.CL cs.AI 91%

Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models

在潜在嵌入空间中压缩序列:大型语言模型的K-标记合并

Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

机构 * Rutgers University(罗格斯大学) AWS AI Labs(AWS人工智能实验室) Amazon(亚马逊) Mistral AI University of California Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出K-Token Merging方法,在潜在空间中压缩序列,通过轻量编码器合并连续K个标记嵌入,实现75%的输入长度缩减,性能损失小。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20148 2026-04-23 cs.CL cs.AI cs.LG 90%

Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models

元工具:用于小语言模型的高效少样本工具适应

Sachin Kumar

机构 * LexisNexis, USA(LexisNexis美国公司)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Meta-Tool研究小语言模型是否能在不复杂适应机制下实现强工具使用性能,发现超网络适应无显著提升,提示应关注提示工程与示例整理。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07050 2026-04-23 cs.IR cs.AI cs.CL cs.LG 88%

ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability

ReasonRank: 通过强推理能力增强文档排序

Wenhan Liu, Xinyu Ma, Weiwei Sun, Yutao Zhu, Yuchen Li, Dawei Yin, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 分校) Baidu Inc., Beijing, China(百度公司,北京,中国) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ReasonRank,通过自动化生成推理密集型训练数据和两阶段训练方法,提升文档排序性能,实验表明其优于现有基线并具有更低延迟。

Comments 25 pages, accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10960 2026-04-23 cs.AI 84%

RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval Generation

RAG-KT: 跨平台可解释知识追踪的多视图融合检索生成

Zhiyi Duan, Hongyu Yuan, Rui Liu

机构 * Inner Mongolia University(内蒙古大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RAG-KT通过多视图融合检索生成技术,解决传统知识追踪模型在跨平台迁移和解释性上的不足,提升准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20473 2026-04-23 cs.CV 80%

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 78%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20720 2026-04-23 cs.LG cs.AI cs.CL 75%

COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling

COMPASS:持续多语言PEFT与自适应语义采样

Noah Flynn

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COMPASS通过自适应语义采样策略,利用参数高效微调方法,在多语言任务中提升模型性能,减少跨语言干扰,实现持续学习框架以适应动态环境。

Journal ref Transactions on Machine Learning Research, 2025, https://openreview.net/forum?id=oapsbIO1Bd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20511 2026-04-23 cs.LG cs.AI cs.CL cs.CV cs.CY 75%

CHASM: Unveiling Covert Advertisements on Chinese Social Media

CHASM:揭示中国社交媒体上的隐蔽广告

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CHASM数据集,用于评估多模态大语言模型在检测社交媒体隐蔽广告的能力,揭示当前模型在识别隐蔽广告中的不足及改进方向。

Comments NeuIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03396 2026-04-23 cs.CL 74%

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

打破助手模式:在基于大语言模型的程序化角色生成中建模行为变异

Maan Qraitem, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 本文提出PersonaWeaver框架,通过解耦世界观构建与行为构建,生成更具多样性和戏剧张力的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏