arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 328 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 34 篇

2604.12148 2026-04-15 cs.CV 87%

ViLL-E: Video LLM Embeddings for Retrieval

ViLL-E:用于检索的视频大语言模型嵌入

Rohit Gupta, Jayakrishnan Unnikrishnan, Fan Fei, Sheng Liu, Son Tran, Mubarak Shah

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ViLL-E通过引入新的嵌入生成机制,提升复杂视频处理能力,在视频检索和时间定位任务中表现优异,同时在视频问答任务中保持竞争力。

Comments Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12640 2026-04-15 cs.SE 86%

LLMs Are Not a Silver Bullet: A Case Study on Software Fairness

LLMs并非银弹:软件公平性的一项案例研究

Xinyue Li, Sixuan Li, Ying Xiao, Jie M. Zhang, Zhou Yang, Xuanzhe Liu, Zhenpeng Chen

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过对比传统机器学习与大语言模型在软件公平性中的表现,发现传统方法在公平性和预测性能上均优于LLM,指出LLM在现实数据中效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 85%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12479 2026-04-15 cs.CL 84%

Meet Dynamic Individual Preferences: Resolving Conflicting Human Value with Paired Fine-Tuning

面对动态个体偏好:通过配对微调解决冲突的人类价值观

Shanyong Wang, Shuhang Lin, Yining Zhao, Xi Zhu, Yongfeng Zhang

机构 * Rutgers University—New Brunswick(罗杰斯大学—新布伦斯维克分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Preference-Paired Fine-Tuning框架,通过Value Conflict Dilemma数据集解决动态个体偏好冲突问题,实验显示其在多选分类和开放生成任务中表现优异,优于传统方法。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15467 2026-04-15 cs.CL cs.AI 84%

Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning

联合回溯适应用于抗遗忘的指令微调

Yukun Zhao, Lingyong Yan, Zhenyang Li, Shuaiqiang Wang, Zhumin Chen, Zhaochun Ren, Dawei Yin

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出联合回溯适应方法,通过引入旧任务的有限提示来缓解增量学习中的灾难性遗忘问题,提升模型在新任务上的泛化能力。

Comments The experimental setting is wrong, i.e., not a real continual learning setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11867 2026-04-15 cs.LG cs.AI 82%

Disposition Distillation at Small Scale: A Three-Arc Negative Result

小规模下的行为蒸馏:一个三弧否定结果

Hari Sadasivan

机构 * Tinman Lab(Tinman实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究尝试通过四阶段MIT蒸馏流程在小语言模型中训练行为倾向,但发现无操作能改变倾向而不损害内容或导致模仿。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12666 2026-04-15 cs.LG cs.CL cs.HC 79%

From Imitation to Discrimination: Progressive Curriculum Learning for Robust Web Navigation

从模仿到鉴别:面向鲁棒网络导航的渐进课程学习

Chuang Peng, Wei Zhang, Renshuai Tao, Xinhao Zhang, Jian Yang

机构 * Beijing Jiaotong University(北京交通大学) Beihang University(北京航空航天大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Triton数据集和渐进训练课程,通过结构-语义硬负样本挖掘和双代理共识流程构建,提升网络导航中对复杂页面的鉴别能力与泛化能力,最终在Mind2Web上验证了专用数据课程优于单纯参数规模的优势。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25843 2026-04-15 cs.AI 77%

ASGuard: Activation-Scaling Guard to Mitigate Targeted Jailbreaking Attack

ASGuard:激活-缩放防护:缓解针对性劫持攻击

Yein Park, Jungwoo Park, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASGuard框架,通过电路分析识别与针对性劫持相关的注意力头,训练通道缩放向量重新校准激活,结合预防性微调提升模型拒绝能力,有效降低攻击成功率并保持模型性能。

Comments ICLR 2026, 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11841 2026-04-15 cs.LG cs.AI 73%

Polynomial Expansion Rank Adaptation: Enhancing Low-Rank Fine-Tuning with High-Order Interactions

多项式展开秩适应:通过高阶交互增强低秩微调

Wenhao Zhang, Lin Mu, Li Ni, Peiquan Jin, Yiwen Zhang

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PERA方法,通过在低秩因子空间中引入结构化多项式展开,提升低秩微调的表达能力,实验证明其在多种基准上表现优异。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11838 2026-04-15 cs.LG cs.AI 73%

A Layer-wise Analysis of Supervised Fine-Tuning

对监督微调的分层分析

Qinghua Zhao, Xueling Gong, Xinyu Chen, Zhongfeng Kang, Xinlu Li

机构 * Hefei University(合肥大学) Lanzhou University(兰州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过信息论、几何和优化指标分析模型规模,揭示了中间层稳定而顶层敏感的分层特性,并提出Mid-Block Efficient Tuning方法,在GSM8K数据集上优于LoRA,证明有效对齐是局部而非分布的。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13789 2026-04-15 cs.CR cs.AI 70%

Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks

揭示并对齐异常注意力头以防御NLP后门攻击

Haotian Jin, Yang Li, Haihui Fan, Lin Shen, Xiangfang Li, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于注意力相似性的后门检测方法,通过检测异常注意力头相似性来防御后门攻击,结合头部微调修复污染的注意力头,有效降低攻击成功率并保持下游任务性能。

Journal ref "Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19134 2026-04-15 cs.GT cs.LG stat.ML 70%

Incentivizing High-Quality Human Annotations with Golden Questions

通过黄金问题激励高质量的人工标注

Shang Liu, Zhongze Cai, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School(帝国理工学院商学院) Imperial College London(帝国理工学院伦敦分校) Meta

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何通过黄金问题激励标注者产生高质量数据,提出基于主代理模型的激励机制,并通过实验验证黄金问题在标注性能监控中的有效性。

Comments Corrected bugs in the proofs by specifying a further assumption. arXiv admin note: text overlap with arXiv:2502.06387

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00655 2026-04-15 cs.CV 67%

Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding

Mema:增强视觉-语言理解的内存增强适配器

Ying Liu, Yudong Han, Kean Shi, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Yangtze Delta Region Academy of Beijing Institude of Technology(北京理工大学长江三角洲地区研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Mema适配器,通过维护状态记忆积累层次视觉表示,提升多模态理解性能,实验验证其在复杂任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12309 2026-04-15 cs.CV 67%

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

专题命中 指令微调 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19820 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception

CropVLM: 为细粒度视觉语言感知学习动态聚焦

Miguel Carvalho, Helder Dias, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CropVLM通过强化学习提升VLM在细粒度图像理解任务中的性能,无需人工标注或合成数据,有效增强模型对细节的捕捉能力。

Comments Accepted to the GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13961 2026-04-15 cs.CL cs.LG 62%

Olmo 3

Olmo 3:先进全开源语言模型家族

Team Olmo, :, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groeneveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Soldaini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Maryland(马里兰大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 Olmo 3是一款7B和32B参数规模的先进语言模型,专注于长上下文推理、函数调用、编程、指令遵循、通用聊天和知识回忆。

Comments minor edit updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14420 2026-04-15 cs.CL cs.AI 62%

Instructions are all you need: Self-supervised Reinforcement Learning for Instruction Following

指令即一切:用于指令遵循的自监督强化学习

Qingyu Ren, Qianyu He, Powei Chang, Jie Zeng, Zeye Sun, Fei Yu, Jiaqing Liang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(上海数据科学 key laboratory,复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需外部监督的自监督强化学习框架,通过直接从指令中生成奖励信号和伪标签来解决多约束任务中稀疏奖励问题,实验表明其在多个领域数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12834 2026-04-15 eess.SP cs.CR cs.LG 57%

Rapid LoRA Aggregation for Wireless Channel Adaptation in Open-Set Radio Frequency Fingerprinting

无线频道适应中开放集射频指纹的快速LoRA聚合

Mingxi Zhang, Renjie Xie, Jincheng Wang, Guyue Li, Wei Xu

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) National Mobile Communications Research Lab, Southeast University(东南大学国家移动通信研究中心)

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种轻量自适应射频指纹提取框架,利用LoRA实现快速适应未知设备和变化信道条件,实验显示在动态无线车用网络中提升识别率并降低训练时间。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12160 2026-04-15 cs.LG 57%

PubSwap: Public-Data Off-Policy Coordination for Federated RLVR

PubSwap: 基于公共数据的联邦强化学习与验证奖励的协同训练

Anupam Nayak, Baris Askin, Muhammed Ustaomeroglu, Carlee Joe-Wong, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 本文提出PubSwap框架,结合LoRA本地适应与公共数据的off-policy步骤,提升联邦RLVR的通信效率和跨客户端协调。通过小规模公共数据集周期性交换响应级训练信号,实现轻量级全局对齐目标。方法在数学和医疗推理基准上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 50%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12307 2026-04-15 cs.CV 50%

Boosting Robust AIGI Detection with LoRA-based Pairwise Training

通过LoRA基于的配对训练提升鲁棒性AIGI检测

Ruiyang Xia, Qi Zhang, Yaowen Xu, Zhaofan Zou, Hao Sun, Zhongjiang He, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出基于LoRA的配对训练策略,通过针对性微调视觉基础模型和模拟数据分布,提升AIGI在严重失真下的检测性能,实验在NTIRE挑战中取得第三名。

Comments 3th place (3/514) technical report(CVPRW-26) at the NTIRE 2026: Robust AI-Generated Image Detection in the Wild Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2512.19728 2026-04-15 cs.LG 95%

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);small language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 85%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09780 2026-04-15 cs.LG 84%

Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO

向小偷致敬:探索去中心化GRPO中的攻击与防御

Nikolay Blagoev, Oğuzhan Ersoy, Lydia Yiyu Chen

机构 * Gensyn Université de Neuchâtel(Neuchâtel大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究去中心化GRPO的鲁棒性,提出首个对抗攻击及防御措施,通过恶意节点污染良性模型,展示攻击成功率可达100%,并提出两种防御机制以减轻攻击影响。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 83%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25758 2026-04-15 cs.AI 77%

Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training

思考火花!:推理模型后训练期间的涌现注意力头

Yein Park, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(韩国大学) Upstage AI AIGEN Sciences(AIGEN 科技)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 研究探讨了后训练技术如何通过涌现的注意力头提升推理能力,分析不同训练方法对注意力头演化的影响,并揭示了复杂推理与基础计算之间的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI 70%

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 67%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12163 2026-04-15 cs.CV 67%

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image:稀疏MoE用于图像生成

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

机构 * Nucleus AI Team(Nucleus AI 团队)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 18 篇

2409.06679 2026-04-15 cs.CL 90%

E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning

E2LLM:用于长上下文理解与推理的编码器扩展大语言模型

Zihan Liao, Jun Wang, Hang Yu, Lingxiao Wei, Jianguo Li, Jun Wang, Wei Zhang

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出E2LLM,通过分块压缩和适配器对齐,解决长上下文处理中的性能、效率与兼容性难题,在文档摘要和问答任务中优于现有方法。

Comments Accept by EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏