arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10296
2506.05412 2026-06-02 cs.CV cs.CL

Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues

视觉-语言模型将头部方向误认为注视方向:非语言对话线索

Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Emory University(埃默里大学) Johns Hopkins University(约翰霍普金斯大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC San Diego(圣地亚哥大学)

AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。

Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11423 2026-06-02 cs.SI cs.CL

Beyond the Crowd: LLM-Augmented Community Notes for Governing Health Misinformation

超越众包:基于LLM增强的社区笔记治理健康错误信息

Jiaying Wu, Zihang Fu, Haonan Wang, Fanxiao Li, Jiafeng Guo, Preslav Nakov, Min-Yen Kan

机构 * National University of Singapore(新加坡国立大学) Yunnan University(云南大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 针对X平台社区笔记在健康错误信息治理中延迟高的问题,提出CrowdNotes+框架,通过LLM增强笔记生成与评估,显著提升正确性、有用性和证据效用。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14750 2026-06-02 cs.CL cs.CV

Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning

Render-of-Thought: 将文本思维链渲染为图像以进行视觉潜在推理

Yifan Wang, Shiyu Li, Peiming Li, Xiaochen Yang, Yang Tang, Zheng Wei

机构 * Tencent BAC(腾讯BAC) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Mathematics and Statistics, University of Glasgow(格拉斯哥大学数学与统计学学院)

AI总结 提出Render-of-Thought框架,通过将思维链的文本步骤渲染为图像,利用视觉语言模型的视觉编码器进行语义对齐,实现3-4倍令牌压缩和推理加速,同时保持竞争性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05179 2026-06-02 cs.CL

From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations

从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释

Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha

机构 * TCS Research(TCS研究) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布) University of Innsbruck(因斯布鲁克大学)

AI总结 针对印地语等低资源语言的虚假信息检测,提出一种结合直接偏好优化(DPO)与课程学习的框架,通过引入“实际性”和“精炼度”参数优化解释质量,实验验证了生成连贯、相关解释的有效性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10788 2026-06-02 cs.CL cs.AI

TInR: Exploring Tool-Internalized Reasoning in Large Language Models

TInR:探索大语言模型中的工具内化推理

Qiancheng Xu, Yongqi Li, Fan Liu, Hongru Wang, Min Yang, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Southeast University(东南大学) University of Edinburgh(爱丁堡大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出TInR-U框架,通过工具内化、监督微调和强化学习三阶段训练,使LLM无需外部文档即可进行工具集成推理,在域内和域外设置中均取得优越性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19496 2026-06-02 cs.CV cs.AI cs.LG

CARES: Context-Aware Resolution Selector for VLMs

CARES: 面向视觉语言模型的上下文感知分辨率选择器

Moshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz

机构 * Technion(技术ion大学) IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Ben-Gurion University(本· Gurion大学)

AI总结 提出CARES轻量级预处理模块,通过紧凑型VLM预测图像-查询对的最小足够分辨率,在保持任务性能的同时最多减少80%计算量。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) Accepted to ACL 2026 (Oral presentation). Code available at https://github.com/mkimhi/CARES

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09566 2026-06-02 cs.CV cs.AI

Hot-Start Chinese Language Modeling:Visual Glyphs Accelerate Sample-Efficient Learning

热启动中文语言建模:视觉字形加速样本高效学习

Shuyang Xiang, Hao Guan

机构 * Independent Researcher(独立研究者) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文通过将汉字渲染为视觉字形图像,研究其对字符级语言建模的归纳偏置,发现视觉输入产生显著的热启动效应,但最终精度与基于索引的方法一致。

Comments 15 pages, 5 figures, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09730 2026-06-02 cs.CL cs.LG

Interpreto: An Explainability Library for Transformers

Interpreto:一个用于Transformer的可解释性库

Antonin Poché, Thomas Mullor, Gabriele Sarti, Frédéric Boisnard, Corentin Friedrich, Charlotte Claye, François Hoofd, Raphael Bernas, Nicholas Asher, Céline Hudelot, Fanny Jourdan

机构 * IRT Saint Exupéry Toulouse(伊尔杜夫圣埃克苏佩里图卢斯) IRIT Toulouse(图卢兹IRIT) Khoury College of Computer Sciences(科赫里计算机科学学院) Ampere(阿姆佩尔) MICS, CentraleSupélec(MICS,中央超导学院) Scienta Lab(科学实验室) Thales Avionics(泰勒斯航空电子) ANITI

AI总结 Interpreto是一个开源Python库,通过归因方法和基于概念的解释,为HuggingFace语言模型(从早期BERT变体到LLM)提供统一的解释工作流,其端到端基于概念的流水线是主要创新。

Comments Accepted to ACL 2026 System Demonstration. Equal contribution: Poché and Jourdan

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21444 2026-06-02 cs.CV cs.AI cs.CL

APB-V: Accelerating Long-Video Understanding via Sequence-Parallelism-aware Approximate Attention

APB-V: 通过序列并行感知的近似注意力加速长视频理解

Yuxiang Huang, Mingye Li, Xu Han, Chaojun Xiao, Weilin Zhao, Ao Sun, Ziqi Yuan, Hao Zhou, Fandong Meng, Zhiyuan Liu

机构 * NLP Group, DCST, IAI, BNRIST, Tsinghua University, Beijing, China(清华大学北京校区自然语言处理组、国防科技大学、人工智能研究院、北京理工大学、清华大学) Department of CS&T, Central South University, Changsha, China(中南大学计算机与技术系,长沙,中国) BUPT, Beijing, China(北京邮电大学,北京,中国) Pattern Recognition Center, WeChat AI, Tencent Inc.(腾讯公司微信人工智能研究院)

AI总结 提出APB-V,一种序列并行框架,通过分布式近似注意力在多GPU上加速长视频推理,显著提升速度且不损失性能。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14224 2026-06-02 cs.IR

Rerank Before You Reason: Analyzing Reranking Tradeoffs through Effective Token Cost in Deep Search Agents

推理前先重排:通过深度搜索代理中的有效令牌成本分析重排权衡

Sahel Sharifymoghaddam, Jimmy Lin

AI总结 研究在深度搜索管道中如何分配推理预算,通过引入有效令牌成本(ETC)指标,分析列表式重排在模型规模、推理努力、重排深度与总令牌成本之间的权衡,发现适度重排能以更低成本达到与增加搜索时推理相当的准确性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09696 2026-06-02 cs.CL

Empathy Applicability Modeling for General Health Queries

通用健康查询的共情适用性建模

Shan Randhawa, Agha Ali Raza, Kentaro Toyama, Julie Hui, Mustafa Naseem

机构 * University of Michigan(密歇根大学) Lahore University of Management Sciences(拉合尔管理科学大学)

AI总结 提出共情适用性框架(EAF),基于临床、语境和语言线索对患者查询的情感反应和解释适用性进行分类,以支持异步医疗中的共情沟通。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03615 2026-06-02 cs.CL cs.SD eess.AS

SARA: Stress Test Reasoning in Audio Deepfake Detection

SARA: 音频深度伪造检测中的压力测试推理

Binh Nguyen, Charles Fleming, Thai Le

机构 * Indiana University(印第安纳大学) Cisco Research(思科研究)

AI总结 提出SARA框架,通过声学感知、推理-判决一致性与不和谐三个维度评估音频语言模型在对抗攻击下的推理可靠性,发现声学攻击降低一致性而语言攻击保持一致性但成功率更高,且推理轨迹的文本一致性可作为检测对抗样本的潜在指标。

Comments Preprint for ACL 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17320 2026-06-02 cs.LG

AdaptiveK: Complexity-Driven Sparse Autoencoders for Interpretable Language Model Representations

AdaptiveK:基于复杂度的稀疏自编码器用于可解释的语言模型表示

Yifei Yao, Hanrong Zhang, Mengnan Du

机构 * Zhejiang University(浙江大学) University of Illinois Chicago(伊利诺伊大学香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出 AdaptiveK SAE,根据输入语义复杂度动态调整稀疏度,利用线性探针引导特征分配,在重构保真度、解释方差、余弦相似度和可解释性指标上优于固定稀疏度方法。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19489 2026-06-02 cs.AI cs.SE

Taming System Complexity: Demystifying Software Engineering Agents in Diagnosing Linux Kernel Faults

驯服系统复杂性:揭秘软件工程代理在诊断Linux内核故障中的作用

Zhenhao Zhou, Zhuochen Huang, Yike He, Chong Wang, Jiajun Wang, Yijian Wu, Xin Peng, Yiling Lou

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 针对Linux内核故障定位挑战,提出LinuxFLBench基准和LinuxFL$^+$增强框架,将现有LLM代理的文件级top-1准确率从41.6%提升7.2%-11.2%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01374 2026-06-02 cs.CL

Bridging the Gap: Transfer Learning from English PLMs to Malaysian English

弥合差距:从英语PLM到马来西亚英语的迁移学习

Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院)

AI总结 针对马来西亚英语的低资源克里奥尔语特性,通过微调预训练语言模型MENmBERT和MENBERT,在命名实体识别和关系抽取任务上分别提升1.52%和26.27%的性能。

Comments Accepted in 9th Workshop on Representation Learning for NLP (Rep4NLP) at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30965 2026-06-01 eess.AS cs.AI cs.CL

ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment

ImmersiveTTS:基于多模态扩散Transformer和领域特定表示对齐的环境感知文本转语音

Jun-Hak Yun, Seung-Bin Kim, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

AI总结 提出ImmersiveTTS模型,通过多模态扩散Transformer和领域特定表示对齐,实现与环境音频自然融合的文本到语音生成。

Comments Accepted to ACL 2026 main conference. Code is available at https://github.com/jjunak-yun/ImmersiveTTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30790 2026-06-01 cs.IR cs.AI cs.CL

On the impact of retrieved content representations in RAG Pipelines

关于检索内容表示对RAG管道的影响

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

机构 * The University of Queensland(昆士兰大学) CSIRO(澳大利亚联邦科学与工业研究组织)

AI总结 通过控制变量实验,研究检索文档的不同表示(选择、摘要、改写等)对RAG生成准确性的影响,发现答案保留是主要决定因素。

Comments 23 pages, 15 figures, submitted to ACL May 2026 ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17101 2026-06-01 cs.CL cs.AI

SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical Reasoning

SEMA-RAG: 面向医学推理的自演化多智能体检索增强生成框架

Yongfeng Huang, Ruiying Chen, James Cheng

机构 * CSE, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Wuhan University of Technology(武汉理工大学)

AI总结 针对医学问答中单轮静态检索与临床推理多阶段过程不匹配的问题,提出SEMA-RAG框架,通过任务解耦和动态多轮探索,由三个专业智能体分别负责临床解释、自演化检索和证据裁决,在多个基准上平均提升准确率6.46个百分点。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13069 2026-06-01 cs.LG cs.CL

Memory-Efficient Structured Backpropagation for On-Device LLM Fine-Tuning

面向设备上大语言模型微调的内存高效结构化反向传播

Juneyoung Park, Yuri Hong, Seongwan Kim, Jaeho Lee

机构 * OptAI Inc.(OptAI公司)

AI总结 提出MeSP方法,通过手动推导利用LoRA低秩结构的反向传播,在计算数学等价梯度的同时平均减少49%内存,使内存受限设备上的微调成为可能。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19936 2026-06-01 cs.LG cs.AI cs.CL

Gap-K%: Measuring Top-1 Prediction Gap for Detecting Pretraining Data

Gap-K%: 通过测量 Top-1 预测差距检测预训练数据

Minseo Kwak, Jaehyung Kim

机构 * Yonsei University(延世大学)

AI总结 提出 Gap-K% 方法,利用 LLM 的 top-1 预测与目标 token 的对数概率差距及滑动窗口策略,在 WikiMIA 和 MIMIR 基准上实现预训练数据检测的最优性能。

Comments ACL 2026 Main Conference; 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12119 2026-06-01 cs.CV cs.AI cs.CL

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to ACL 2026 and selected for the Best Paper list; later desk-rejected due to an inadvertent manual bibliography-editing error. Previous versions are withdrawn due to an inadvertent manual bibliography-editing error; please refer to the latest corrected version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06453 2026-06-01 cs.AI

ConSensus: Multi-Agent Collaboration for Multimodal Sensing

ConSensus:面向多模态感知的多智能体协作

Hyungjun Yoon, Mohammad Malekzadeh, Sung-Ju Lee, Fahim Kawsar, Lorena Qendro

机构 * KAIST(韩国科学技术院) Nokia Bell Labs(诺基亚贝尔实验室) University of Glasgow(格拉斯哥大学)

AI总结 提出ConSensus,一种无需训练的多智能体协作框架,通过将多模态感知任务分解为专用智能体并采用混合融合机制,在五个基准上平均准确率提升7.1%,融合token成本降低12.7倍。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05846 2026-06-01 cs.CL cs.AI

EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context

EMCEE:通过提取合成多语言上下文桥接知识与推理以提升大语言模型的多语言能力

Hamin Koo, Jaehyung Kim

机构 * Yonsei University(延世大学)

AI总结 提出EMCEE框架,通过从LLM自身提取并融合语言特定知识,结合推理输出,显著提升多语言任务性能,尤其在低资源语言上平均提升31.7%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12851 2026-06-01 cs.CL cs.AI

MeMo: Towards Language Models with Associative Memory Mechanisms

MeMo:迈向具有联想记忆机制的语言模型

Fabio Massimo Zanzotto, Elena Sofia Ruzzetti, Giancarlo A. Xompero, Leonardo Ranaldi, Davide Venditti, Federico Ranaldi, Cristina Giannone, Andrea Favalli, Raniero Romagnoli

机构 * Human-centric ART, University of Rome Tor Vergata(人文导向的ART,罗马大学Tor Vergata) University of Edinburgh(爱丁堡大学) Almawave S.p.A.(Almawave公司)

AI总结 提出MeMo架构,通过分层联想记忆直接记忆文本,实现透明化和模型编辑,实验证明单层和多层配置的记忆能力。

Journal ref Proceedings of Association for Computational Linguistics (Findings), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22934 2026-06-01 cs.CL cs.AI cs.LG

Unraveling LoRA Interference: Orthogonal Subspaces for Robust Model Merging

解开LoRA干扰:用于鲁棒模型合并的正交子空间

Haobo Zhang, Jiayu Zhou

机构 * University of Michigan Ann Arbor(密歇根大学安娜堡分校)

AI总结 针对LoRA微调模型合并时性能下降的问题,提出通过微调前约束LoRA子空间正交性来减少任务间干扰的方法OSRM,可无缝集成现有合并算法,提升合并性能并保持单任务准确率。

Comments 14 pages, 5 figures, 16 tables, accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11972 2026-06-01 cs.CL

Reassessing Extractive QA Datasets at Scale: LLM-as-a-Judge and In-Depth Analyses

重新评估大规模抽取式问答数据集:LLM作为评判者与深入分析

Xanh Ho, Jiahao Huang, Florian Boudin, Akiko Aizawa

机构 * National Institute of Informatics, Japan(日本国立信息研究所) The University of Tokyo, Japan(东京大学) Inria, LS2N, Nantes Université, France(法国Inria、LS2N、南特大学)

AI总结 本研究系统性地使用LLM作为评判者评估四个抽取式问答数据集,发现其与人类评价的相关性远高于EM和F1,并分析了答案类型敏感性、提示变化和自偏好偏差等因素。

Comments GEM Workshop at ACL 2026; code and data are available at https://github.com/Alab-NII/llm-judge-extract-qa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30348 2026-05-29 cs.CL cs.AI cs.LG

LLMSurgeon: Diagnosing Data Mixture of Large Language Models

LLMSurgeon: 诊断大型语言模型的数据混合

Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen

机构 * VILA Lab, MBZUAI(VILA实验室,MBZUAI) UCL

AI总结 提出LLMSurgeon框架,通过逆问题方法从目标LLM生成文本中估计预训练语料的领域分布,实现无需训练数据的后验审计。

Comments ACL 2026 Main. Code at https://github.com/Yaxin9Luo/LLMSurgeon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30334 2026-05-29 cs.AI cs.CL

Demystifying Data Organization for Enhanced LLM Training

揭秘数据组织以增强大语言模型训练

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文系统探索数据组织对大语言模型训练的影响,提出边界锐化、循环调度、课程连续性和局部多样性四项优化准则,并基于此设计了两种新的数据排序方法STR和SAW,实验验证了其在预训练和微调阶段的有效性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏