arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12365 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2605.06663 2026-05-12 cs.CL 85%

EMO: Pretraining Mixture of Experts for Emergent Modularity

EMO:用于涌现模块化的专家混合预训练

Ryan Wang, Akshita Bhagia, Sewon Min

机构 * University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06522 2026-05-08 cs.LG cs.CV 85%

Agentic AIs Are the Missing Paradigm for Out-of-Distribution Generalization in Foundation Models

代理AI是基础模型在分布外泛化中的缺失范式

Xin Wang, Haibo Chen, Wenxuan Liu, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15706 2026-04-20 cs.CL 85%

Target-Oriented Pretraining Data Selection via Neuron-Activated Graph

基于神经激活图的目标导向预训练数据选择

Zijun Wang, Haoqin Tu, Weidong Zhou, Yiyang Zhou, Xiaohuan Zhou, Bingni Zhang, Weiguo Feng, Taifeng Wang, Cihang Xie, Fengze Liu

机构 * ByteDance(字节跳动) UC Santa Cruz(加州大学圣克鲁兹分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于神经激活图的排名方法,通过选取高影响神经元构建NAG,提升目标导向预训练效果,实验显示在六个基准测试中平均提升4.9%,并在多目标设置中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17591 2026-04-17 cs.CL 85%

Lil-Bevo: Explorations of Strategies for Training Language Models in More Humanlike Ways

Lil-Bevo:探索以更人性化方式训练语言模型的策略

Venkata S Govindarajan, Juan Diego Rodriguez, Kaj Bostrom, Kyle Mahowald

机构 * Department of Linguistics(语言学系) Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出Lil-Bevo,通过音乐数据预训练、短序列先训练及特定token掩码等策略,探索更人性化的语言模型训练方法,但效果仍低于大模型。

Comments Proceedings of the BabyLM Challenge

Journal ref Proceedings of the BabyLM Challenge at the 27th Conference on Computational Natural Language Learning 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05663 2026-04-14 cs.AI 85%

CuraLight: Debate-Guided Data Curation for LLM-Centered Traffic Signal Control

CuraLight: 基于辩论引导的数据整理用于LLM中心的交通信号控制

Qing Guo, Xinhang Li, Junyu Chen, Zheng Guo, Shengzhe Xu, Lin Zhang, Lei Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Big Data Center(北京大数据中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CuraLight框架,通过强化学习代理生成高质量交互轨迹并结合多LLM辩论系统优化信号控制策略,实验显示在不同真实网络中优于现有方法,降低平均通行时间、排队长度和等待时间。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09377 2026-04-13 cs.CL 85%

Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios

具有多级任务-特征引导的数据合成的任务感知LLM路由用于冷启动场景

Hui Liu, Bin Zou, Kecheng Chen, Jie Liu, Wenya Wang, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TRouter,通过多级任务-特征引导的数据合成框架解决冷启动问题,提升LLM路由在冷启动和领域内设置下的性能。

Comments 30 pages, Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08510 2026-04-10 cs.CL 85%

What do Language Models Learn and When? The Implicit Curriculum Hypothesis

语言模型学习了什么以及何时?隐式课程假说

Emmy Liu, Kaiser Sun, Millicent Li, Isabelle Lee, Lindia Tjuatja, Jen-tse Huang, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Department of Computer Science, Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系、数据科学与人工智能研究所) Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究通过设计简单可组合任务,发现模型技能以可组合顺序出现,且在不同模型间一致,表明预训练过程具有结构性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19894 2026-04-08 cs.SE cs.AI 85%

TransAgent: Enhancing LLM-Based Code Translation via Fine-Grained Execution Alignment

TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译

Zhiqiang Yuan, Weitong Chen, Hanlin Wang, Xin Peng, Zhenpeng Chen, Yiling Lou

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00920 2026-04-02 cs.CL 85%

GPT-NL Public Corpus: A Permissively Licensed, Dutch-First Dataset for LLM Pre-training

GPT-NL公共语料库:一个许可宽松、以荷兰语为主的用于大语言模型预训练的数据集

Jesse van Oort, Frank Brinkkemper, Erik de Graaf, Bram Vanroy, Saskia Lensink

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文介绍了GPT-NL公共语料库,这是最大的许可宽松的荷兰语资源语料库,包含21个纯荷兰语集合,总计360亿个预处理荷兰语标记,以及来自现有数据集的英语、代码和德语/丹麦语标记,旨在为合法、有用且无害的语言模型创造提供支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00249 2026-04-02 cs.AI cs.MA 85%

A Safety-Aware Role-Orchestrated Multi-Agent LLM Framework for Behavioral Health Communication Simulation

一种安全意识导向的角色协调多智能体LLM框架用于行为健康沟通模拟

Ha Na Cho

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种安全导向的角色协调多智能体LLM框架,通过协调不同角色的智能体模拟支持性行为健康对话,通过分解对话责任并动态激活智能体以确保安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10102 2026-03-31 cs.LG 85%

PANTHER: Generative Pretraining Beyond Language for Sequential User Behavior Modeling

PANTHER:超越语言的生成预训练用于序列用户行为建模

Guilin Li, Yun Zhang, Xiuyuan Chen, Chengqi Li, Bo Wang, Linghe Kong, Wenjia Wang, Weiran Huang, Matthias Hwai Yong Tan

机构 * Shanghai Jiao Tong University(上海交通大学) WeChat Pay, Tencent(微信支付,腾讯) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PANTHER通过生成预训练方法,结合生成与判别模型,实现用户行为序列的高效建模,提升交易预测和欺诈检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG 85%

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22707 2026-03-30 cs.CL 85%

Detecting Non-Membership in LLM Training Data via Rank Correlations

通过排名相关性检测LLM训练数据中的非成员

Pranav Shetty, Mirazul Haque, Zhiqiang Ma, Xiaomo Liu

机构 * JPMorgan AI Research(摩根大通人工智能研究院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出PRISM方法,利用模型logits的排名相关性检测训练数据未被使用,有效排除训练数据中的成员身份,提升模型合规性验证。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15675 2026-03-30 cs.CL 85%

LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models

LLM-to-Speech: 一种用于训练方言文本到语音模型的合成数据管道

Ahmed Khaled Khamis, Hesham Ali

机构 * Georgia Institute of Technology(佐治亚理工学院) Nile University(尼罗大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出NileTTS数据集,通过LLM生成埃及阿拉伯语内容并合成语音,用于训练多语言TTS模型,填补了埃及阿拉伯语语音合成的研究空白。

Comments 8 pages, 2 figures, EACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14861 2026-03-27 q-bio.GN cs.AI q-bio.QM 85%

BMFM-RNA: whole-cell expression decoding improves transcriptomic foundation models

BMFM-RNA:全细胞表达解码改进转录组基础模型

Michael M. Danziger, Bharath Dandala, Viatcheslav Gurev, Matthew Madgwick, Sivan Ravid, Tim Rumbell, Akira Koseki, Tal Kozlovski, Ching-Huei Tsou, Ella Barkan, Tanwi Biswas, Jielin Xu, Yishai Shimoni, Jianying Hu, Michal Rosen-Zvi

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 通过全细胞表达解码方法,改进转录组基础模型,在下游任务中表现优于掩码语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23421 2026-03-25 econ.GN cs.AI q-fin.EC 85%

Quantifying Systemic Vulnerability in the Foundation Model Industry

量化基础模型行业的系统性脆弱性

Claudio Pirrone, Stefano Fricano, Gioacchino Fazio

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AIIVI指数,基于O-Ring理论量化基础模型行业脆弱性,发现计算基础设施和能源系统是主要约束因素,揭示了行业在数据透明度低和技术快速演变下的极端脆弱性。

Comments Conference Paper - SIEPI (29-30 January 2026) - Bari

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03385 2026-03-24 cs.LG math.PR 85%

SIGMA: Scalable Spectral Insights for LLM Model Collapse

SIGMA:用于LLM模型崩溃的可扩展频谱洞察

Yi Gu, Lingyou Pang, Xiangkun Ye, Tianyu Wang, Jianyu Lin, Carey E. Priebe, Alexander Aue

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计学系) Department of Mathematics, Northwestern University(西北大学数学系) Boston University(波士顿大学) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出SIGMA框架,通过频谱分析嵌入Gram矩阵来检测LLM模型崩溃,提供数学基础的度量方法,并实现大规模模型的可扩展监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18855 2026-03-20 cs.IT cs.LG cs.SY eess.SP eess.SY math.IT 85%

BeamAgent: LLM-Aided MIMO Beamforming with Decoupled Intent Parsing and Alternating Optimization for Joint Site Selection and Precoding

BeamAgent:基于解耦意图解析和交替优化的LLM辅助MIMO波束成形

Xiucheng Wang, Yue Zhang, Nan Cheng

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出BeamAgent框架,通过解耦语义意图解析与数值优化,结合交替优化算法解决基站选址与预编码设计问题,实现高效波束成形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16148 2026-03-18 cs.AI 85%

NeuronSpark: A Spiking Neural Network Language Model with Selective State Space Dynamics

NeuronSpark:一种具有选择性状态空间动态的脉冲神经网络语言模型

Zhengzheng Tang

机构 * Boston University(波士顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);SFT(abstract);分类 cs.AI

AI总结 NeuronSpark是一种基于脉冲神经网络的大型语言模型,通过选择性状态空间动态和多种优化技术,在无Transformer蒸馏的情况下实现大规模语言建模。

Comments 10 pages, 6 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 85%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14430 2026-03-17 cs.CL 85%

Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese Literature

创新融合还是模仿?LLM生成中文文学中的题材特异性同质性

Yuanchi Ma, Kaize Shi, Hui He, Zhihua Zhang, Zhongxiang Lei, Ziliang Qiu, Renfen Hu, Jiamou Liu

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过引入普罗普叙事学理论,分析LLM生成的中文网络文学叙事结构,揭示其同质化原因,定义34种现代网络叙事功能并构建标注语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08220 2026-03-11 cs.CL 85%

Pretraining with Token-Level Adaptive Latent Chain-of-Thought

基于令牌级适应性潜在链式思维的预训练

Boyi Zeng, Yiqin Hao, He Li, Shixiang Song, Feichen Song, Zitong Wang, Siyuan Huang, Yi Xu, ZiWei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Al Laboratory(上海Al实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出了一种基于令牌级适应性潜在链式思维的预训练方法,通过内部化潜在链式思维来提高模型性能,减少计算成本,并在语言建模和下游任务中取得显著改进。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05684 2026-03-04 cs.AI cs.CV cs.RO 85%

D2E: Scaling Vision-Action Pretraining on Desktop Data for Transfer to Embodied AI

D2E:在桌面数据上扩展视觉-动作预训练以迁移到具身AI

Suhwan Choi, Jaeyoon Jung, Haebin Seong, Minchan Kim, Minyeong Kim, Yongjun Cho, Yoonshik Kim, Yubeen Park, Youngjae Yu, Yunsung Lee

机构 * Stanford University(斯坦福大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 D2E通过桌面数据预训练,实现了具身AI任务的有效迁移,其框架包含三个组件,展示了在物理操作和导航任务中的高性能表现。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12927 2026-02-25 cs.CL 85%

SEFL: A Framework for Generating Synthetic Educational Assignment Feedback with LLM Agents

SEFL:一种生成合成教育作业反馈的框架

Mike Zhang, Amalie Pernille Dilling, Léon Gondelman, Niels Erik Ruan Lyngdorf, Euan D. Lindsay, Johannes Bjerva

机构 * University of Copenhagen, Denmark(哥本哈根大学) Aalborg University, Denmark(奥尔堡大学) Pioneer Centre for AI, Denmark(AI先锋中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEFL通过合成数据框架生成高质量教育作业反馈,提升反馈质量与效率,适用于高等教育领域。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16687 2026-02-19 cs.SD cs.CL eess.AS 85%

Scaling Open Discrete Audio Foundation Models with Interleaved Semantic, Acoustic, and Text Tokens

通过交错语义、音频和文本标记扩展开放离散音频基础模型

Potsawee Manakul, Woody Haosheng Gan, Martijn Bartelds, Guangzhi Sun, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SODA模型,通过交错语义、音频和文本标记扩展开放离散音频基础模型,实现通用音频生成和跨模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19117 2026-02-18 cs.CL 85%

Stop saying LLM: Large Discourse Models (LDM) and Artificial Discursive Agent (ADA)?

不要再说大语言模型:大型话语模型(LDM)和人工话语代理(ADA)?

Amar Lakel

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出用大型话语模型和人工话语代理替代传统的大语言模型,通过认识论转变探讨话语代理在社会中的治理与共治作用。

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08592 2026-02-10 cs.LG 85%

TFMLinker: Universal Link Predictor by Graph In-Context Learning with Tabular Foundation Models

TFMLinker:通过基于图的上下文学习进行通用链接预测的通用链接预测器

Tianyin Liao, Chunyu Hu, Yicheng Sui, Xingxuan Zhang, Peng Cui, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Beihang University(北航)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TFMLinker通过表格基础模型的上下文学习能力,在不同图上进行通用链接预测,无需数据集特定微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06183 2026-02-09 cs.LG 85%

To 2:4 Sparsity and Beyond: Neuron-level Activation Function to Accelerate LLM Pre-Training

迈向2:4稀疏性:神经元层面激活函数加速LLM预训练

Meghana Madhyastha, Daniel Haziza, Jesse Cai, Newsha Ardalani, Zhiqi Bu, Carole-Jean Wu

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过神经元层面的激活函数稀疏性技术,加速LLM预训练,提升训练效率1.4-1.7倍,适用于NVIDIA A100及后续GPU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05932 2026-02-06 cs.CL 85%

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

多项语言还是多群体?多语言大语言模型对价值导向的选择题的回答

Léo Labat, Etienne Ollion, François Yvon

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) CREST, CNRS, Institut Polytechnique de Paris(CREST、国家科学研究中心、巴黎高等理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言LLM在价值导向选择题中的回答一致性,发现语言影响回答,需进一步探讨偏好微调的作用。

Comments 17 pages, 5 figures (8 pages of references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01162 2026-02-03 cs.CL 85%

Typologically-Informed Candidate Reranking for LLM-based Translation into Low-Resource Languages

基于语言类型学的候选重排序用于基于大语言模型的低资源语言翻译

Nipuna Abeykoon, Ashen Weerathunga, Pubudu Wijesinghe, Parameswari Krishnamurthy

机构 * ZWAG AI Ltd(ZWAG人工智能有限公司) Dubai AI Campus(迪拜人工智能校园) DIFC(迪拜国际科技论坛)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于语言类型学的候选重排序框架,通过语言类型学分析提升低资源语言翻译质量,无需平行数据或模型重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏