arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-09 至 2026-07-09 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2607.07494 2026-07-09 cs.DC cs.LG 新提交 92%

GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining

GIFT:用于大语言模型预训练的几何感知低精度梯度通信

Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对LLM预训练中梯度通信瓶颈,提出几何感知梯度缩放方法GIFT,通过变换梯度到近各向同性空间进行低精度通信,开发简化算法平衡开销与减少量,经实验验证可减少预训练时间并改善下游任务保留情况。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06617 2026-07-09 cs.LG cs.AI 新提交 84%

Inertia-1: An Open Exploration of Wearable Motion Foundation Models

Inertia-1:可穿戴运动基础模型的开放探索

Zongzhe Xu, Aakarsh Anand, Sarah Jiang, Chuntung Zhuang, Zitao Shuai, Sriram Sankararaman, Yuzhe Yang

机构 * John Hopkins University(约翰·霍普金斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究可穿戴运动基础模型,利用大量加速度计数据构建框架,涵盖数据、模型和训练选择等,通过多数据集评估得出有趣发现,不仅提供先进方法,还为可穿戴运动表示学习提供全面实用开放指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07675 2026-07-09 cs.CV 新提交 82%

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

用于具身智能的缩放专家混合视频预训练

Shuailei Ma, Jiaqi Liao, Xinyang Wang, Jingjing Wang, Chaoran Feng, Zijing Hu, Chong Bao, Zichen Xi, Yuqi Gan, Weisen Wang, Yanhong Zeng, Qin Zhao, Zifan Shi, Wei Wu, Hao Ouyang, Qiuyu Wang, Shangzhan Zhang, Jiahao Shao, Yipengjing Sun, Liangxiao Hu, Lunke Pan, Nan Xue, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Ka Leong Cheng

机构 * Robbyant(蚂蚁灵波)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对视频生成模型领域不匹配问题,提出LingBot-Video,采用MoE架构、构建数据剖析引擎、开发多维奖励系统进行视频预训练,验证了其性能和效率,贡献了首个大规模开源MoE视频基础模型。

Comments Project page: https://technology.robbyant.com/lingbot-video

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 82%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 预训练与数据 :LLM(title);instruction tuning(abstract);pretraining(abstract)

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17390 2026-07-09 cs.CV 版本更新 82%

FMMC: Harnessing the Power of Foundation Models for Accurate Material Classification

利用基础模型提升材料分类的准确性

Qingran Lin, Fengwei Yang, Chaolun Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Waseda University(早稻田大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出一种利用基础模型克服数据限制并提升分类准确性的新框架,通过生成高质量数据集和融合视觉语言模型先验知识,有效提高材料分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06802 2026-07-09 eess.SP cs.AI 新提交 79%

A Multi-Analyst LLM Pipeline for Auditable Rule Discovery Across 68 Public Physiological Corpora

用于跨68个公共生理语料库进行可审计规则发现的多分析师大语言模型管道

Dovy Paukstys

机构 * Komori Care, LLC(科莫里护理公司)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI

AI总结 针对开放生理语料库异质性无法确定新监测平台探测器规则的问题,提出多分析师大语言模型工作流程,通过读取语料库文档、去重、审核、整合等操作,产生可审计规则形状库及探测器组件,推动文献规则向硬件验证发展。

Comments 8 pages, 2 figures, 9 tables; submitted to IEEE SPMB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06948 2026-07-09 cs.CV cs.AI 新提交 79%

Self-Supervised Pretraining Improves Cross-Site and Cross-Scale Robustness of Point Cloud Leaf-Wood Segmentation

自监督预训练提高点云树叶-木材分割的跨站点和跨尺度鲁棒性

Heeju Mun, Tackang Yang, Yunsoo Nam, Changhyun Choi

机构 * Department of Landscape Architecture and Rural Systems Engineering, Seoul National University, Seoul, South Korea(景观建筑与乡村系统工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Landscape Architecture, Seoul National University, South Korea(景观建筑跨学科项目,首尔国立大学,韩国) Integrated Major in Smart City Global Convergence, Seoul National University, Seoul, Republic of Korea(智能城市全球融合整合专业,首尔国立大学,首尔,韩国) Research Institute of Agriculture and Life Sciences, Seoul National University, Seoul, Republic of Korea(农业与生命科学研究院,首尔国立大学,首尔,韩国)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 研究树木点云树叶-木材分割方法跨森林类型和地点准确性差异问题,采用自监督预训练Point-M2AE并结合递归体素细分,提升了分割精度,在跨站点和跨尺度上表现良好,还改善了下游木材体积估计的性能。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06845 2026-07-09 cs.CL 新提交 77%

LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见

Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds(连接思维公司) Emory University(埃默里大学) Wilfrid Laurier University(威尔弗里德·劳里埃大学) University of Toronto(多伦多大学) University of Guelph(圭尔夫大学) Monark Health(莫纳克健康公司) CIFAR Solution Network(加拿大高级研究院解决方案网络)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02707 2026-07-09 cs.CV 新提交 71%

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

VLRC:视觉语言重投影一致性作为用于更好的前馈3D预训练的可扩展信号

Marwane Hariat, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris(U2IS,法国国立高等先进技术学校 - 巴黎综合理工学院) Pôle Recherche, Agence Ministérielle pour l’IA de Défense(军事人工智能部研究中心)

专题命中 预训练与数据 :pretraining(title)

AI总结 研究提出视觉语言重投影一致性(VLRC),利用冻结的视觉语言表征作为语义多视图监督,无需额外3D标注,能提升3D重建精度等,为前馈3D预训练提供可扩展辅助目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 70%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08920 2026-07-09 cs.CL stat.AP stat.ME 70%

Documents Are People and Words Are Items: A Psychometric Approach to Textual Data with Contextual Embeddings

文档是人,词语是项目:一种使用上下文嵌入的文本数据心理测量方法

Jinsong Chen

机构 * Faculty of Education, University of Hong Kong(香港大学教育学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于上下文嵌入的心理测量方法,用于分析文本数据,通过将文档视为个体和词语视为项目,揭示文本中的潜在知识维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07282 2026-07-09 cs.CL cs.DL 新提交 57%

A Word-Level Digital Reader of the Prasthanatrayi with Sankara's Bhasya: Corpus, Method, and an Open, Offline Reading Aid for the Advaita Vedanta Canon

带有商羯罗注疏的吠檀多三经的词级数字阅读器:语料库、方法以及为不二论吠檀多经典提供的开放离线阅读辅助工具

Tamal Maharaj

机构 * Ramakrishna Mission Vivekananda Educational and Research Institute(罗摩克里希那传道会辨喜教育与研究学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 该研究针对吠檀多三经阅读难题,构建开放离线词级数字阅读器。利用混合管道和人工审核循环处理文本,涵盖多单元及大量词分析与字典。经评估其分析与权威词典高度一致,提供了便捷的教学阅读辅助工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07542 2026-07-09 cs.RO cs.CV 新提交 50%

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences

SonoRank:迈向无需校准的实时前臂超声序列手指弯曲检测

Dean Zadok, Alon Wolf, Alex M. Bronstein, Oren Salzman

机构 * Technion(以色列理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对动力假肢手因依赖sEMG功能受限的问题,提出SonoRank方法,通过对超声序列对排序学习及微调,实现无需校准的手指弯曲检测,在交叉验证中F1分数比直接分类基线提高28%,推动超声假肢实用化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 50%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07230 2026-07-09 cs.CV 新提交 50%

`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation

用于自监督视频对象分割的注意力引导跨时间聚类

Waqas Arshid, Mohammad Awrangjeb, Alan Wee-Chung Liew, Yongsheng Gao

机构 * Griffith University(格里菲斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对视频对象分割任务,现有自监督方法存在问题。本文提出跨时间一致性和聚类框架,结合注意力引导令牌选择与轻量级时间聚类,通过显著性加权目标对齐软部分分配,利用冻结变压器主干实现有效扩展,提升自监督视频对象分割性能。

Comments Accepted for publication in Machine Intelligence Research journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15770 2026-07-09 physics.optics cs.AR cs.CV 版本更新 50%

Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding

通过纳米光子波前编码实现物理基础的单目深度

Bingxuan Li, Jiahao Wu, Yuan Xu, Zezheng Zhu, Yunxiang Zhang, Kenneth Chen, Yanqi Liang, Nanfang Yu, Qi Sun

机构 * New York University(纽约大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决单目深度感知中度量尺度模糊问题,核心方法是用超透镜通过纳米光子学编码深度线索,结合DFMs与输入自适应策略及模拟管道,实验证明该方法有效提升单目度量深度传感精度。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏