arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 46 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 46 篇

2607.03925 2026-07-07 cs.LG 新提交 88%

NeuroOnline: Bridging Pretraining and Online Adaptation for EEG Foundation Models

NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁

Weibin Li, Wendu Li, Yushan You, Chen Wei, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14163 2026-07-07 cs.CL cs.AI 版本更新 88%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 87%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-07-07 cs.CL cs.AI cs.LG 新提交 87%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, zhangliangxu, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16893 2026-07-07 cs.CL 版本更新 86%

Predicting the Emergence of Induction Heads in Language Model Pretraining

预测语言模型预训练中归纳头的出现

Tatsuya Aoyama, Ethan Gotlieb Wilcox, Nathan Schneider

机构 * Department of Linguistics, Georgetown University(语言学系,乔治城大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

AI总结 研究训练数据统计特性与归纳头形成关系,通过自然和合成数据设置,发现简单公式可预测归纳头形成点,表面二元重复频率等影响其形成并找到决策边界,局部依赖也影响其形成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11086 2026-07-07 cs.SE cs.AI 版本更新 86%

Evaluating LLM-Based Regression Test Generation

基于大语言模型的回归测试生成评估

Jing Liu, Seongmin Lee, Eleonora Losiouk, Marcel Böhme

机构 * MPI-SP(Max Planck Institute for Software Process Engineering) University of California at Los Angeles(加州大学洛杉矶分校) University of Padua(帕多瓦大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用大语言模型为特定程序即时生成回归测试,将其作为机器翻译任务,通过对多个项目测试,反馈导向的零样本原型Cleverest表现良好,还探讨了提交消息对其效果的影响。

Comments 23 pages. Published in PACMSE Volume 3, Issue FSE. Artifact of Paper "Evaluating LLM-based Regression Test Generation": https://dl.acm.org/do/10.5281/zenodo.19616584

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 85%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03160 2026-07-07 cs.CL cs.AI 新提交 85%

The Role of Prompt Language and Translation-Theory-Driven Prompts in Large Language Models: A Case Study on Spanish-Chinese Journalistic Translation

提示语言和翻译理论驱动的提示在大语言模型中的作用:以西班牙语-中文新闻翻译为例

Haohong Lai, Weijia Li

机构 * Faculty of Translation and Interpreting(翻译与口译学院) Autonomous University of Barcelona(巴塞罗那自治大学) Barcelona, Spain(西班牙巴塞罗那)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究提示语言和翻译理论驱动的提示设计对GPT-5.2生成的西中新闻翻译质量的影响。通过48种实验条件翻译平行语料库,用自动评估指标和人工评估,发现理论驱动提示能减少特定错误,提示语言影响小。

Comments Published in the Proceedings of the 27th Annual Conference of the European Association for Machine Translation (EAMT 2026), pp. 927-945. ACL Anthology entry forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04081 2026-07-07 cs.LG stat.ML 新提交 83%

A Unified Framework for In-Context Learning with Causal and Masked Language Models

一种用于上下文学习的因果和掩码语言模型统一框架

Chenrui Liu, Chuanlong Xie, Falong Tan, Yicheng Zeng, Lixing Zhu

机构 * Beijing Normal University at Zhuhai(北京师范大学珠海分校) Hunan University(湖南大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究上下文学习,提出统计学习框架,将自回归和掩码预训练目标置于共同风险分析中,在特定条件下得出推理时MASK和自回归目标的同阶上界等成果,做了实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05247 2026-07-07 cs.CV 新提交 82%

Vision Pretraining for Dense Spatial Perception

面向稠密空间感知的视觉预训练

Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract)

AI总结 针对现有视觉基础模型牺牲空间细节理解的问题,提出以边界为中心的掩码边界建模自监督预训练范式,提升稠密空间感知能力与下游任务性能。

Comments Tech report, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 81%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04846 2026-07-07 cs.LG cs.AI 新提交 81%

Pretraining Curricula Enable Selective Fine-tuning

预训练课程实现选择性微调

Sebastian A. Bruijns, Jirko Rubruck, Mia H. Whitefield, Kai J. Sandbrink, Fazl Barez, Christopher Summerfield

机构 * University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04541 2026-07-07 cs.CV cs.AI cs.LG cs.RO 新提交 81%

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络

Jingyu Song, Yi Liu, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。

Comments 17 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16730 2026-07-07 stat.ML cs.AI cs.LG 新提交 81%

Attention is Just Another Name for Coupling? A Fast-Slow ODE Perspective on Hierarchical Pretraining

注意力只是耦合的另一个名字?:关于层级预训练的快速-慢速ODE视角

Zhengyuan Gao

机构 * Independent scholar(独立学者)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种快慢ODE视角,将因果自注意力视为耦合机制,并引入一个通过零初始化门控反馈到快路径的慢子系统,在理论证明和实验验证中揭示了其与主方程平稳分布的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 81%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20757 2026-07-07 cs.CL cs.LG 版本更新 81%

TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior

TokSuite:衡量分词器选择对语言模型行为的影响

Gül Sena Altıntaş, Malikeh Ehghaghi, Brian Lester, Fengyuan Liu, Wanru Zhao, Marco Ciccone, Colin Raffel

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Google DeepMind(谷歌DeepMind) McGill University(麦吉尔大学) University of Cambridge(剑桥大学) Hugging Face

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出TokSuite,含模型集合与基准测试,通过不同分词器的预训练模型及多语言鲁棒性基准测试,解耦分词器影响,阐明多种流行分词器优缺点。

Comments ICML 2026. 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04735 2026-07-07 cs.DB cs.LG 新提交 79%

Identifiability of Relational Queries in Multi-View Pretraining

多视图预训练中关系查询的可识别性

Ratan Bahadur Thapa, Daniel Hernández

机构 * University of Stuttgart, Germany(斯图加特大学,德国) Analytic Computing, KI, University of Stuttgart(斯图加特大学分析计算与人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 研究数据集成中查询可识别性问题,通过形式化接口定律下的查询可识别性,证明多项式时间证书CheckCert可判定、不可识别查询有误差下限、最小增强算法Greedy-MinAug可找最小接口集,实验验证了算法效果。

Comments Artifacts to be archived at DaRUS: https://doi.org/10.18419/DARUS-6292

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19833 2026-07-07 cs.CL cs.AI cs.DL 版本更新 79%

Polarity Detection of Sustainable Development Goals in News Text

新闻文本中可持续发展目标的极性检测

Andrea Cadeddu, Alessandro Chessa, Vincenzo De Leo, Gianni Fenu, Francesco Osborne, Diego Reforgiato Recupero, Angelo Salatino, Luca Secchi

机构 * LinkaLab

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍可持续发展目标极性检测新任务,提出SDG - POD数据集,评估六种开源大语言模型在零样本和微调设置下的表现,发现微调模型性能更佳,合成训练数据可提升模型鲁棒性和分类性能。

Comments The paper has been updated thanks to the reviewers comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17758 2026-07-07 cs.LG 版本更新 77%

Memisis: Orchestrating and Evaluating Synthetic Data for Tabular Health Datasets

Memisis:协调和评估表格健康数据的合成数据

Nitish Nagesh, Pengbao Zhou, Atchuth Naveen Chilaparasetti, Yajat Nagaraj Kiran, Tu Nguyen, Arshia Harish Puthran, Muhjaazee Love, Aadi Sharma, Mahdi Bagheri, Ian Harris, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Memisis工具,通过结合现有合成数据工具、大语言模型和先进评估指标,协调和评估合成数据,以提高下游预测任务和临床决策的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11784 2026-07-07 cs.LG stat.ML 版本更新 77%

Language Generation with Replay: A Learning-Theoretic View of Model Collapse

带重放的语言生成:模型崩溃的学习理论视角

Giorgio Racca, Michal Valko, Amartya Sanyal

机构 * University of Copenhagen(哥本哈根大学) Isara Labs(Isara实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究随着前沿大语言模型训练对数据需求增加,生成文本可能重入训练语料库致模型崩溃的问题。通过语言生成极限框架,引入重放对手,刻画重放何时限制生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03786 2026-07-07 cs.CL cs.LG 76%

Compact Example-Based Explanations for Language Models

紧凑的基于示例的语言模型解释

Loris Schoenegger, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学学院) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学语言文化研究学院)

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.LG

AI总结 本文提出一种无需重新训练的选例相关性评分,用于评估示例集对模型输出解释的有效性,并展示了其在选择策略中的应用,提升解释质量。

Comments ACL 2026 Findings. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04939 2026-07-07 cs.SE 新提交 75%

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

教大语言模型一种低资源语言:增强Pharo中的代码补全

Kilian Kier, Alessandro Giagnorio, Omar AbedelKader, Oleksandr Zaitsev, Robert Peharz, Romain Robbes, Gabriele Bavota, Stéphane Ducasse

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究将基于大语言模型的代码补全引入低资源语言Pharo,介绍结合特定数据处理、预训练与微调的端到端流程,引入基准测试,实证表明专用模型性能超越原模型及更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04941 2026-07-07 cs.CL cs.SD eess.AS 新提交 74%

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

DuplexChat:大规模构建用于口语对话语言建模的分离说话者全双工对话语音

Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学,日本) National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 针对现有大规模公共语音语料库不适用于全双工口语对话模型训练的问题,提出DuplexChat及DuplexChat-Pipe,通过特定流程构建分离说话者全双工对话语音,产出多语言语料库。

Comments 4 pages, 1 figures, submitted to SLT demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04832 2026-07-07 cs.CL 新提交 70%

Semantic Homogenization in Italian Popular Music: A Diachronic Analysis

意大利流行音乐中的语义同质化:历时分析

Lorenzo Canale, Stefano Scotta, Alberto Messina

机构 * Centro Ricerche, Innovazione Tecnologica e Sperimentazione(研究中心、技术创新与实验)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究意大利圣雷莫音乐节决赛歌曲歌词语义变化,开发灵活高效方法,结合多种分析及技术,发现语义渐趋统一,凸显自然语言处理工具价值。

Journal ref J Comput Soc Sc 9, 44 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 70%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03869 2026-07-07 cs.CV cs.AI 新提交 70%

GeoSelect: Spatial-Program Execution for Training-Free Referring Remote Sensing Image Segmentation

GeoSelect:用于无训练的指称遥感图像分割的空间程序执行

Yuhang Jiang, Guohui Deng, Miaozhong Xu, Chao Ruan, Jinling Zhao, Linsheng Huang

机构 * School of Internet, Anhui University(安徽大学互联网学院) National Engineering Research Center for Agro-Ecological Big Data Analysis & Application, Anhui University(安徽大学农业生态大数据分析与应用国家工程研究中心) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究无训练的指称遥感图像分割,提出GeoSelect方法,将指称重构成类型化空间程序执行,由语言模型合成程序,经检查器和执行器运行,贡献是提升分割指标且可检查中间过程。

Comments 20 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05076 2026-07-07 cs.SE cs.FL 新提交 67%

Can Code Specify a System Precisely Enough to Formally Verify It?

代码能否精确指定系统以进行形式化验证?

Jean-Jacques Dubray

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究评估生产软件支付工作流,通过手工模型验证核心协议正确性,发现故障处理差距并修复;生产支付沙盒探针暴露问题;还复制了关于大语言模型规范可靠性受合同结构而非语言影响的结论。

Comments 25 pages, 3 figures, 5 tables. Artifacts and reference models at https://github.com/jdubray/SysMoBench-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交 67%

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20659 2026-07-07 cs.RO 版本更新 67%

StageCraft: Execution Aware Mitigation of Distractor and Obstruction Failures in VLA Models

StageCraft: 通过执行意识缓解VLA模型中干扰和障碍故障

Kartikay Milind Pangaonkar, Prabin Rath, Omkar Patil, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 StageCraft通过利用大规模视觉语言模型进行推理,改进预训练VLA策略性能,通过操控环境初始状态避免执行故障,实现在三个真实任务领域中性能提升40%。

Comments Accepted to IEEE International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05155 2026-07-07 cs.CL cs.LG 新提交 62%

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

EdgeBench:揭示从真实环境中学习的缩放定律

Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi

机构 * ByteDance(字节跳动)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏