arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 30 篇

2606.13811 2026-07-28 quant-ph cs.AI 版本更新 92%

Aligning Quantum Operators with Large Language Models

对齐量子算子与大型语言模型

Rogerio Feris, Yunchao Liu, Pengyuan Li, Hang Hua, David Kremer

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 提出将酉算子映射到LLM潜空间的方法,实现量子与语言输入的联合建模,在Clifford+T电路合成任务上取得与最先进方法竞争的结果,并支持语言条件合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22652 2026-07-28 cs.AI 新提交 91%

KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering

KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答

Yike Wu, Nan Hu, Guilin Qi, Guohui Xiao, Chen Jiang, Xinchun Zou, Yuchen Lu, Songlin Zhai, Yongrui Chen, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) Huawei Technologies(华为技术有限公司) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24717 2026-07-28 cs.CL cs.AI 新提交 88%

DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data

数据编排器:学习编排预训练数据的示例级整理

Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对预训练数据处理未适应各示例需求的问题,提出DataOrchestra框架,统一处理操作并为每个示例编排特定管道,经实验验证该框架在多基准测试中表现良好,在数学持续预训练中有效且能减少计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22769 2026-07-28 cs.LG cs.AI 新提交 88%

DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning

DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化

He Zhang

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22662 2026-07-28 cs.AI 新提交 83%

CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data

CuraWeb:网络规模预训练数据的质量、冗余性和多样性联合优化

Peiguang Li, Yongwei Zhou, Juncheng Diao, Yuchun Fan, Jian Yang, Jianxiao Yang, Zhongda Su, Shuguang Jiao, Xiao Wei, Zhiye Zou, Gan Dong, Zhizhao Zeng, Rongxiang Weng, Jingang Wang, Xunliang Cai

机构 * Meituan(美团)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对开放网络语料库预训练数据优化的局限性,提出质量、冗余性和多样性联合优化范式,结合双轨清理与混合去重,构建CuraWeb语料库,实验证明其在多基准测试中性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08164 2026-07-28 cs.CV 版本更新 82%

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

MRI预处理需要多少才够?脑MRI基础模型的成本效用研究

Jiangshuan Pang, Wangyang Tang, Jing Yan, Zhixuan Cheng, Youzhe He, Yiting Deng, Zhenkun Zhuang, Shiping Liu

机构 * University of the Chinese Academy of Sciences(中国科学院大学) BGI Research(华大研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过比较P0-P7预处理级别对自监督3D MRI预训练的影响,发现并非预处理越强越好,P2是最低成本可行级别,更强预处理仅在特定任务中带来有限提升,且下游可补偿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 81%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22694 2026-07-28 cs.AI 新提交 79%

Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models

贝叶斯重复惩罚:一种用于扭转自回归语言模型中注意力崩溃的有原则的相邻条件框架

Wenjie Fan, Bin Ma, Dong Li

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 针对自回归语言模型注意力崩溃问题,提出基于相邻条件概率构造的贝叶斯重复惩罚框架,通过自归一化惩罚率校正异常置信度,经指数移动平均累积到输出层偏差,实验表明该机制能拯救崩溃模型并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11421 2026-07-28 cs.CL 版本更新 79%

Towards Cultural Bridge by Bahnaric-Vietnamese Translation Using Transfer Learning of Sequence-To-Sequence Pre-training Language Model

通过基于序列到序列预训练语言模型的迁移学习实现巴拿语-越南语翻译以搭建文化桥梁

Dat Minh Tran Phan, Khang Nhat Hoang Vo, Tho Thanh Quan

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 为解决巴拿语-越南语翻译中资源不足问题,利用基于序列到序列预训练语言模型的迁移学习方法,借助预训练越南语模型,结合有限双语资源继续训练,并通过数据增强等优化,有效实现翻译,促进民族文化交流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14717 2026-07-28 cs.LG cs.AI math.OC stat.ML 版本更新 79%

Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling

跷跷板:通过平衡学习率和批量调度加速训练

Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学 Kempner 机构) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究如何加速大语言模型预训练,提出Seesaw框架,通过平衡学习率和批量调度,在保留损失动态时减少串行步骤。理论上给出相关等效性证明并扩展,实验表明该框架能在相同浮点运算量下减少时钟时间,接近理论极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-07-28 cs.CL 新提交 77%

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22577 2026-07-28 cs.AI 新提交 77%

cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs

大规模的cMoLLM:语言模型混合的水平扩展定律

Xin Yang, Yemin Wang, Mingda Liu, Letian Li, Shuaishuai Cao, Zhengxiao He, Ryan Dong

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型训练和推理成本随模型规模线性增长的瓶颈,将MoE风格混合层 reformulate 为可变内核动态卷积,引入cMoLLM,在FineWeb训练的模型中提升了语言建模及下游任务表现,有更好流利用率等优势。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24276 2026-07-28 cs.CL cs.AI cs.LG 新提交 75%

The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages

分词器代价:量化并解释印度语言子词分词的跨语言成本

Priyansh Srivastava

机构 * Sirena Ai India(印度Sirena人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究量化印度语言子词分词跨语言成本,测量六种分词器在十四种语言上的分词丰富度,揭示字节对合并失败是高代价主因,多语言分词器可降低代价,还发现分词与阅读理解性能关联受语言资源可用性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23242 2026-07-28 cs.CL cs.LG 新提交 73%

IndicTalk: A Large-Scale Persona-Based Multilingual Conversational Corpus for Indic Languages

IndicTalk:用于印度语言的大规模基于角色的多语言对话语料库

Sahil Deepak Gawande, Mayank Singh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对印度语言高质量多语言代码混合对话资源稀缺问题,提出通过全自动管道生成IndicTalk语料库,涵盖多种印度语言变体,经多种评估表现良好,将发布该语料库支持相关人工智能开发评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24516 2026-07-28 cs.CV cs.AI 新提交 70%

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

DecoupleMix:用于可扩展视觉语言模型数据配方的解耦比率搜索和凸分配

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究针对视觉语言模型数据构建缺乏原则性标准的问题,提出DecoupleMix框架,将其解耦为类间比率搜索和类内凸分配两个子问题,实验证明该方法优于启发式基线,且最优比率可跨规模转移,提升了VLM竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17931 2026-07-28 cs.AI 版本更新 70%

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

LiteResearcher:一种用于深度研究代理的可扩展代理强化学习训练框架

Bince Qu, Wanli Li, Bo Pan, Jianyu Zhang, Zheng Liu, Pan Zhang, Wei Chen, Bo Zhang

机构 * Zhejiang University(浙江大学) Simplex AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 LiteResearcher通过构建轻量虚拟世界提升代理强化学习的可扩展性,使小规模搜索代理在GAIA和Xbench等基准上取得state-of-the-art结果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23782 2026-07-28 cs.RO 新提交 67%

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

$N_0$-VTLA:使用潜在触觉令牌扩展视觉-触觉-语言-动作模型

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract)

AI总结 研究提出$N_0$-VTLA模型,基于视觉主干,通过视觉-触觉预训练、分阶段触觉路径集成和优势条件离线策略改进进行触觉集成训练。该模型在丰富接触基准测试中表现出色,为通用触觉驱动操作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22615 2026-07-28 q-bio.NC cs.AI cs.LG cs.NE 新提交 62%

Masked Autoencoders Learn Perception-Relevant Representations from Resting State Neural Data

掩码自动编码器从静息态神经数据中学习与感知相关的表示

Aleksandr Kovalev, Antonio Lozano, Fabrizio Grani, Cristina Soto Sanchez, Leili Soo, Rocío López-Peco, Adrian Villamarin-Ortiz, Roberto Morollón Ruiz, María del Mar Ayuso Arroyave, Alfonso Rodil, Eduardo Fernández

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究利用自监督学习,通过在盲人参与者V1区的自发神经活动上预训练掩码自动编码器,测试能否改善感知解码。结果显示该方法有效,表明自发皮层活动有价值,无监督预训练是改善神经解码的好策略。

Comments 6 papers, 4 figures. NeuroAI Workshop, AAAI 2026

Journal ref Proceedings of the First Workshop on NeuroAI Multimodal Intelligence @ AAAI 2026, PMLR 308:93-98, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23319 2026-07-28 cs.CL cs.CY cs.ET cs.LG 新提交 62%

BHARATI: Morphology-Aware Tokenizers for Classical Indian Languages with Subword Fertility Analysis

BHARATI:用于古典印度语言的形态感知分词器及子词丰富度分析

Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran, Santhosh Sivasubramani

机构 * Centre for Sensors, Instrumentation and Cyber-Physical System Engineering (Centre for SeNSE), Indian Institute of Technology Delhi(印度理工学院德里分校传感器、仪器仪表和网络物理系统工程中心(SeNSE中心)) RSL Quantum, FITT, IIT Delhi(印度理工学院德里分校FITT的RSL量子公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对古典印度语言分词低效问题,提出BHARATI,它基于多语言语料库训练出三个版本的分词器,经子词丰富度分析和实验验证,v3表现出色,能减少序列长度,增加下游语言模型有效上下文长度,相关模型、脚本和基准已开源。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19363 2026-07-28 cs.AI cs.CL 版本更新 62%

AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally

AdaRoPE:并非所有注意力头都应同等旋转和缩放

Shaowen Wang, Yuke Zheng, Tansheng Zhu, Shuang Chen, Shaofan Liu, Suncong Zheng, Jian Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究发现Transformer中不同功能的注意力头需不同频率范围和缩放因子,提出AdaRoPE为各头配备可学习参数,实验表明其性能优于现有变体,能更好地进行上下文扩展并保留短上下文性能,凸显在单头级别优化旋转位置嵌入之重要性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24542 2026-07-28 cs.CL cs.DL cs.IR 新提交 57%

From transcription to semantic corpus analysis: unsupervised learning of sentence representations for ancient languages

从转录到语义语料库分析:古代语言句子表示的无监督学习

Th{é}otime de la Selle

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究古代语言句子表示的无监督学习,采用TSDAE和CSE策略,将专门语言模型转换为特定语料库句子编码器,在教父文献圣经重用案例中表现出色,优于多种基线,且可跨作品作者迁移,相关工具可供非专业人员使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交 57%

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23854 2026-07-28 cs.AI 新提交 57%

Understanding Human-like Solutions in Combinatorial Optimization via Learning and Search

通过学习和搜索理解组合优化中类人解决方案

Haijiang Yan, Jian-Qiao Zhu, Liqiang Huang, Ming Meng

机构 * The University of Warwick(华威大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) South China Normal University(华南师范大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 研究欧几里得旅行商问题中人类如何找到接近最优解,通过大规模行为和计算研究,对比人类与基于指针网络的神经策略,发现类人解决方案或源于结构化监督学习、强化学习及测试时搜索的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22884 2026-07-28 cs.CL 新提交 57%

CHiPS: Character Histograms and Positional Signals for Lightweight Authorship Attribution in Romanian Texts

CHiPS:罗马尼亚语文本中用于轻量级作者归属的字符直方图和位置信号

Sanda-Maria Avram, George C. Ţurcaş

机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴比什-波雅依大学数学与计算机科学学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究针对罗马尼亚语文本提出CHiPS轻量级字符级作者归属方法,研究两种互补写作风格指纹,包括字符直方图分类器和位置信号分类器,还介绍了融合变体等,通过实验探讨受限字符证据在严格泄漏控制下的效果。

Comments 17 pages, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15928 2026-07-28 cs.LG 版本更新 57%

Knowledge-Guided Cross-Modal Fusion for Adult-to-Pediatric ECG Transfer via Label-Conditioned Contrastive Alignment

通过标签条件对比对齐实现成人到儿科心电图转换的知识引导跨模态融合

Xinran Liu, Yuwen Li, Hongxiang Gao, Heyang Xu, Jianqing Li, Zongmin Wang, Chengyu Liu

机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) Nanjing Medical University(南京医科大学) Zhengzhou University(郑州大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究针对成人与儿科心电图转换问题,提出知识引导的跨模态融合框架PEACE,通过标签条件对比对齐等方法,在有限监督下实现更好的儿科心电图解释,消融实验证明标签条件知识对齐是关键驱动因素。

Comments This article was accidentally submitted as a new arXiv paper instead of a replacement of arXiv:2605.00647. Please refer to arXiv:2605.00647 for the correct and updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08362 2026-07-28 cs.CL 版本更新 57%

Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

越南高地、三角洲和海岸的回声:占语、高棉语和岱侬语的多语言语料库

Anh Trac Duc Dinh, Khang Nhat Hoang Vo, Vinh Cong Doan, Tai Tien Ta, Khoa Duc Anh Lam

机构 * Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), VNU-HCM(胡志明市理工大学计算机科学与工程学院(胡志明市国立大学所属)) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 针对越南占语、高棉语和岱侬语在自然语言处理中缺乏语料库的问题,引入CKTN语料库,指出现有多语言编码器不足,采用脚本感知适应方法,得到分割减少、分类性能强的编码器,揭示词汇重叠检索评估局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04266 2026-07-28 eess.SP cs.LG 版本更新 57%

Aortic Valve Disease Screening from PPG via Physiology-Guided Self-Supervised Learning

通过生理引导的自监督学习检测PPG中的主动脉瓣疾病

Jiaze Wang, Qinghao Zhao, Zizheng Chen, Zhejun Sun, Deyun Zhang, Yuxi Zhou, Shenda Hong

机构 * Department of Computer Science, Tianjin University of Technology(天津理工大学计算机科学系) National Institute of Health Data Science, Peking University(北京大学国家健康数据科学研究院) Department of Cardiology, Peking University People’s Hospital(北京大学人民医院心内科) HeartVoice Medical Technology(心声医疗科技) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University(清华大学计算机科学与技术系、北京人工智能研究所、互联网产业研究所) Institute of Medical Technology, Peking University Health Science Center(北京大学健康科学中心医学技术研究所) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究所) State Key Laboratory of Vascular Homeostasis and Remodeling, NHC Key Laboratory of Cardiovascular Molecular Biology and Regulatory Peptides, Peking University(北京大学血管稳态与重塑国家重点实验室、国家心血管分子生物学与调节肽重点实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于生理引导的自监督学习方法,利用大量未标记PPG数据高效筛查主动脉狭窄和反流,实现优于传统监督学习的检测性能。

Comments 33 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01759 2026-07-28 cs.CV 50%

PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning

PointCSP:自监督点云学习中的跨样本语义传播与稳定性保持

Xinxing Yu, Ajian Liu, Sunyuan Qiang, Hui Ma, Liying Yang, Yuzhong Wang, Zhi Rao, Yanyan Liang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究点云自监督学习中跨场景语义一致性问题,提出基于跨样本语义传播的PC-SSL框架及非对称语义保持蒸馏,在状态空间显式建模样本动态依赖,实现跨样本语义对齐与稳定转移,实验证明性能优于现有方法。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 50%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09708 2026-07-28 eess.AS 版本更新 50%

Adapting a Text-to-Audio Model for Room Impulse Response Generation

为房间脉冲响应生成适应文本到音频模型

Kirak Kim, Sungyoung Kim

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。

Comments Accepted to IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏