arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 29 篇

2608.14792 2026-08-18 cs.CL cs.AI cs.LG 新提交 93%

Prompting is not enough: supervised baselines and leakage control for measuring shared decision-making with LLMs in pediatric encounters

仅靠提示是不够的:儿科诊疗场景中利用大语言模型(LLM)衡量共同决策(SDM)的有监督基线与泄漏控制

Bernardo Modenesi, Jody Lin, Kimberly Kaphingst, Angela Zhu, Maya Wheeler, Peilu Zhang, Angela Fagerlin

机构 * University of Utah(犹他大学) University of Utah Spencer Fox Eccles School of Medicine(犹他大学斯宾塞·福克斯·埃克尔斯医学院) Kahlert School of Computing, University of Utah(犹他大学卡勒特计算机学院) Huntsman Cancer Institute, University of Utah(犹他大学亨茨曼癌症研究所)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对儿科外科决策诊疗场景,对比零样本LLM、有监督分类器及二者的堆叠模型衡量SDM行为的效果,发现零样本提示不足,还识别出数据泄漏路径,为相关评估提供了基线与泄漏控制依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14813 2026-08-18 cs.CL 新提交 91%

Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data

超出界限:评估LLM训练数据中极端主义言论的流行程度与内容

Dmitry Nikolaev, Ashley A. Mattheis

机构 * University of Manchester(曼彻斯特大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对LLM训练数据的极端主义言论问题,以Dolma语料库为对象,经多步骤提取得出其含数十万份极端主义文档的下限,并探讨相关数据整理与预训练影响。

Comments Accepted to the CPSS workshop @ KONVENS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14591 2026-08-18 eess.SP cs.IT cs.LG 新提交 89%

6G Native AI and Channel Foundation Models

6G原生AI与信道基础模型

Shugong Xu, Jun Jiang, Yuan Gao

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文从系统设计视角界定6G原生AI的内涵,提出信道基础模型(CFMs)作为6G原生AI的技术范式,阐明其类型与优势,验证其在标注有限时可提升定位与波束预测性能。

Comments Awesome GitHub: this https URL (https://github.com/GREAT-ISAC/Awesome-Channel-Foundation-Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15195 2026-08-18 cs.CV 新提交 88%

Beyond Natural-Image Foundation Models: Benchmarking Satellite Pretraining for Ophthalmic Image Analysis

超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试

Lovre Antonio Budimir, Mingya Alexa Gong, Alyssa Foong Quinney, Ivana Matovinović, Yukun Zhou, Pearse A. Keane, Sven Lončarić, Marinko V. Šarunić

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) University College London(伦敦大学学院) Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) Department of Computer Science, University College London(伦敦大学学院计算机科学系) NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。

Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16747 2026-08-18 cs.LG cs.AI 新提交 88%

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释

Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

机构 * Anthropic

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16707 2026-08-18 cs.CL cs.AI 新提交 87%

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

语义老虎机:上下文内的探索-利用受语义先验的偏置

David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Skyfall AI(天空fall人工智能公司) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出语义老虎机框架,发现LLM的探索-利用受语义先验偏置,语义标签对齐奖励可提升性能,负奖励比同等正奖励触发更多探索,为LLM智能体决策可靠性提供了新见解。

Comments 10 pages, 5 figures in main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15875 2026-08-18 cs.RO 新提交 85%

GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力

GigaBrain Team, Angen Ye, Axiang Sun, Can Jin, Chenxi Cheng, Chong Shi, Dengke Shang, Dingqian Zhang, Guan Huang, Guangqiang Wang, Guangqing Ding, Guo Li, Hangcong Li, Hengyu Zhong, Hongtao Lu, Jianbo Qin, Jiming Mao, Jing Zhu, Jindi Lv, Jingzhi Cui, Junjie Xie, Junyi Bao, Kai Liu, Lei Yuan, Limin Long, Lv Feng, Mingming Yu, Peng Li, Pengfei Yi, Qi Li, Qianli Zhang, Qingfang Li, Qitang Hu, Rui Zhang, Shaoyan Sun, Shibo Sun, Shiying Duan, Tenghui Chen, Tianze Liu, Weijie Ke, Wenyao Xue, Xiaofeng Wang, Xiaoyu Tian, Xinyu Liu, Xinze Chen, Yang Wang, Yankai Wang, Yejun Zeng, Yifan Li, Yifei Nie, Yilong Li, Yilong Liu, Yongchao Feng, Yumeng Wang, Yun Ye, Zhichao Liu, Ziheng He, Zonghai Yang, Zheng Zhu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。

Comments this https URL (https://gigaai.cc/blog/gigabrain07)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15412 2026-08-18 cs.LG cs.AI cs.SE 新提交 84%

Invariant Pretraining for Robust Code Representations

用于鲁棒代码表示的不变预训练

Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo, Zili Wang, Hao Chen

机构 * University of California at Davis(加州大学戴维斯分校) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对代码表示模型在不变程序下鲁棒性退化问题,提出仅基于代码的不变预训练(InvPT)方法,在克隆检测、代码分类任务上分别提升鲁棒性最高11、19个百分点,同时保持或提升标准准确率。

Comments To appear in LMPL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 82%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16718 2026-08-18 cs.CV 新提交 82%

CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification

CytoFormer:用于组织病理学细胞分类的分子监督细胞基础模型

Jialu Yao, Songhao Li, Alina Yu, Zhi Huang

机构 * University of Pennsylvania(宾夕法尼亚大学) Germantown Friends School(日耳曼敦贵格会学校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 CytoFormer利用配对H&E染色与空间转录组学数据训练细胞基础模型,在细胞分类、迁移学习及主动学习中表现优异,为常规组织学的细胞分析提供高效可复用表示。

Comments 20 pages, 5 figures, 2 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16614 2026-08-18 cs.CV 新提交 82%

Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts

超越准确率:评估地理空间基础模型的校准度及其对分布偏移的敏感性

Nils Lehmann, Jakob Gawlikowski, Burak Ekim, Isaac Corley, Xiao Xiang Zhu

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) German Aerospace Center (DLR)(德国航空航天中心) Massachusetts Institute of Technology (MIT)(麻省理工学院) Taylor Geospatial(泰勒地理空间公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 该研究指出GeoFMs仅用准确率排序的不足,分析其校准度与分布偏移敏感性,发现EO预训练模型更易过度自信,提出需多条件多指标评估以缩小实际部署差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15798 2026-08-18 cs.LG stat.ML 新提交 79%

Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception

语言模型的交叉熵风险估计:不一致性必然是稠密的,留出法也不例外

Hanti Lin

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 该研究指出语言模型的每词交叉熵风险无法被一致估计,即使采用留出法也存在稠密的不一致状态,提出两种需付出代价的解决途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15548 2026-08-18 cs.LG cs.AI 新提交 79%

Spectral Saliency for Machine Unlearning

用于机器遗忘的光谱显著性

Cedar Site Bai, Amber Yijia Zheng, Raymond A. Yeh, Brian Bullins

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对机器遗忘问题,受Muon启发提出光谱显著性遗忘(SSU)方法,通过对弱奇异分量设阈值更新,在图像分类器、扩散模型和LLM上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16185 2026-08-18 cs.CL cs.AI 新提交 73%

LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents

LENS:基于动态原始文档的潜在证据探索的上下文内搜索

Xingjun Wang, Gongsheng Li, Qi Fan, Yunlin Mao, Luyan Su, Yingda Chen

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对动态原始文档的上下文内搜索问题,提出无索引框架LENS,通过迭代选择候选证据并更新置信度实现预算约束下的证据定位,在多组实验中其证据召回率和答案依据表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 70%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16053 2026-08-18 cs.CL eess.AS 新提交 70%

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen:为合成对话语音解耦内容、时序与声学

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

机构 * Institute of Science Tokyo(科学东京大学) Hokkaido University(北海道大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 DuplexGen框架通过解耦对话的内容、时序与声学,生成更贴近真实对话的合成语音,构建了带多类标注的医患对话语料库,性能优于传统拼接式合成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14585 2026-08-18 cs.AI 新提交 70%

Euclid-Omni: A Unified Neuro-Symbolic Framework for Plane Geometry

Euclid-Omni:面向平面几何的统一神经符号框架

Zhaoyu Li, Hangrui Bi, Youyuan Zhang, Wenjie Ma, Zenan Li, Zhaolei Zhang, Xujie Si, Kaiyu Yang

机构 * Apodex University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) ETH Zürich(苏黎世联邦理工学院) Meta FAIR

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Euclid-Omni统一神经符号框架,结合形式几何系统与LLMs、VLMs,核心为符号几何求解器Euclidea,生成合成数据训练模型,在竞赛级几何问题上性能优异且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16612 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Degradation-Aligned Self-Supervised Learning for State of Health Estimation of Lithium-Ion Batteries under Label Sparsity

标签稀疏场景下锂离子电池健康状态估计的退化对齐自监督学习

Jiaqi Yao, Julia Kowal

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对标签稀疏下锂离子电池SOH估计问题,提出基于CNN-GRU的退化对齐SSL框架,利用排序预训练结合微调,仅用1%标注数据即可实现高精度SOH估计,为实际应用提供新方向。

Comments Submitted to and under review at Energy and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15964 2026-08-18 cs.CL cs.AI 新提交 62%

LLMs Get Smarter from Targeted Synthetic Multilingual Data

大语言模型(LLMs)从针对性的合成多语言数据中提升性能

Ishika Agarwal, Arkajyoti Charaborty, Tanner Sorensen, Neha Gupta, Andreas Stolcke

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Uniphore(优尼佛(Uniphore)公司)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HOTFIXR数据生成框架,通过探测学生模型多语言弱点生成合成多语言数据,可提升大语言模型的多语言性能,降低微调引发的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14675 2026-08-18 cs.LG cs.AI 新提交 62%

Take it Personally: The Limits of General SSL Representations for Real-Life PPG Emotion Detection

个性化考量:通用自监督学习表征在真实生活光体积描记(PPG)情感检测中的局限性

Dominika Kunc, Przemysław Kazienko, Stanisław Saganowski

机构 * Wroclaw University of Science and Technology(弗罗茨瓦夫科技大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究评估PPG-based SSL在真实生活情感检测中的效能,发现通用SSL表征无法胜任主观情感推理,微调时纳入个人数据才是性能关键,公开了RL-PPG编码器相关资源。

Comments 9 pages, 4 Figures, 2 Tables, Accepted as the 14th International Conference on Affective Computing and Intelligent Interaction (ACII 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14633 2026-08-18 eess.SP cs.LG 新提交 57%

Wolff-Parkinson-White Detection at 471:1 Class Imbalance: A Leakage-Controlled Study of the Data Bottleneck

471:1类别不平衡下的Wolff-Parkinson-White检测:数据瓶颈的泄漏控制研究

Nathael Altman

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究针对WPW检测的471:1类别不平衡问题,在控制数据泄漏的前提下,比较多种信号表示,发现特征融合模型表现与两成员投票相当,部署模型为筛查预筛选工具。

Comments 36 pages, 7 figures. Code, frozen models, out-of-fold scores and the full decision log: this https URL (https://github.com/nathaelaltman/wpw-ecg-detection)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16198 2026-08-18 cs.CV cs.AI 新提交 57%

Picking the Right Image to Classify: Reliable-Input Selection in Teledermatology

选择合适的图像进行分类:远程皮肤病学中的可靠输入选择

Fabian Gröger, Marco Weishaupt, Philippe Gottfrois, Simone Lionetti, Linda Wermelinger, Nipun Ranasekara, Ludovic Amruthalingam, Alexander A. Navarini, Marc Pouly

机构 * University of Basel(巴塞尔大学) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) University Hospital Basel(巴塞尔大学医院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 该研究针对远程皮肤病学中模型因图像分布偏移分类错误的问题,提出可靠输入选择任务,测试多种无预训练数据的选择器,发现其均难缩小与神谕的差距,置信度融合马氏距离的选择器效果仍有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16190 2026-08-18 cs.CR cs.LG 新提交 57%

Decorrelation Is Not Complementarity: Skill, Not Lineage, Governs Trusted-Monitor Ensembles

去相关并非互补性:技能而非谱系管控可信监控器集成体

Anik Jha

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究发现构建可信监控器集成体时,技能而非谱系决定性能,去相关度量对集成体增益预测极弱,且无选择策略能击败样本外单个最佳监控器。

Comments AI control, trusted monitoring, ensemble diversity, scalable oversight, backdoor detection, capability control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16096 2026-08-18 cs.IR cs.CL 新提交 57%

The Commercial Tax: Rent-vs-Own Blind Spots in Multi-Hop Retrieval Benchmarks

商业税负:多跳检索基准中的租用与自建盲区

Luis M. Sanchez, Kosrow Dehnad

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 该研究指出多跳检索基准存在商业部署许可与成本信息盲区,发现NVIDIA Nemotron-3-Embed-8B是首个与开源基准性能持平的商业许可嵌入模型,并量化了索引成本差异。

Comments 23 pages, 4 figures. Replication artifacts (harness, per-question recall vectors, cost model, bootstrap code): this https URL (https://doi.org/10.5281/zenodo.21972866); embedding matrices: this https URL (https://huggingface.co/datasets/toryx-ai/commercial-tax-musique-embeddings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15861 2026-08-18 cs.LG 新提交 57%

TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition

TransfHAR:用于按需活动识别的自监督手腕表征

Aidan Bradshaw, Riku Arakawa, Xin Liu, Karan Ahuja

机构 * Northwestern University(西北大学) Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 TransfHAR是一种自监督手腕IMU框架,可通过学习粗粒度运动先验实现按需细粒度活动识别,在跨数据集评估及用户研究中均优于或匹配全监督基线,为该领域提供了有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15799 2026-08-18 cs.CL 新提交 57%

Using the Mimi codec for metalinguistic representations

使用Mimi编解码器实现元语言表示

Artem Saloev, Erin Pacquetet, Nicolas Ballier

机构 * Université Paris Cité(巴黎西岱大学) ALTAE(ALTAE机构) SCIAM(SCIAM机构)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文针对Moshi语言模型的神经编解码器Mimi的2048个token语义码本,发现其ABX实验无法捕捉语义token到音素实现的映射,经与TIMIT语料对齐后证实该码本token ID可映射至多粒度音素实现,为元语言表示研究提供了关键发现。

Comments 11 pages, accepted for the Proceedings of the Third Workshop on the Bridges and Gaps between Formal and Computational Linguistics (BriGap-3), Paris 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15483 2026-08-18 cs.LG 新提交 57%

Measuring Structured Predictability in Neural Training Dynamics: A Cross-Regime Study

测量神经训练动力学中的结构化可预测性:一项跨 regime 研究

Fanqi Wang, Weisheng Tang, Hairong Qi

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本研究以短程可预测性为度量,结合三类探测方法,在 CIFAR 和 Pythia 70M 模型上揭示了深度网络训练动力学中辅助参数与主体参数的可预测性差异,为训练动力学提供了参数分辨率的诊断方式。

Comments 42 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16793 2026-08-18 cs.CV 新提交 50%

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer

PixRestore:基于像素扩散Transformer的统一图像修复模型

Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出无VAE的像素空间DiT模型PixRestore,通过流匹配与DINO特征可靠性预测实现UIR,仅50M参数且单步推理,在效率与修复性能上优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15651 2026-08-18 cs.CV 新提交 50%

Gaussian-JEPA: Joint-Embedding Predictive Learning for 3D Gaussian Splats

Gaussian-JEPA:面向3D高斯溅射的联合嵌入预测学习

Bin Ren, Qi Ma, Yue Li, Zongyan Han, Yidi Li, Yuqian Fu, Rao Muhammad Anwer, Theo Gevers, Fahad Shahbaz Khan, Salman Khan

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出Gaussian-JEPA,通过预测高斯令牌块潜在表示实现自监督学习,在多类任务上优于重构预训练,为3D高斯表示提供有效学习目标

Comments Joint-embedding predictive representation learning for 3D Gaussian Splatting

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 35 篇

2608.15949 2026-08-18 cs.IR cs.AI cs.CL cs.LG 新提交 94%

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

为确认而提问:用于自信多轮大语言模型推荐的信息交互

Cedar Site Bai, Duanshun Li, Zhenyu Liao, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi

专题命中 指令微调 :LLM(title,summary_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏