arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 737 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.22738 2026-06-23 cs.IR 新提交 50%

PA-User: Simulating Trust and Verification under AI-Generated Content

PA-User: 模拟AI生成内容下的信任与验证

Saber Zerhoudi

专题命中 预训练与数据 :language model(abstract)

AI总结 提出PA-User用户模拟器,通过检测努力预算、信任组件和决策规则,模拟用户在AI生成内容环境下的验证行为,降低高风险遗憾并提高信任校准。

Journal ref 12th Federation of European Simulation Societies Conference (EUROSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21788 2026-06-23 cs.RO cs.CV 新提交 50%

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

基于旋转感知的点云嵌入用于视觉驱动的手中重定向

Yashom Dighe, Karthik Dantu

机构 * University at Buffalo(布法罗大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出旋转感知点云嵌入,通过校准欧氏潜在距离与SO(3)测地误差,使无模型强化学习策略无需显式姿态或稠密流即可从点云目标实现手中重定向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17337 2026-06-23 eess.AS 新提交 50%

From Signals to Patterns: Non-Invasive Tuberculosis Detection from Cough Audio using Bandit Weighted Hyperbolic Prototypes

从信号到模式:使用Bandit加权双曲原型从咳嗽音频进行非侵入性结核病检测

Mohd Mujtaba Akhtar, Girish, Sanjam Wadhwa, Muskaan Singh, Ning Ma

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出COBALT框架,融合频谱特征与语音基础表示,通过码本对齐双曲原型和Bandit可靠性加权,在CODA TB DREAM挑战基准上实现最优性能。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13102 2026-06-23 cs.RO 新提交 50%

FTP-1: A Generalist Foundation Tactile Policy Across Tactile Sensors for Contact-Rich Manipulation

FTP-1:一种跨触觉传感器的通用基础触觉策略,用于密集接触操作

Chengbo Yuan, Zicheng Zhang, Mingjie Zhou, Wendi Chen, Yi Wang, Zhuoyang Liu, Dantong Niu, Shuo Wang, Hui Zhang, Wenkang Zhang, Yingdong Hu, Yuanqing Gong, Wanli Xing, Chuan Wen, Cewu Lu, Kaifeng Zhang, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Sharpa Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出FTP-1,首个通用基础触觉策略,通过异构编码器和共享Transformer专家,跨21种传感器和3000小时数据预训练,实现触觉操作技能的跨传感器迁移,在未见传感器上成功率提升31%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18659 2026-06-18 cs.SD 新提交 50%

Responsible ASR: Overcoming Challenges of Foundational Models in Narrow-Band and Low-Resource Settings

负责任的ASR:克服窄带和低资源场景下基础模型的挑战

Tejas Godambe, Nutan Choudhary, Sanket Shah, Nagaraj Adiga, Sharath Adavanne

机构 * Applied AI(应用人工智能)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文评估了开源和商业基础ASR模型在窄带对话中的表现,针对低资源语言印地语和低资源口音印度英语,发现零样本性能不佳,微调虽有改进但效果因语言和口音而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16209 2026-06-16 cs.DL cs.IR 新提交 50%

Viral Images: Identifying Reprintings within 1.5 Million Photographs in Chronicling America

病毒图像:在《记录美国》的150万张照片中识别翻印

Bruno Buccalon, Yueran Sun, Benjamin Charles Germain Lee

专题命中 预训练与数据 :pretraining(abstract)

AI总结 利用CLIP嵌入和聚类方法,在《记录美国》的150万张照片中无监督识别翻印内容,并构建交互式界面供人文学者研究。

Comments 13 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15938 2026-06-16 cs.CV cs.MM 新提交 50%

Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis

学习纵向胸部X光分析的方向性语义转变

Zhangfeng Hu, Zefan Yang, Ge Wang, Tanveer Syeda-Mahmood, Anushree Burade, Mannudeep Kalra, Pingkun Yan

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) Massachusetts General Hospital, Harvard Medical School(麻省总医院,哈佛医学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出ProTrans框架,将疾病进展建模为配对CXR研究间的方向性语义转变,利用放射学报告和可学习进展特征图显式编码语义变化,通过反向时间建模和双向重建一致性实现方向感知,在纵向下游任务中优于现有方法。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13700 2026-06-15 eess.SP cs.CV 新提交 50%

C-MambaPose: A Physics-Informed Complex Mamba Framework for Cross-Environment WiFi Human Pose Estimation

C-MambaPose:一种物理信息驱动的复杂Mamba框架用于跨环境WiFi人体姿态估计

Phuc Nguyen H

机构 * VinUniversity(文大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出C-MambaPose,一种结合物理信息的复值Mamba-GraFormer混合框架,通过相位保留表示和动态选择性感受野的时空复杂Mamba编码器,实现跨环境WiFi三维人体姿态估计,在MM-Fi数据集上以3.78M参数达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 50%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 50%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11710 2026-06-11 cs.CV 新提交 50%

ERN-Net : Evolving Reason Node-Net for Document Binarization

ERN-Net: 用于文档二值化的演化推理节点网络

Hsin-Jui Pan, Sheng-Wei Chan, Jen-Shiung Chiang

机构 * Dept. of Electrical Engineering Tamkang University(电子工程系 台湾科技大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出ERN-Net,通过演化推理节点和多尺度推理增强退化敏感区域,结合ConvNeXt-Tiny骨干网络和DIBCO预训练,在低数据低内存下实现高效文档二值化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11314 2026-06-11 cs.CV cs.GR 新提交 50%

TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions

TRON:追踪光线以编排用于3D高斯重建的神经渲染器

Or Perel, Hassan Abu Alhaija, Zian Wang, Jacob Munkberg, Matan Atzmon, Sanja Fidler, Masha Shugrina

机构 * NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出TRON框架,结合3D高斯光线追踪与神经渲染,实现真实世界3D场景在新光照、动态物体运动、物体插入和材质编辑下的逼真可控渲染,通过内在分解先验和光线追踪辐射引导,弥合物理渲染与神经渲染的差距。

Comments Project page: https://research.nvidia.com/labs/sil/projects/tron/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交 50%

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :preference optimization(abstract)

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10340 2026-06-10 cs.RO 新提交 50%

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

OMG: 面向通用人形机器人的全模态运动生成

Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出OMG框架,通过精心策划的数据流程和扩散模型,实现基于语言、音频和参考动作的全模态全身控制,展示了最先进的性能和可扩展性。

Comments Project Page: https://tsinghua-mars-lab.github.io/OMG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07050 2026-06-08 eess.SP 新提交 50%

Optimized Sampling of Angle-Resolved Scatterometry Data Using End-to-End Compressed Learning Model for Nanograss Deficiency Detection

使用端到端压缩学习模型优化角度分辨散射测量数据采样用于纳米草缺陷检测

Mehdi Abdollahpour, Carsten Bockelmann, Armin Dekorsy

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出端到端压缩学习框架,集成可学习纬度采样层与CNN,联合优化采样与分类,在减少90%采样点下保持94.2%的五级缺陷分类精度。

Comments Preprint. 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06978 2026-06-08 cs.CV 新提交 50%

CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection

CL-CLIP: 基于CLIP的持续学习框架与代价体积类别解耦用于目标检测

Zihan Liu, Yuguang Yang, Shengjie Su, Jianing Pang, Linlin Yang, Chunyu Xie, Nikolai Yu. Zolotykh, Baochang Zhang

机构 * National College for Excellent Engineers, Beihang University(卓越工程师学院,北京航空航天大学) AI Research, Qihoo 360(360人工智能研究院,奇虎360) School of Electronic Information Engineering, Beihang University(电子信息学院,北京航空航天大学) School of Cyber Science and Technology, Beihang University(网络安全科学与技术学院,北京航空航天大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学) State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) Institute of Information Technology, Mathematics and Mechanics, Lobachebsky University(信息技术、数学与力学学院,洛瓦茨基大学) School of Artificial Intelligence, Beihang University(人工智能学院,北京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出CL-CLIP框架,通过代价体积引导的类别解耦,增强开放词汇检测器的持续学习能力,缓解灾难性遗忘,在PASCAL VOC和MS-COCO上显著提升F-ViT基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06569 2026-06-08 cs.RO 新提交 50%

PhyRoGen: Synthetic Generation of Physical Robot Manipulation Puzzles Using Procedural Content Generation

PhyRoGen:使用程序化内容生成物理机器人操作谜题的合成生成

Lennart Julian Droß, Andreas Orthey, Marc Toussaint

机构 * Technical University of Berlin(柏林技术大学) Robotics Institute Germany(德国机器人研究所)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出PhyRoGen框架,利用程序化内容生成自动创建机器人操作谜题的合成数据集,生成的24个谜题可在1-300秒内求解,并在物理仿真中验证可操作性。

Comments 8 pages, accepted at CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏