arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10821 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2607.25085 2026-07-29 eess.AS 新提交 50%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24159 2026-07-28 cs.RO cs.CV 新提交 50%

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

DeVA:用于机器人策略学习的具有物理引导的解耦视频-动作模型

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究可泛化机器人操纵策略,提出DeVA模型,通过专门的视频和动作专家、多级特征转移及物理显著引导,实现丰富信息交换,使策略学习更易处理,在模拟和实际实验中展现良好性能。

Comments Project page with videos, code, and checkpoints: https://deva-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18576 2026-07-22 cs.CV 新提交 50%

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

通过程序合成数据实现番茄表型的文本条件分割

Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

机构 * Computer, Electrical and Mathematical Sciences and Engineering Division, KAUST(计算机、电气与数学科学与工程系,沙特阿卜杜拉国王科技大学) Department of Computer Science, University of Calgary(卡尔加里大学计算机科学系) Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Artificial Intelligence, Adam Mickiewicz University(亚当·密茨凯维奇大学人工智能系) Department of Electronics and Telecommunications, Polytechnic University of Turin(都灵理工大学电子与电信系)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对温室作物表型分析中缺乏标注数据问题,提出结合合成数据生成与基础模型微调的框架,通过对商业樱桃番茄温室建模生成合成数据集,微调SAM 3,显著提升分割性能,还公开相关模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18155 2026-07-21 cs.SE 新提交 50%

Testing Retrieval-Augmented Generation Systems with Chunk Coverage

用块覆盖率测试检索增强生成系统

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 预训练与数据 :language model(abstract)

AI总结 研究用块覆盖率(CC)测试检索增强生成(RAG)系统的检索组件,CC衡量语料块检索比例,可指导测试选择与生成,通过实验表明CC引导测试能更快达覆盖率且提高故障检测有效性,无需测试预言机就能捕捉检索多样性。

Comments ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17638 2026-07-21 cs.CV 新提交 50%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16285 2026-07-21 cs.CV 新提交 50%

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition

用于部分标记多任务面部表情识别的共享潜在空间

Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

机构 * Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT)(胡志明市理工大学计算机科学与工程学院) Dept. of AI, FPT University(FPT大学人工智能系) Department of Artificial Intelligence Convergence, Chonnam National University(全南国立大学人工智能融合系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对野外面部表情多任务且标注不完整不均衡的问题,提出将部分标记多任务学习视为对共享情感潜在空间的边缘化方法,在s-Aff-Wild2数据集上提升了表情和动作单元识别效果,得出相关结论并展示了小范围转移结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15058 2026-07-17 cs.CV cs.RO 新提交 50%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13178 2026-07-16 cs.CV 新提交 50%

A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition

一种用于无监督钢表面缺陷识别的掩码自动编码器方法

Shrey Patel

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对钢表面缺陷识别中标记数据稀缺问题,采用基于Transformer的掩码自动编码器,通过随机掩码部分图像块让轻量级解码器重建,联合辅助缺陷定位目标训练编码器,聚类预训练编码器特征,取得较高匹配准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11366 2026-07-14 cs.CV 新提交 50%

Self-supervised training for high-resolution close-range multispectral remote sensing imagery

高分辨率近程多光谱遥感影像的自监督训练

Leon-Friedrich Thomas, Mikael Änäkkälä, Antti Lajunen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究探索自监督学习在高分辨率多光谱无人机影像用于精准农业的有效性,用MoCo-v3等对基于Transformer的编码器预训练,在作物-杂草语义分割任务中表现出色,展示跨传感器和区域泛化能力,还提供芬兰多光谱无人机数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 50%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交 50%

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07542 2026-07-09 cs.RO cs.CV 新提交 50%

SonoRank: Towards Calibration-Free Real-Time Finger Flexion Detection from Forearm Ultrasound Sequences

SonoRank:迈向无需校准的实时前臂超声序列手指弯曲检测

Dean Zadok, Alon Wolf, Alex M. Bronstein, Oren Salzman

机构 * Technion(以色列理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对动力假肢手因依赖sEMG功能受限的问题,提出SonoRank方法,通过对超声序列对排序学习及微调,实现无需校准的手指弯曲检测,在交叉验证中F1分数比直接分类基线提高28%,推动超声假肢实用化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07534 2026-07-09 cs.CV 新提交 50%

Infinite Worlds with Versatile Interactions

具有通用交互的无限世界

Zelin Gao, Qiuyu Wang, Jiapeng Zhu, Jingye Chen, Zichen Liu, Qingyan Bai, Jiahao Wang, Yufeng Yuan, Hanlin Wang, Yichong Lu, Ka Leong Cheng, Haojie Zhang, Jian Gao, Tianrui Feng, Yuzheng Liu, Yao Yao, Yinghao Xu, Xing Zhu, Yujun Shen, Hao Ouyang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 介绍LingBot-World 2.0的升级,包括通过因果预训练实现无界交互、提炼实时变体保证快速响应,引入多样交互元素,集成智能控制并开发共享界面,还将主模型与轻量级模型配对便于单GPU部署。

Comments Project page: https://technology.robbyant.com/lingbot-world-v2 Code: https://github.com/robbyant/lingbot-world-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07230 2026-07-09 cs.CV 新提交 50%

`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation

用于自监督视频对象分割的注意力引导跨时间聚类

Waqas Arshid, Mohammad Awrangjeb, Alan Wee-Chung Liew, Yongsheng Gao

机构 * Griffith University(格里菲斯大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对视频对象分割任务,现有自监督方法存在问题。本文提出跨时间一致性和聚类框架,结合注意力引导令牌选择与轻量级时间聚类,通过显著性加权目标对齐软部分分配,利用冻结变压器主干实现有效扩展,提升自监督视频对象分割性能。

Comments Accepted for publication in Machine Intelligence Research journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06560 2026-07-08 cs.CV 新提交 50%

Vision as Unified Multimodal Generation

视觉作为统一的多模态生成

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。

Comments 48 pages,22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06238 2026-07-08 cs.CV 新提交 50%

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

PhyMRI-SR:迈向基于物理感知的MRI图像超分辨率

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Academy of AI for Science(上海人工智能研究院) Fudan University(复旦大学) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学生物医学工程学院与先进医学材料与器械国家重点实验室) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决MRI图像超分辨率问题,将其视为物理感知重建问题。核心方法是采用2D高斯点渲染并引入三项创新,包括先验感知高斯表示、物理约束信号建模和元学习框架。主要贡献是在动态分辨率数据集和标准基准上实现领先性能,有临床部署潜力。

Comments Project Page: https://bio-med-i2-lab.github.io/projects/PhyMRI-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03203 2026-07-07 eess.IV 新提交 50%

Mutually Exclusive Multiclass Lesion Segmentation in Neuroimaging: Binary-Guided Weak Supervision with Inter-Class Orthogonality

神经成像中的互斥多类病变分割:具有类间正交性的二元引导弱监督

Ashutosh Kumar, Vivek Dhamale, Vaanathi Sundaresan

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对神经成像中共存病变子类的弱监督分割难题,提出BiMEx-MS框架,将多类分割分解为全病变定位和排他性类分配,通过特定损失和形态学伪标签细化实现类间互斥,在多数据集上效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04747 2026-07-07 cs.CV 新提交 50%

MergeSurv: Merging-Based Continual Learning for Survival Analysis on Whole-Slide Images

MergeSurv:用于全切片图像生存分析的基于合并的持续学习

Vu Minh Tran, Doanh C. Bui, Maï K. Nguyen, Khang Nguyen

机构 * University of Information Technology(信息技术大学) Viet Nam National University Ho Chi Minh City(胡志明市越南国立大学) ETIS (UMR 8051), CY Cergy Paris University, ENSEA, CNRS, France(法国CY Cergy巴黎大学、ENSEA、法国国家科学研究中心联合建立的ETIS实验室(UMR 8051))

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对全切片图像生存分析,提出MergeSurv框架,独立微调病理视觉语言基础模型参数后合并,还探究两种推理策略,实验表明其优于其他方法且能减少灾难性遗忘。

Comments 10 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04400 2026-07-07 cs.NI 新提交 50%

On the Physical Plausibility and Distribution Alignment for Sim-to-Real RF Positioning

关于从仿真到实际射频定位的物理合理性与分布对齐

Ararat Saribekyan, Armen Manukyan, Hrant Khachatrian, Theofanis P. Raptis

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究基站校准、物理逼真度、合成数据规模及 RSSI 分布对齐对仿真到实际数据传输的影响。通过调整基站参数校准,对比不同校准方式及数据集,发现分布对齐对射频定位更重要。

Comments This work was supported by funding under the bilateral agreement between CNR (Italy) and HESC MESCS RA (Armenia) as part of the DeepRF project for the 2025-2026 biennium, and by the HESC MESCS RA grant No. 22rl-052 (DISTAL)

Journal ref 2026 International Conference on Computer, Information and Telecommunication Systems (CITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30988 2026-07-07 cs.RO 新提交 50%

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

多感官持续学习:将预训练的视觉运动策略适应到力觉

Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出MuSe方法,通过多阶段融合、多感官未来预测和预训练数据经验回放,将有限的多感官数据融入预训练的纯视觉策略,在保持原始任务性能的同时适应新任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02139 2026-07-03 cs.CV 新提交 50%

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

AdaCount: 基于相似性引导的空间与特征自适应无训练零样本目标计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫萨德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 针对零样本目标计数在密集小目标场景下的漏检和分割不佳问题,提出无训练框架AdaCount,通过原型驱动相似性图引导空间扭曲和特征调制,提升SAM3对目标区域的表征能力,达到新SOTA。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00223 2026-07-02 cs.CV 新提交 50%

Does Your ViT Still Need U-Net for Segmentation?

你的ViT做分割还需要U-Net吗?

Xin Li, Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Yanxi Chen, Yujian Xiong, Hao Wang, Oana M. Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Mayo Clinic(梅奥诊所)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文探究现代ViT骨干网络下医学图像分割是否仍需U-Net解码器,并提出基于查询的纯编码器分割框架EoSeg,在多个数据集上取得优异性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 50%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27084 2026-06-26 cs.CV eess.IV 新提交 50%

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

伪文本条件3D Grounding DINO用于腹部CT器官定位

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出CT-3GDINO,一种轻量级3D检测器,通过冻结伪文本类令牌替代真实文本编码器,实现腹部CT中五个器官的定位,在193个体积上达到0.5830 mAP。

Comments 24 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26800 2026-06-26 cs.RO 新提交 50%

SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation

SSI-Policy: 学习用于视觉语言机器人操作的结构化场景接口

Kaijun Wang, Zikai Ouyang, Xuping Wu, Jinyi Hong, Wei Pan, Haibo Lu, Jia Pan, Wei Zhang, Linfang Zheng

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) LimX Dynamics

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出SSI-Policy框架,通过统一的结构化场景接口(SSI)联合编码单目深度、语言锚定的物体布局和指令条件化的2D运动轨迹,实现从少量演示中学习机器人操作,在LIBERO基准上仅用10个演示即提升15%性能。

Comments Accepted by 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09457 2026-06-25 cs.RO 新提交 50%

$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models

$ω$-EVA:基于潜在交互世界模型的构想、验证与行动

Zhenguo Sun, Yu Sun, Hande Huang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出$ω$-EVA框架,通过潜在交互世界模型实现“构想-验证-行动”循环,利用动作条件潜在动力学和语言条件流策略生成动作,无需生成未来视频,在多种机器人操作任务中提升策略性能。

Comments Add some ablation experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24774 2026-06-24 cs.CV 新提交 50%

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

揭示视觉语言大模型中的训练数据暴露:基于参数梯度的方法

Zhihao Zhu, Hongyi Tang, Yi Yang, Ahmed Abbasi

机构 * Department of Information Systems, Business Statistics and Operations Management (ISOM), Hong Kong University of Science and Technology, Hong Kong, China(信息系统、商业统计与运营管理系(ISOM),香港科技大学,香港,中国) Department of IT, Analytics, and Operations, University of Notre Dame, Notre Dame, Indiana, USA(信息技术、分析与运营系,诺丁汉大学,诺丁汉,印第安纳州,美国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出梯度审计框架GradAudit,通过分析模型参数梯度特征检测训练数据,在医疗和通用数据集上显著优于现有方法,并揭示现有方法低估了未经授权数据使用程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交 50%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22276 2026-06-23 eess.AS cs.SD 新提交 50%

Learning from Audio-Dependency Errors: Data Curation Strategies Based on Model Confusion Patterns in Audio Question Answering

从音频依赖错误中学习:基于模型混淆模式的音频问答数据策展策略

Hyeonuk Nam

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出一种诊断性数据策展方法,通过探测音频-语言模型在不同音频条件下的混淆模式,筛选强音频依赖样本进行微调,在音频问答任务上提升准确率。

Comments DCASE 2025 Challenge Task5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏