arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-03-11 至 2026-03-11 共收录 10
2603.09877 2026-03-11 cs.CV

InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing

InternVL-U: 使统一多模态模型在理解、推理、生成和编辑方面更加普及

Changyao Tian, Danni Yang, Guanzhou Chen, Erfei Cui, Zhaokai Wang, Yuchen Duan, Penghao Yin, Sitao Chen, Ganlin Yang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Leyao Gu, Haomin Wang, Qi Wei, Jinhui Yin, Xue Yang, Zhihang Zhong, Qi Qin, Yi Xin, Bin Fu, Yihao Liu, Jiaye Ge, Qipeng Guo, Gen Luo, Hongsheng Li, Yu Qiao, Kai Chen, Hongjie Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Xiamen University(厦门大学) CUHK MMLab(香港中文大学MMLab)

AI总结 InternVL-U通过轻量级统一多模态模型,在保持强大生成能力的同时,实现了在理解、推理、生成和编辑方面的高效平衡。

Comments technical report, 61 pages, https://github.com/OpenGVLab/InternVL-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09712 2026-03-11 cs.RO

Robotic Scene Cloning:Advancing Zero-Shot Robotic Scene Adaptation in Manipulation via Visual Prompt Editing

机器人场景克隆:通过视觉提示编辑推进零样本机器人场景适应在操作中

Binyuan Huang, Yuqing Wen, Yucheng Zhao, Yaosi Hu, Tiancai Wang, Chang Wen Chen, Haoqiang Fan, Zhenzhong Chen

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Dexmal The Hong Kong Polytechnic University(香港理工大学)

AI总结 机器人场景克隆通过视觉提示编辑提升零样本机器人场景适应能力,实现跨场景的高效操作性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09527 2026-03-11 cs.LG cs.AI

Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation

通过参数和数据高效适应实现草稿模型的高效对齐

Luxi Lin, Zhihang Lin, Zhanpeng Zeng, Yuhao Chen, Qingyu Zhang, Jixiang Luo, Xuelong Li, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Shanghai Innovation Institute(上海创新研究院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI)) University of Science and Technology of China (USTC)(中国科学技术大学)

AI总结 本文提出高效草稿适应框架EDA,通过解耦架构、数据再生策略和样本选择机制,实现草稿模型在特定领域微调时的高效适应,降低训练成本并提升推测解码性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09312 2026-03-11 cs.CV

IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

IntroSVG: 通过反思生成器-批评者框架从渲染反馈中学习以实现文本到SVG生成

Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao

机构 * Fudan University(复旦大学) TeleAI Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 IntroSVG通过反思生成器-批评者框架,结合监督微调和直接偏好优化,实现文本到SVG生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09259 2026-03-11 cs.CV cs.RO

Implicit Geometry Representations for Vision-and-Language Navigation from Web Videos

从网络视频中隐式几何表示的视觉-语言导航

Mingfei Han, Haihong Hao, Liang Ma, Kamila Zhumakhanova, Ekaterina Radionova, Jingyi Zhang, Xiaojun Chang, Xiaodan Liang, Ivan Laptev

机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区)

AI总结 本研究提出基于网络视频的隐式几何表示方法,用于视觉-语言导航,通过提升数据利用率和鲁棒性,实现更广泛的应用。

Comments Extension of CVPR 2025 RoomTour3D with implicit geometric representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05871 2026-03-11 cs.CV

Pathwise Test-Time Correction for Autoregressive Long Video Generation

逐帧测试时校正用于自回归长视频生成

Xunzhi Xiang, Zixuan Duan, Guiyu Zhang, Haiyu Zhang, Zhe Gao, Junta Wu, Shaofeng Zhang, Tengfei Wang, Qi Fan, Chunchao Guo

机构 * Nanjing University(南京大学) Tencent Hunyuan(腾讯文言) Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出TTC方法,通过利用初始帧作为参考锚点,有效校正自回归长视频生成中的漂移问题,提升生成质量并延长生成长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18811 2026-03-11 cs.CV cs.AI

Mitigating Long-Tail Bias in HOI Detection via Adaptive Diversity Cache

通过自适应多样性缓存缓解HOI检测中的长尾偏差

Yuqiu Jiang, Xiaozhen Qiao, Yifan Chen, Ye Zheng, Zhe Sun, Xuelong Li

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

AI总结 本文提出自适应多样性缓存模块,通过无训练机制缓解HOI检测中的长尾偏差,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01290 2026-03-11 cs.LG cs.AI

Rating Quality of Diverse Time Series Data by Meta-learning from LLM Judgment

通过LLM判断对异质时间序列数据进行质量评级

Shunyu Wu, Dan Li, Wenjie Feng, Haozheng Ye, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) State Key Laboratory of Al Safety(人工智能安全国家重点实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出TSRating框架,利用LLM判断对异质时间序列数据进行质量评级,通过元学习提升跨领域适应性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21147 2026-03-11 cs.LG

Semi-Supervised Conformal Prediction With Unlabeled Nonconformity Score

半监督置信预测与未标记非一致性评分

Xuanning Zhou, Zihao Shi, Hao Zeng, Xiaobo Xia, Bingyi Jing, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出SemiCP,通过结合标记和未标记数据提升置信预测的覆盖性能,实验表明在有限标记数据下可显著降低覆盖差距。

Comments Accept by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09084 2026-03-11 cs.CV

OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing

OmniEdit: 一种无需训练的唇同步与音频视觉编辑框架

Lixiang Lin, Siyuan Jin, Jinshan Zhang

机构 * HiThink Research(HiThink研究机构) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

AI总结 OmniEdit提出一种无需训练的框架,通过替换编辑序列和去除随机元素,实现唇同步与音频视觉编辑的高效稳定处理。

详情

展开后加载摘要…

URL PDF HTML 收藏