arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2403.01528 2025-12-01 cs.CL cs.AI q-bio.BM

Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey

利用生物分子和自然语言通过多模态学习:一篇综述

Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

AI总结 本文综述了生物分子与自然语言多模态学习的最新进展,探讨了技术表示、多模态整合方法、应用实例及未来研究方向。

Comments 2025.11.28 Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22659 2025-12-01 cs.AI cs.CV

Geometrically-Constrained Agent for Spatial Reasoning

几何约束代理用于空间推理

Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室)

AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22456 2025-12-01 cs.CV

ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models

ITS3D: 推理时缩放用于文本引导的3D扩散模型

Zhenglin Zhou, Fan Ma, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * ReLER, Zhejiang University(浙江大学ReLER实验室) National University of Singapore(新加坡国立大学)

AI总结 ITS3D通过优化问题和验证器引导搜索算法,提升文本引导的3D扩散模型生成质量。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22357 2025-12-01 cs.CV

AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows

AnchorFlow: 基于潜在锚点对齐流的无训练3D编辑

Zhenglin Zhou, Fan Ma, Chengzhuo Gui, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 AnchorFlow通过潜在锚点对齐流实现无训练3D编辑,确保编辑过程中的稳定性和语义一致性,提升编辑效果和几何保真度。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22146 2025-12-01 cs.CL

C$^2$DLM: Causal Concept-Guided Diffusion Large Language Models

C$^2$DLM: 基于因果概念的扩散大语言模型

Kairong Han, Nuanqiao Shan, Ziyu Zhao, Zijing Hu, Xinpeng Dong, Junjian Ye, Lujia Pan, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Noah’s Ark Lab, Huawei Technologies(华为技术有限公司诺亚实验室)

AI总结 C$^2$DLM通过引入因果概念引导机制,提升大语言模型在推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21977 2025-12-01 cs.CV

Motion Matters: Motion-guided Modulation Network for Skeleton-based Micro-Action Recognition

动作至关重要:用于基于骨骼的微动作识别的运动引导调制网络

Jihao Gu, Kun Li, Fei Wang, Yanyan Wei, Zhiliang Wu, Hehe Fan, Meng Wang

机构 * University College London(伦敦大学学院) ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院、合肥综合性国家科学中心) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)

AI总结 本文提出运动引导调制网络MMN,通过骨骼和帧级运动线索调制提升微动作识别的准确性。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02961 2025-12-01 cs.CL

FlowerTune: A Cross-Domain Benchmark for Federated Fine-Tuning of Large Language Models

FlowerTune: 一个跨领域用于联邦微调大型语言模型的基准测试

Yan Gao, Massimo Roberto Scamarcia, Javier Fernandez-Marques, Mohammad Naseri, Chong Shen Ng, Dimitris Stripelis, Zexi Li, Tao Shen, Jiamu Bai, Daoyuan Chen, Zikai Zhang, Rui Hu, InSeo Song, Lee KangYoon, Hong Jia, Ting Dang, Junyan Wang, Zheyuan Liu, Daniel Janes Beutel, Lingjuan Lyu, Nicholas D. Lane

机构 * Flower Labs(Flower实验室) University of Cambridge(剑桥大学) Zhejiang University(浙江大学) Penn State University(宾夕法尼亚州立大学) Alibaba Group(阿里巴巴集团) University of Nevada, Reno(内华达大学拉斯维加斯分校) Gachon University(加荣大学) The University of Auckland(奥克兰大学) The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学) Sony AI(索尼人工智能)

AI总结 FlowerTune提出一个跨领域联邦微调LLM的基准测试,评估26种模型在四个领域中的性能,提供隐私保护和领域适应的见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20270 2025-12-01 cs.CV

ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation

ParticleGS: 从视频中学习神经高斯粒子动力学以实现无先验的物理运动外推

Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) North China University of Technology(华北理工大学) University of Science and Technology of China(中国科学技术大学)

AI总结 ParticleGS通过学习神经高斯粒子动力学,实现无先验的物理运动外推,提升动态3D场景的预测准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14684 2025-12-01 cs.CL cs.AI

Mind the Gap: Bridging Thought Leap for Improved Chain-of-Thought Tuning

注意间隔:为改进链式推理微调而弥合思维跳跃

Haolei Xu, Yuchen Yan, Yongliang Shen, Wenqi Zhang, Guiyang Hou, Shengpei Jiang, Kaitao Song, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) SF Technology(SF技术) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出CoT思维跳跃桥任务,通过生成缺失的中间推理步骤提升数学推理任务的性能,实验表明在NuminaMath上改进达+5.87%。

Comments Accepted to NeurIPS 2025. Camera ready version. Code: https://github.com/ZJU-REAL/Mind-the-Gap Project: https://zju-real.github.io/CoT-Bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21265 2025-11-27 cs.CV

Unlocking Zero-shot Potential of Semi-dense Image Matching via Gaussian Splatting

通过高斯点划技术解锁半密集图像匹配的零样本潜力

Juncheng Chen, Chao Xu, Yanjun Cao

机构 * Zhejiang University(浙江大学) Huzhou Institute of Zhejiang University(浙江大学湖州研究院)

AI总结 MatchGS通过高斯点划技术系统修正3DGS几何结构,生成高精度对应标签,提升零样本图像匹配性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01812 2025-11-27 cs.CY cs.AI cs.CL

From Text to Multimodality: Exploring the Evolution and Impact of Large Language Models in Medical Practice

从文本到多模态:探索大型语言模型在医疗实践中的演变与影响

Qian Niu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Junyu Liu, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Benji Peng, Xinyuan Song, Ziyuan Qin, Riyang Bao, Zekun Jiang

机构 * Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Indiana University(印第安纳大学) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(Purdue 大学) Emory University, Atlanta, GA, USA(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)

AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02387 2025-11-27 cs.AI cs.CL

Large Language Models and Cognitive Science: A Comprehensive Review of Similarities, Differences, and Challenges

大语言模型与认知科学:对相似性、差异性和挑战的全面综述

Qian Niu, Junyu Liu, Ziqian Bi, Pohsun Feng, Benji Peng, Keyu Chen, Ming Li, Lawrence KQ Yan, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Ziyuan Qin, Riyang Bao, Xinyuan Song, Zekun Jiang

机构 * Kyoto University(京都大学) Indiana University(印第安纳大学) National Taiwan Normal University(台湾师范大学) Georgia Institute of Technology(佐治亚理工学院) Hong Kong University of Science(香港科学大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) University of Liverpool, UK(利物浦大学) University of Edinburgh, UK(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(普渡大学) Emory University(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University(四川大学西昌生物大数据中心、西昌医院)

AI总结 本文综述了大语言模型与认知科学的相似性、差异性和挑战,探讨了LLMs在认知领域的应用及改进方法。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10431 2025-11-27 cs.CV cs.AI

ProtoPFormer: Concentrating on Prototypical Parts in Vision Transformers for Interpretable Image Recognition

ProtoPFormer: 在视觉变换器中聚焦原型部分以实现可解释的图像识别

Mengqi Xue, Qihan Huang, Haofei Zhang, Jingwen Hu, Jie Song, Mingli Song, Canghong Jin

机构 * Hangzhou City University(杭州市大学) Zhejiang University(浙江大学) ZJU-Bangsun Joint Research Center(浙大- bangsun 联合研究中心)

AI总结 ProtoPFormer通过引入全局和局部原型,提升视觉变换器在可解释图像识别中的性能和可解释性。

Comments Arxiv preprint; 18 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20614 2025-11-26 cs.CV

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

一致性批评者:通过参考引导的注意对齐纠正生成图像中的不一致

Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou

机构 * VCIP, Nankai University Show Lab, National University of Singapore State Key Laboratory of CAD\&CG, Zhejiang University

AI总结 本文提出ImageCritic,通过参考引导的注意力对齐方法纠正生成图像中的不一致问题,提升细粒度细节的一致性。

Comments Project page: https://ouyangziheng.github.io/ImageCritic-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20609 2025-11-26 cs.LG

Adaptive Hopfield Network: Rethinking Similarities in Associative Memory

自适应Hopfield网络:重新思考关联记忆中的相似性

Shurong Wang, Yuqi Pan, Zhuoyang Shen, Meng Zhang, Hongwei Wang, Guoqi Li

机构 * Zhejiang University(浙江大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出自适应相似度机制,通过自适应Hopfield网络在多种任务中实现更准确的关联记忆检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19990 2025-11-26 cs.CV

OmniRefiner: Reinforcement-Guided Local Diffusion Refinement

OmniRefiner: 基于强化学习的局部扩散细化

Yaoli Liu, Ziheng Ouyang, Shengtao Lou, Yiren Song

机构 * Zhejiang University(浙江大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学)

AI总结 OmniRefiner通过强化学习和局部扩散细化技术,提升参考引导图像生成中细粒度细节的保留与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19902 2025-11-26 cs.CR cs.AI

Zero-Knowledge Proof Based Verifiable Inference of Models

基于零知识证明的可验证模型推断

Yunxiao Wang

机构 * Zhejiang University(浙江大学)

AI总结 本文提出一种基于零知识证明的框架,实现无需暴露模型参数的深度学习推断验证,通过递归组合零知识证明和Fiat-Shamir启发式方法,生成固定大小的zkSNARK证明,验证DeepSeek模型的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19851 2025-11-26 cs.LG cs.DC

Accelerating Wireless Distributed Learning via Hybrid Split and Federated Learning Optimization

通过混合分割与联邦学习优化加速无线分布式学习

Kun Guo, Xuefei Li, Xijun Wang, Howard H. Yang, Wei Feng, Tony Q. S. Quek

机构 * School of Communications and Electronics Engineering, East China Normal University(通信与电子工程学院,东华大学) School of Electronics and Information Technology, Sun Yat-sen University(电子与信息学院,中山大学) Zhejiang University/University of Illinois at Urbana-Champaign Institute, Zhejiang University(浙江大学/伊利诺伊大学厄巴纳-香槟分校研究院,浙江大学) Department of Electronic Engineering, State Key Laboratory of Space Network and Communications, Tsinghua University(电子工程系,空间网络与通信国家重点实验室,清华大学) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息系统技术与设计学院,新加坡科技设计大学)

AI总结 本文提出混合分割与联邦学习优化方法,通过学习模式选择、批量大小优化和资源联合优化,提升无线分布式学习的收敛速度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19830 2025-11-26 cs.DB cs.AI

Beyond Relational: Semantic-Aware Multi-Modal Analytics with LLM-Native Query Optimization

超越关系:基于语义的多模态分析与LLM原生查询优化

Junhao Zhu, Lu Chen, Xiangyu Ke, Ziquan Fang, Tianyi Li, Yunjun Gao, Christian S. Jensen

机构 * Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

AI总结 Nirvana通过结合可编程语义运算符和LLM原生查询优化,实现多模态数据分析,显著提升效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19435 2025-11-26 cs.CV

Are Image-to-Video Models Good Zero-Shot Image Editors?

图像到视频模型是否是良好的零样本图像编辑器?

Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 IF-Edit通过无需微调的框架,利用预训练图像到视频扩散模型实现指令驱动的图像编辑,解决提示错位、冗余时间潜在特征和模糊后期帧问题,展现强大的推理能力和通用编辑竞争力。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19786 2025-11-26 cs.CV

MAPo : Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction

MAPo : 基于变形3D高斯点散布的运动感知分区以实现高保真的动态场景重建

Han Jiao, Jiakai Sun, Yexing Xu, Lei Zhao, Wei Xing, Huaizhong Lin

机构 * Zhejiang University(浙江大学) Sun Yat-Sen University(中山大学)

AI总结 MAPo通过动态分区策略提升动态场景重建的保真度,以高动态3D高斯点的精细建模和跨帧一致性损失解决运动细节与渲染质量的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08640 2025-11-26 cs.CV

Orientation Matters: Making 3D Generative Models Orientation-Aligned

方向至关重要:使3D生成模型方向对齐

Yichong Lu, Yuzhuo Tian, Zijin Jiang, Yikun Zhao, Yuanbo Yang, Hao Ouyang, Haoji Hu, Huimin Yu, Yujun Shen, Yiyi Liao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出方向对齐的3D物体生成方法,通过构建Objaverse-OA数据集并微调两种生成模型,实现跨类别的方向一致性,提升下游任务性能。

Comments Accepted by NeurIPS 2025. Project Page: https://xdimlab.github.io/Orientation_Matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18525 2025-11-26 cs.CV

TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation

TK-Mamba:将KAN与Mamba结合用于文本驱动的3D医学图像分割

Haoyu Yang, Yutong Guan, Meixing Shi, Yuxiang Cai, Jintao Chen, Sun Bing, Wenhui Lei, Mianxin Liu, Xiaoming Shi, Yankai Jiang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Research Center, National Certification Technology (Hangzhou) Co., Ltd(国家认证技术(杭州)有限公司研究部) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学)

AI总结 TK-Mamba通过融合KAN与Mamba,提出文本驱动的3D医学图像分割方法,实现高效准确的多器官和肿瘤分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16655 2025-11-26 cs.CV

MovieDreamer: Hierarchical Generation for Coherent Long Visual Sequence

MovieDreamer:用于生成连贯长视觉序列的分层生成

Canyu Zhao, Mingyu Liu, Wen Wang, Weihua Chen, Fan Wang, Hao Chen, Bo Zhang, Chunhua Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。

Comments 30 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19561 2025-11-26 cs.LG cs.AI cs.CV

Merging without Forgetting: Continual Fusion of Task-Specific Models via Optimal Transport

无遗忘的融合:通过最优传输实现任务特定模型的持续融合

Zecheng Pan, Zhikang Chen, Ding Li, Min Zhang, Sen Cui, Hongshuo Jin, Luqi Tao, Yi Yang, Deheng Ye, Yu Zhang, Tingting Zhu, Tianling Ren

机构 * Tsinghua University(清华大学) University of Oxford(牛津大学) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Tencent(腾讯) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出OTMF方法,通过最优传输理论解决模型融合中的分布偏移问题,实现任务特定模型的持续融合,提升多任务系统的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19425 2025-11-25 cs.CV

SAM3-Adapter: Efficient Adaptation of Segment Anything 3 for Camouflage Object Segmentation, Shadow Detection, and Medical Image Segmentation

SAM3-Adapter: 高效适应Segment Anything 3用于伪装物分割、阴影检测和医学图像分割

Tianrun Chen, Runlong Cao, Xinda Yu, Lanyun Zhu, Chaotao Ding, Deyi Ji, Cheng Chen, Qi Zhu, Chunyan Xu, Papa Mao, Ying Zang

机构 * KOKONI, Moxin (Huzhou) Tech. Co., LTD(摩西(湖州)科技有限公司) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Information Engineering, Huzhou University(湖州大学信息工程学院) School of Electrical and Electronic Engineering, Nanyang Technological University(新加坡南洋理工大学电子与电气工程学院) College of Computing and Data Science, Nanyang Technological University(新加坡南洋理工大学计算与数据科学学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 SAM3-Adapter通过高效适配框架提升SAM3在伪装物分割、阴影检测和医学影像分割等任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19268 2025-11-25 cs.CV

BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment

BideDPO:基于文本和条件对齐的同时图像生成

Dewei Zhou, Mingwei Li, Zongxin Yang, Yu Lu, Yunqiu Xu, Zhizhong Wang, Zeyi Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Huawei Technologies Ltd., China(华为技术有限公司)

AI总结 BideDPO通过双向解耦的DPO框架解决文本与条件间的冲突,提升图像生成的准确性和一致性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏