arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-07-24 至 2026-07-24 共收录 8
2607.21550 2026-07-24 cs.LG 新提交

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21504 2026-07-24 cs.CV 新提交

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Texture++:使用区域感知扩散模型提升3D资产纹理分辨率

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) North China Electric Power University(华北电力大学)

AI总结 针对3D资产纹理分辨率低问题,提出Texture++框架,通过在UV空间重新表述超分辨率任务,采用自适应视图选择、四叉树纹理区域组织及基于扩散的超分辨率模型,提升纹理分辨率,相比现有方法显著改进了纹理细节与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21239 2026-07-24 cs.CV 新提交

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

用于稳健线性偏振估计的斯托克斯信息扩散

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工学院) School of Automation, Central South University(中南大学自动化学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 研究从单张RGB图像估计线性偏振问题,提出基于穆勒形式主义的GenPolar框架,通过预测斯托克斯分量并结合可观测性感知损失监督偏振角,采用两阶段训练策略,在多数据集实验中性能达先进水平,提升下游应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20924 2026-07-24 cs.CV 新提交

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21284 2026-07-24 cs.LG cs.AI cs.ET math.AP 版本更新

PILD: Physics-Informed Learning via Diffusion

PILD:通过扩散进行物理引导学习

Tianyi Zeng, Tianyi Wang, Jiaru Zhang, Zimo Zeng, Feiyang Zhang, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Tongji University, Shanghai, China(同济大学) University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校)

AI总结 PILD通过引入虚拟残差观测和条件嵌入模块,结合物理约束与扩散模型,提升工程和科学任务中生成模型的准确性、稳定性和泛化能力。

Comments 34 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏