arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2508.17188 2026-04-14 cs.AI

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10953 2026-04-14 cs.CL

A Multilingual Dataset and Empirical Validation for the Mutual Reinforcement Effect in Information Extraction

一种多语言数据集和信息提取中相互强化效应的实证验证

Chengguang Gan, Sunbowen Lee, Qingyu Yin, Yunhao Liang, Xinyang He, Hanjun Wei, Younghun Lim, Shijian Wang, Hexiang Huang, Qinghao Zhang, Shiwen Ni, Tatsunori Mori

机构 * Yokohama National University(横滨国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) Southeast University(东南大学) University of Tsukuba(筑波大学) Pusan National University(釜山大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出多语言MRE混合数据集,通过LLM辅助框架减少标注工作,验证了多语言环境下信息提取中相互强化效应的普遍性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14299 2026-04-14 cs.CL cs.AI

Template-assisted Contrastive Learning of Task-oriented Dialogue Sentence Embeddings

基于模板的对话句嵌入对比学习

Minsik Oh, Jiwei Li, Guoyin Wang

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) Alibaba Qwen Pilot(阿里巴巴Qwen Pilot)

AI总结 本文提出TaDSE方法,利用模板信息通过自监督对比学习学习对话句嵌入,通过合成数据集增强效果,并在五个对话基准数据集上验证了其有效性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10218 2026-04-14 cs.CV

SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation

SMFormer:通过基础模型和数据增强赋能自监督立体匹配

Yun Wang, Zhengjie Yang, Jiahao Zheng, Zhanjie Zhang, Dapeng Oliver Wu, Yulan Guo

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Hong Kong Generative AI Research and Development Center, The Hong Kong University of Science and Technology(香港科技大学香港生成式人工智能研发中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electronics and Communication Engineering, the Shenzhen Campus of Sun Yat-sen University, Sun Yat-sen University(中山大学深圳校区电子与通信工程学院)

AI总结 本文提出SMFormer框架,结合基础模型和数据增强提升自监督立体匹配的鲁棒性与准确性,在多个基准测试中达到SOTA水平,甚至超越部分监督方法。

Journal ref IEEE Transactions on Image Processing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10132 2026-04-14 cs.CV cs.AI

Semantic Manipulation Localization

语义操控定位

Zhenshan Tan, Chenhan Lu, Yuxiang Huang, Ziwen He, Xiang Zhang, Yuzhe Sha, Xianyi Chen, Tianrun Chen, Zhangjie Fu

机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证教育部工程研究中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) KOKONI3D, Moxin (Hangzhou) Technology Company Ltd.(KOKONI3D,魔芯(杭州)科技有限公司)

AI总结 本文提出语义操控定位任务,通过TRACE框架实现对图像中微妙语义编辑的定位,优于传统IML方法,提供更完整的定位结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09651 2026-04-14 cs.CV cs.LG cs.RO

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09590 2026-04-14 cs.AI cs.CL cs.CY

DeepReviewer 2.0: A Traceable Agentic System for Auditable Scientific Peer Review

DeepReviewer 2.0:一个可追溯的代理系统用于可审计的科学同行评审

Yixuan Weng, Minjun Zhu, Qiujie Xie, Zhiyuan Ning, Shichen Li, Panzhong Lu, Zhen Lin, Enhao Gu, Qiyao Sun, Yue Zhang

机构 * Engineering School, Westlake University(西湖大学工学院) Zhejiang University(浙江大学) Soochow University(苏州大学)

AI总结 DeepReviewer 2.0通过可追溯的审查包和可执行的后续行动,提升同行评审的可审计性,其在134个提交中优于人类评审和现有自动系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09553 2026-04-14 cs.IR cs.AI

SRBench: A Comprehensive Benchmark for Sequential Recommendation with Large Language Models

SRBench: 一个面向大型语言模型的序列推荐综合基准

Jianhong Li, Zeheng Qian, Wangze Ni, Haoyang Li, Hongwei Yao, Yang Bai, Kui Ren

机构 * Zhejiang University(浙江大学)

AI总结 SRBench通过多维框架、统一输入范式和新型提取机制,解决序列推荐模型评估中的公平性、稳定性与效率问题,揭示LLM-SR模型过度关注流行度而缺乏深度理解的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22153 2026-04-14 cs.CV cs.AI

Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation

超越瓷砖匹配:连接不一致的航空和卫星视图以实现仅视觉UAV导航

Kejia Liu, Haoyang Zhou, Ruoyu Xu, Peicheng Wang, Mingli Song, Haofei Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

AI总结 本文提出Bearing-UAV方法,通过联合预测UAV绝对位置和航向实现跨视图导航,提升在复杂环境下的定位精度和鲁棒性。

Comments Accepted as a conference paper by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06003 2026-04-14 cs.LG

EvoESAP: Non-Uniform Expert Pruning for Sparse MoE

EvoESAP: 非均匀专家修剪用于稀疏MoE

Zongfang Liu, Shengkun Tang, Boyang Sun, Zhiqiang Shen, Xin Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出EvoESAP,通过非均匀层间稀疏分配提升稀疏MoE模型的生成能力,同时保持多选准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16309 2026-04-14 cs.CR cs.AI

The Weight of a Bit: EMFI Sensitivity Analysis of Embedded Deep Learning Models

比特的重量:嵌入式深度学习模型的EMFI敏感性分析

Jakub Breier, Štefan Kučerák, Xiaolu Hou

机构 * TTControl GmbH(TTControl公司) Faculty of Informatics and Information Technologies, Slovak University of Technology(斯洛伐克理工大学信息学与信息技术学院) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)

AI总结 本文研究四种数表示对EMFI攻击成功的影响,发现整数表示比浮点表示更抗攻击,尤其8位整数在较大网络中保持较高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10042 2026-04-14 cs.CV cs.AI

Fake-HR1: Rethinking Reasoning of Vision Language Model for Synthetic Image Detection

Fake-HR1: 重新思考视觉语言模型在合成图像检测中的推理方式

Changjiang Jiang, Xinkuan Sha, Fengchang Yu, Jingjing Liu, Jian Liu, Mingqi Fang, Chenfeng Zhang, Wei Lu

机构 * Wuhan University(武汉大学) AntGroup(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 Fake-HR1通过两阶段训练框架实现自适应推理,提升合成图像检测性能与效率,优于现有LLMs。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24574 2026-04-14 cs.LG cs.AI

DistDF: Time-Series Forecasting Needs Joint-Distribution Wasserstein Alignment

DistDF:时间序列预测需要联合分布Wasserstein对齐

Hao Wang, Licheng Pan, Yuan Lu, Zhixuan Chu, Xiaoxi Li, Shuting He, Zhichao Chen, Haoxuan Li, Qingsong Wen, Zhouchen Lin

机构 * Xiaohongshu Inc.(小红书公司) College of Control Science and Technology, Zhejiang University(浙江大学控制科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算与人工智能学院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Squirrel AI(松鼠AI) Center for Data Science, Peking University(北京大学数据科学中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 DistDF通过最小化预测序列与标签序列条件分布之间的分布差异,解决传统直接预测方法在标签序列自相关时的偏差问题,提升多种预测模型性能。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07286 2026-04-14 cs.LG cs.AI q-bio.BM q-bio.QM

Evolutionary Profiles for Protein Fitness Prediction

蛋白质适应性预测的进化图谱

Jigang Fan, Xiaoran Jiao, Shengdong Lin, Zhanming Liang, Weian Mao, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) East China University of Science and Technology(华东理工大学) Chengdu University of Information Technology(成都信息工程大学) Massachusetts Institute of Technology(麻省理工学院) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出EvoIF模型,通过整合进化信号提升蛋白质突变适应性预测性能,采用轻量结构和逆强化学习框架,在有限数据下实现高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01917 2026-04-14 cs.DC cs.LG

A Heavy-Load-Enhanced and Changeable-Periodicity-Perceived Workload Prediction Network

一种增强负载和可变周期性感知的工作负载预测网络

Feiyi Chen, Naijin Liu, Zhen Qin, Hailiang Zhao, Mengchu Zhou, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Beijing Wuzi University(北京物资学院) Zhejiang Gongshang University(浙江工商大学)

AI总结 本文提出PePNet,通过自动检测周期长度和适应性融合周期信息,提升可变周期时间序列中稀有高负载预测的准确性,实验表明其在整体和高负载预测上分别提升11.8%和21.0%。

Comments Submitted to TII 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09529 2026-04-13 cs.CV cs.AI cs.CL

VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning

VL-Calibration:解耦的大型视觉-语言模型推理置信度校准

Wenyi Xiao, Xinchi Xu, Leilei Gan

机构 * Zhejiang University(浙江大学)

AI总结 本文提出VL-Calibration,通过强化学习框架解耦视觉和推理置信度,提升大视觉-语言模型的校准与视觉推理准确率。

Comments 24 pages, ACL 2026 Main. Repository: https://github.com/Mr-Loevan/VL-Calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09366 2026-04-13 cs.CV

Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors

具有不确定性感知先验的鲁棒4D视觉几何变换器

Ying Zang, Yidong Han, Chaotao Ding, Yuanqi Hu, Deyi Ji, Qi Zhu, Xuanfu Li, Jin Ma, Lingyun Sun, Tianrun Chen, Lanyun Zhu

机构 * Zhejiang University(浙江大学) Huzhou University(湖州师范学院) Huawei(华为) Tongji University(同济大学)

AI总结 本文提出一种框架,通过建模重建过程中的不确定性,分离动态和静态成分,采用熵引导子空间投影、局部一致性驱动几何净化和不确定性感知多视角一致性机制,提升动态场景重建的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27222 2026-04-13 cs.CV

HD-VGGT: High-Resolution Visual Geometry Transformer

HD-VGGT:高分辨率视觉几何变换器

Tianrun Chen, Yuanqi Hu, Yidong Han, Hanjie Xu, Deyi Ji, Qi Zhu, Chunan Yu, Xin Zhang, Cheng Chen, Chaotao Ding, Ying Zang, Xuanfu Li, Jin Ma, Lanyun Zhu

机构 * Zhejiang University(浙江大学) Huzhou University(湖州师范学院) Nanjing University of Science and Technology(南京理工大学) Huawei(华为) Tongji University(同济大学)

AI总结 HD-VGGT通过双分支架构实现高效稳定的高分辨率3D重建,利用低分辨率分支生成全局一致的几何结构,高分辨率分支通过学习的特征上采样模块细化细节,采用特征调制技术抑制不稳定特征,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00035 2026-04-13 cs.CL cs.AI cs.LG

Constraining Sequential Model Editing with Editing Anchor Compression

通过编辑锚压缩约束序列模型编辑

Hao-Xiang Xu, Jun-Yu Ma, Zhen-Hua Ling, Ningyu Zhang, Jia-Chen Gu

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China(中国科学技术大学语音及语言信息处理国家工程研究中心) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文提出Editing Anchor Compression框架,通过选择重要编辑锚点压缩参数矩阵,减少序列编辑中的偏差,保留模型通用能力并提升编辑知识保留度。

Comments Accepted by NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09089 2026-04-13 cs.SE cs.AI cs.CR

DeepGuard: Secure Code Generation via Multi-Layer Semantic Aggregation

DeepGuard:通过多层语义聚合实现安全代码生成

Li Huang, Zhongxin Liu, Yifan Wu, Tao Yin, Dong Li, Jichao Bi, Nankun Mu, Hongyu Zhang, Meng Yan

机构 * Chongqing University(重庆大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全全国重点实验室,浙江大学) Peking University(北京大学)

AI总结 DeepGuard通过多层语义聚合提升代码生成的安全性,实验表明其在安全性和功能性上均优于基线模型,有效检测并减少不安全模式。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08585 2026-04-13 cs.DB cs.AI

QCFuse: Query-Centric Cache Fusion for Efficient RAG Inference

QCFuse:基于查询的缓存融合用于高效RAG推理

Jianxin Yan, Zeheng Qian, Wangze Ni, Zhitao Shen, Zhiping Wang, Haoyang Li, Jia Zhu, Lei Chen, Kui Ren

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) Zhejiang Normal University(浙江师范大学)

AI总结 QCFuse通过基于查询的缓存融合提升RAG推理效率,利用语义摘要锚点优化查询表示并选择性重计算相关token,实验证明在保持准确性的同时提升响应效率40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08582 2026-04-13 cs.LG cs.AI

Multivariate Time Series Anomaly Detection via Dual-Branch Reconstruction and Autoregressive Flow-based Residual Density Estimation

多变量时间序列异常检测通过双分支重建和自回归流基于残差密度估计

Jun Liu, Ying Chen, Ziqian Lu, Qinyue Tong, Jun Tang

机构 * Zhejiang University(浙江大学) Zhejiang Sci-Tech University(浙江理工大学)

AI总结 本文提出DBR-AF框架,通过双分支重建和自回归流模块解决多变量时间序列异常检测中的过拟合和误判问题,实验表明其在多个基准数据集上表现优异。

Comments 12 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08548 2026-04-13 cs.CV

ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Datasets

ETCH-X:通过可组合数据集增强具有衣物人类的表达性身体拟合

Xiaoben Li, Jingyi Wu, Zeyu Cai, Siyuan Yu, Boqian Li, Yuliang Xiu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 本文提出ETCH-X,通过引入紧致性感知拟合范式、SMPL-X扩展和隐式密集对应关系,提升身体拟合的鲁棒性和细节表达,实现对衣物动态、姿态变化和噪声输入的高效处理。

Comments Page: https://xiaobenli00.github.io/ETCH-X/, Code: https://github.com/XiaobenLi00/ETCH-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06737 2026-04-13 cs.CL cs.AI

WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report

WisdomInterrogatory (LuWen): 一种开源法律大语言模型技术报告

Yiquan Wu, Yuhang Liu, Yifei Liu, Ang Li, Siying Zhou, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学)

AI总结 本文提出基于Baichuan模型的开源中文法律语言模型LuWen,通过持续预训练、监督微调和检索增强生成技术,提升法律领域任务表现。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13450 2026-04-13 cs.CV cs.CL

LADR: Locality-Aware Dynamic Rescue for Efficient Text-to-Image Generation with Diffusion Large Language Models

LADR:基于局部性的动态救援方法,用于高效文本到图像生成的扩散大语言模型

Chenglin Wang, Yucheng Zhou, Shawn Chen, Tao Wang, Kai Zhang

机构 * East China Normal University(华东师范大学) University of Macau(澳门大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

AI总结 本文提出LADR方法,通过利用图像的空间马尔可夫性质加速推理,实现文本到图像生成的高效生成,同时保持生成质量。

Comments ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00491 2026-04-13 cs.RO cs.AI

Traj2Action: A Co-Denoising Framework for Trajectory-Guided Human-to-Robot Skill Transfer

Traj2Action: 一种用于轨迹引导的人机技能转移协同去噪框架

Han Zhou, Jinjin Cao, Liyuan Ma, Xueji Fang, Guo-jun Qi

机构 * MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖大学先进技术研究所)

AI总结 本文提出Traj2Action框架,通过3D操作端点轨迹作为统一中间表示,解决人机技能转移中的形态差距问题,提升机器人动作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08546 2026-04-10 cs.CV

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏