arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-06-11 至 2026-06-11 共收录 12
2606.11264 2026-06-11 q-bio.QM cs.AI 新提交

OmniBioTwin: A System-of-Twinned-Systems Framework for Health Digital Twins

OmniBioTwin:用于健康数字孪生的孪生系统之系统框架

Zhaohui Wang, Yu Huang, Jiang Bian

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出OmniBioTwin框架,通过多层级网络架构中的模块化孪生体和交互算子,实现跨尺度健康数字孪生的系统级集成,并在阿尔茨海默病GLP-1信号通路中验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12303 2026-06-11 cs.CV 新提交

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

从二维网格到一维标记:重塑多模态图像融合的共享表示

Yuchen Xian, Yunqiu Xu, Yang He, Yi Yang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12146 2026-06-11 cs.LG cs.AI 新提交

nD-RoPE: A Generalized RoPE for n-Dimensional Position Embedding

nD-RoPE:一种用于n维位置嵌入的广义RoPE

Boyang Li, Yulin Wu, Sizhe Xu, Nuoxian Huang, Zhonghang Yuan, Shangyi Guo, Shu Yang, Takahiro Yabe

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出nD-RoPE,将旋转位置嵌入推广到任意维度,通过多尺度正则单纯形波矢设计实现各向同性,在图像、视频和点云任务中提升性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12099 2026-06-11 cs.CV 新提交

ISAP-3D: Identity-Slot Aligned Part-Aware 3D Generation

ISAP-3D: 身份槽对齐的部件感知3D生成

Junlin Hao, Haoshuai Fu, Xibin Song, Wei Li, Ruigang Yang, Xinggong Zhang, Jinchuan Zhang

机构 * Peking University(北京大学) Tencent(腾讯) Huawei(华为) University of Science and Technology of China(中国科学技术大学)

AI总结 针对部件感知3D生成中因身份-布局纠缠导致的结构歧义问题,提出身份槽对齐框架ISAP-3D,通过语义身份令牌锚定每个部件并进行一对一布局预测,实现稳定可控的部件级3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12051 2026-06-11 cs.CV 新提交

MFEN:Multi-Frequency Expert Network for Visible-Infrared Person Re-ID

MFEN:用于可见光-红外行人重识别的多频专家网络

Xulin Li, Yan Lu, Bin Liu, Qinhong Yang, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出多频专家网络(MFEN),通过多频调制和混合专家设计自适应组合不同频带,结合随机频率增强和频率辅助优化,解决可见光-红外图像模态差异问题。

Comments CVPR Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11745 2026-06-11 cs.CV cs.AI 新提交

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

从提示到标记:将因果监督内化到视觉-语言模型中进行多图像因果推理

Haoping Yu, Yuanxi Li, Jing Ma

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出BridgeVLM,通过从多图像输入诱导因果图并转换为因果标记,注入LLM解码器进行因果消息传递,显著提升多图像因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11683 2026-06-11 cs.CV cs.AI 新提交

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

推理,再推理:跨视角重访提升空间推理

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou, Xiaofeng Cao, Jiangchao Yao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ReRe框架,通过生成互补新视角视频让MLLM先推理再验证,无需训练即可显著提升空间推理性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11482 2026-06-11 cs.SI cs.CL 新提交

Building Social World Models with Large Language Models

用大型语言模型构建社会世界模型

Haofei Yu, Yining Zhao, Guanyu Lin, Jiaxuan You

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出社会世界模型(SWM)框架,利用LLM从社会数据中挖掘时间模式,学习社会信念的状态转移函数,无需人工标注或普查数据,在预测市场基准上超越时序基础模型。

Comments 9 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11450 2026-06-11 cs.CV 新提交

Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition

探索自适应掩码重建用于自监督基于骨架的动作识别

Shengkai Sun, Zhiyong Cheng, Zefan Zhang, Jianfeng Dong, Zhihui Li, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Jilin University(吉林大学) Zhejiang Gongshang University(浙江工商大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出自适应掩码重建(AMR)框架,通过解耦编码器-解码器并引入自适应引导模块,加速预训练并提升下游动作识别精度,在多个数据集上超越现有方法。

Comments Accepted by CVPR2026. The code is available at https://github.com/AshenOne1005/AMR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11221 2026-06-11 cs.CV 新提交

LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment

LAST: 通过Gromov-Wasserstein对齐连接视觉-语言与动作流形

Huaihai Lyu, Chaofan Chen, Yuheng Ji, Xiansheng Chen, Pengwei Wang, Shanghang Zhang, Changsheng Xu

机构 * National Engineering Laboratory for Intelligent Information Processing(智能信息处理国家级工程实验室) University of Science and Technology of China(中国科学技术大学)

AI总结 提出LAST方法,通过李代数线性化和局部度量离散化,对齐视觉-语言语义几何与动作流形,解决异构空间不兼容问题,提升VLA模型收敛性和泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏