arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2228
2511.05818 2026-01-06 cs.CV

LRANet++: Low-Rank Approximation Network for Accurate and Efficient Text Spotting

LRANet++:用于准确高效文本定位的低秩近似网络

Yuchen Su, Zhineng Chen, Yongkun Du, Zuxuan Wu, Hongtao Xie, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Institute of Trustworthy Embodied AI, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学可信具身人工智能研究院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

AI总结 LRANet++通过低秩近似和三重分配方案,实现高效准确的任意形状文本定位。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26122 2026-01-06 cs.CL

Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking

推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考

Feng Ju, Zeyu Qin, Rui Min, Zhitao He, Lingpeng Kong, Yi R. Fung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学)

AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04862 2026-01-06 cs.CV cs.RO

High-Precision Transformer-Based Visual Servoing for Humanoid Robots in Aligning Tiny Objects

高精度基于Transformer的视觉伺服控制用于人形机器人对齐微小物体

Jialong Xue, Wei Gao, Yu Wang, Chao Ji, Dongdong Zhao, Shi Yan, Shiwu Zhang

机构 * Institute of Humanoid Robots, Department of Precision Machinery and Precision Instrumentation, University of Science and Technology of China(人形机器人研究院,精密机械与精密仪器系,中国科学技术大学)

AI总结 本文提出基于Transformer的视觉伺服方法,实现人形机器人高精度微小物体对齐,实验显示收敛误差小于1.3毫米,成功率达93%-100%。

Comments for associated video, see https://b23.tv/cklF7aK

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00537 2026-01-05 cs.CV

Boosting Segment Anything Model to Generalize Visually Non-Salient Scenarios

提升 Segment Anything 模型以泛化视觉非显著场景

Guangqian Guo, Pengfei Chen, Yong Guo, Huafeng Chen, Boqiang Zhang, Shan Gao

机构 * Unmanned System Research Institute at Northwestern Polytechnical University(西北工业大学无人系统研究院) School of Electronic, Electrical, and Communication Engineering, University of Chinese Academic of Sciences(中国科学院大学电子电气与通信工程学院) Max Planck Institute for Informatics (MPI-INF)(马克斯·普朗克研究所(信息研究所)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出VNS-SAM,通过改进Segment Anything模型以提升对视觉非显著场景的分割性能和泛化能力。

Comments Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00535 2026-01-05 cs.CV

FreeText: Training-Free Text Rendering in Diffusion Transformers via Attention Localization and Spectral Glyph Injection

FreeText: 通过注意力定位和频谱字形注入实现免训练的文本渲染

Ruiqiang Zhang, Hengyi Wang, Chang Liu, Guanjie Wang, Zehua Ma, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science and Technology of China(安徽省数字安全重点实验室,中国科学技术大学)

AI总结 FreeText通过注意力定位和频谱字形注入技术,无需训练即可提升文本渲染的准确性和美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00352 2026-01-05 cs.CV

OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning

OmniVaT:单域泛化用于多模态视觉-触觉学习

Liuxiang Qiu, Hui Da, Yuzhen Niu, Tiesong Zhao, Yang Cao, Zheng-Jun Zha

机构 * Fujian Key Laboratory for Intelligent Processing and Wireless Transmission of Media Information(福建智能媒体信息处理与无线传输重点实验室) College of Physics and Information Engineering(物理与信息工程学院) Fuzhou University(福州市大学) College of Computer and Data Science(计算机与数据科学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition(MoE脑启发智能感知与认知重点实验室) University of Science and Technology of China(中国科学技术大学)

AI总结 OmniVaT通过多模态分数傅里叶适配器和离散树生成模块,首次实现单域泛化多模态视觉-触觉学习任务,提升跨领域适应性与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00322 2026-01-05 cs.CV

Depth-Synergized Mamba Meets Memory Experts for All-Day Image Reflection Separation

深度协同Mamba遇见记忆专家用于全天图像反射分离

Siyan Fang, Long Peng, Yuntao Wang, Ruonan Wei, Yuehuan Wang

机构 * Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学)

AI总结 DMDNet通过深度感知扫描和记忆专家补偿模块,提升全天图像反射分离性能,尤其在夜间表现更优。

Comments This paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00311 2026-01-05 cs.CV

ReMA: A Training-Free Plug-and-Play Mixing Augmentation for Video Behavior Recognition

ReMA:一种无需训练的即插即用混合增强方法用于视频行为识别

Feng-Qi Cui, Jinyang Huang, Sirui Zhao, Jinglong Guo, Qifan Cai, Xin Yan, Zhi Liu

机构 * University of Science and Technology of China(科学技术大学) Hefei University of Technology(合肥工业大学) Hefei Xiaosheng Intelligent Technology Co., Ltd.(合肥小生智能科技有限公司) Cylingo Group(Cylingo集团) The University of Electro-Communications(电通大学)

AI总结 ReMA通过受控的混合替换机制提升视频行为识别的表示鲁棒性,无需额外监督或参数,增强泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22428 2026-01-05 cs.LG stat.ML

Causality-Inspired Safe Residual Correction for Multivariate Time Series

基于因果的多变量时间序列安全残差校正

Jianxiang Xie, Yuncheng Hua, Mingyue Cheng, Flora Salim, Hao Xue

机构 * University of New South Wales(新南威尔士大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出基于因果的安全残差校正框架CRC,通过分而治之的策略确保多变量时间序列预测的非退化性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04344 2026-01-05 cs.CV

MICACL: Multi-Instance Category-Aware Contrastive Learning for Long-Tailed Dynamic Facial Expression Recognition

MICACL: 多实例类别感知对比学习用于长尾动态面部表情识别

Feng-Qi Cui, Zhen Lin, Xinlong Rao, Anyang Tong, Shiyao Li, Fei Wang, Changlin Chen, Bin Liu

机构 * University of Science and Technology of China(科学技术大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(IAI合肥国家科学中心)

AI总结 MICACL通过整合时空依赖建模和长尾对比学习优化,提升动态面部表情识别的鲁棒性和泛化能力。

Comments Accepted by IEEE ISPA2025

Journal ref 2025 IEEE International Symposium on Parallel and Distributed Processing with Applications (ISPA), Shenyang, China, 2025, pp. 601-608

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24847 2026-01-01 cs.LG physics.ao-ph

AODDiff: Probabilistic Reconstruction of Aerosol Optical Depth via Diffusion-based Bayesian Inference

AODDiff:基于扩散的贝叶斯推断的气溶胶光学深度概率重建

Linhao Fan, Hongqiang Fang, Jingyang Dai, Yong Jiang, Qixing Zhang

机构 * State Key Laboratory of Fire Science(火灾科学国家重点实验室) University of Science and Technology of China(中国科学技术大学) Fire Research Division(火灾研究部) National Institute of Standards and Technology(美国国家标准与技术研究院)

AI总结 AODDiff通过扩散-贝叶斯推断实现气溶胶光学深度的概率重建,具备高空间光谱保真度和不确定性量化能力。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24639 2026-01-01 cs.CV

From Sequential to Spatial: Reordering Autoregression for Efficient Visual Generation

从序列到空间:重新排列自回归以实现高效的视觉生成

Siyang Wang, Hanting Li, Wei Li, Jie Hu, Xinghao Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 RadAR通过引入径向拓扑和嵌套注意力机制,提升自回归视觉生成的效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23832 2026-01-01 cs.LG

Exploiting the Prior of Generative Time Series Imputation

利用生成时间序列填补的先验

YuYang Miao, Chang Li, Zehua Chen

机构 * Imperial College London, Department of Electronic and Electrical Engineering(帝国理工学院伦敦校区电子与电气工程系) University of Science and Technology of China(中国科学技术大学) Tsinghua University, Department of CST(清华大学计算机科学与技术系) Shengshu AI(盛数人工智能)

AI总结 Bridge-TS通过引入专家先验和组合先验,提升生成时间序列填补的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17609 2026-01-01 cs.SD cs.LG

Audio Super-Resolution with Latent Bridge Models

基于潜在桥模型的音频超分辨率

Chang Li, Zehua Chen, Liyuan Wang, Jun Zhu

机构 * Department of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Shengshu AI, Beijing, China(盛舒人工智能,北京,中国) USTC, Hefei, China(中国科学技术大学,合肥,中国)

AI总结 本文提出基于潜在桥模型的音频超分辨率方法,通过压缩音频到潜在空间并设计桥模型,实现高质量的任意到48kHz和192kHz音频上采样。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23545 2025-12-30 cs.CV cs.AI

PathFound: An Agentic Multimodal Model Activating Evidence-seeking Pathological Diagnosis

PathFound: 一种促进证据寻求病理诊断的代理多模态模型

Shengyi Hua, Jianfeng Wu, Tianle Shen, Kangzhe Hu, Zhongzhen Huang, Shujuan Ni, Zhihong Zhang, Yuan Li, Zhe Wang, Xiaofan Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) Shanghai Innovation Institute(上海创新研究院) Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) Institute of Pathology, Fudan University(复旦大学病理研究所) Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)

AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23457 2025-12-30 cs.AI cs.CL cs.LG

Replay Failures as Successes: Sample-Efficient Reinforcement Learning for Instruction Following

重播失败作为成功:用于指令跟随的样本高效强化学习

Kongcheng Zhang, Qi Yao, Shunyu Liu, Wenjian Zhang, Min Cen, Yang Zhou, Wenkai Fang, Yiru Zhao, Baisheng Lai, Mingli Song

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Dalian University of Technology(大连理工大学) University of Science and Technology of China(中国科学技术大学) Alibaba Cloud Computing(阿里云计算) Chinese Academy of Sciences(中国科学院)

AI总结 HiR 提出了一种样本高效强化学习框架,通过将失败尝试视为成功来提升指令跟随任务的性能,利用双偏好学习实现高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22882 2025-12-30 cs.CV eess.IV

Hash Grid Feature Pruning

哈希网格特征剪枝

Yangzhi Ma, Bojun Liu, Jie Li, Li Li, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本研究提出了一种哈希网格特征剪枝方法,通过识别并剪枝无效特征以减少存储开销,同时保持模型性能,实现率失真性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24170 2025-12-30 math.NA cs.AI cs.NA

SymMaP: Improving Computational Efficiency in Linear Solvers through Symbolic Preconditioning

SymMaP:通过符号预条件化提高线性求解器的计算效率

Hong Wang, Jie Wang, Minghao Ma, Haoran Shao, Haoyang Liu

机构 * University of Science and Technology of China(中国科学技术大学) CAS Key Laboratory of Technology in GIPAS, University of Science and Technology of China(中国科学技术大学国家实验室(GIPAS技术))

AI总结 SymMaP通过符号预条件化方法结合传统技术与机器学习,提高线性求解器效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18262 2025-12-30 cs.RO cs.AI cs.CV cs.HC cs.LG

ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement

ReSemAct:通过语义结构化和效用细化推进细粒度机器人操作

Chenyu Su, Weiwei Shang, Chen Qian, Fei Zhang, Shuang Cong

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学)

AI总结 ReSemAct 通过语义结构化和效用细化方法,在细粒度机器人操作中实现更精确的效用目标生成与动态环境适应。

Comments Code and videos: https://github.com/scy-v/ReSemAct and https://resemact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14404 2025-12-30 cs.CV

ViC-Bench: Benchmarking Visual-Interleaved Chain-of-Thought Capability in MLLMs with Free-Style Intermediate State Representations

ViC-Bench: 用自由式中间状态表示法对多模态大语言模型的视觉交错链式思维能力进行基准测试

Xuecheng Wu, Jiaxing Liu, Danlei Huang, Yifan Wang, Yunyun Shi, Kedi Chen, Junxiao Xue, Yang Liu, Chunlin Chen, Hairong Dong, Dingkang Yang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Meituan Inc.(美团公司) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Robotics and Automation, Nanjing University(南京大学机器人与自动化学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 ViC-Bench 通过自由式中间状态表示法,系统评估多模态大语言模型的视觉交错链式思维能力,涵盖四个任务并提出新评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22664 2025-12-30 cs.CV cs.AI

Unleashing Foundation Vision Models: Adaptive Transfer for Diverse Data-Limited Scientific Domains

释放基础视觉模型:面向多样化数据受限科学领域的自适应迁移

Qiankun Li, Feng He, Huabao Chen, Xin Ning, Kun Wang, Zengfu Wang

机构 * University of Science and Technology of China(中国科学技术大学) AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Nanyang Technological University(南洋理工大学)

AI总结 本文提出CLAdapter,通过自适应迁移技术提升基础视觉模型在数据受限科学领域中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22627 2025-12-30 cs.CL

Chain-of-thought Reviewing and Correction for Time Series Question Answering

时间序列问题回答的链式思考审查与修正

Chen Su, Yuanhe Tian, Yan Song

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 T3LLM通过引入显式修正机制,利用三个LLM协作实现时间序列问题回答的多步骤推理与自我修正,从而在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12974 2025-12-30 cs.SD eess.AS

The CCF AATC 2025 Speech Restoration Challenge: A Retrospective

2025年CCF AATC语音恢复挑战:回顾

Junan Zhang, Mengyao Zhu, Xin Xu, Hui Bu, Zhenhua Ling, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Audio Department, Huawei CBG(华为CBG音频部门) Beijing AISHELL Technology Co., Ltd.(北京艾斯HELL科技有限公司) University of Science and Technology of China(中国科学技术大学)

AI总结 2025年CCF AATC挑战回顾了语音恢复领域的现状,揭示了轻量模型、生成模型权衡及度量差距问题。

Comments Technical Report. Homepage: https://ccf-aatc.org.cn. Code & Data: https://github.com/viewfinder-annn/anyenhance-v1-ccf-aatc

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14051 2025-12-29 cs.CL cs.AI

GroupDebate: Enhancing the Efficiency of Multi-Agent Debate Using Group Discussion

GroupDebate: 通过群体讨论提升多智能体辩论效率

Tongxuan Liu, Xingyu Wang, Weizhe Huang, Wenjiang Xu, Yuting Zeng, Lei Jiang, Hailong Yang, Jing Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航)

AI总结 本文提出GroupDebate方法,通过将智能体划分为小组并共享中间结果,减少多智能体辩论的token成本,提升效率和准确性。

Comments Accepted by AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20615 2025-12-24 cs.CV

Active Intelligence in Video Avatars via Closed-loop World Modeling

通过闭环世界建模实现视频虚拟角色的主动智能

Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ORCA框架,通过闭环世界建模和双系统架构,实现视频虚拟角色的主动智能与目标导向行为。

Comments Project Page: https://xuanhuahe.github.io/ORCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20469 2025-12-24 cs.AI

Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale

Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统

Linfeng Zhang, Siheng Chen, Yuzhu Cai, Jingyi Chai, Junhan Chang, Kun Chen, Zhi X. Chen, Zhaohan Ding, Yuwen Du, Yuanpeng Gao, Yuan Gao, Jing Gao, Zhifeng Gao, Qiangqiang Gu, Yanhui Hong, Yuan Huang, Xi Fang, Xiaohong Ji, Guolin Ke, Zixing Lei, Xinyu Li, Yongge Li, Ruoxue Liao, Hang Lin, Xiaolu Lin, Yuxiang Liu, Xinzijian Liu, Zexi Liu, Jintan Lu, Tingjia Miao, Haohui Que, Weijie Sun, Yanfeng Wang, Bingyang Wu, Tianju Xue, Rui Ye, Jinzhe Zeng, Duo Zhang, Jiahui Zhang, Linfeng Zhang, Tianhan Zhang, Wenchang Zhang, Yuzhi Zhang, Zezhong Zhang, Hang Zheng, Hui Zhou, Tong Zhu, Xinyu Zhu, Qingguo Zhou, Weinan E

机构 * DP Technology Beijing China(北京DP技术有限公司) AI for Science Institute Beijing China(北京AI for Science研究院) Shanghai Jiao Tong University Shanghai China(上海交通大学) Beihang University Beijing China(北京航空航天大学) Peking University Beijing China(北京大学) Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) Shanghai Innovation Institute Shanghai China(上海创新研究院) East China Normal University Shanghai China(华东师范大学) Zhongguancun Academy Beijing China(中关村学院) University of Science and Technology of China Hefei China(中国科学技术大学) Tongji University Shanghai China(同济大学) The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)

AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20194 2025-12-24 cs.CV eess.IV

Generative Latent Coding for Ultra-Low Bitrate Image Compression

生成性潜在编码用于超低比特率图像压缩

Zhaoyang Jia, Jiahao Li, Bin Li, Houqiang Li, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本研究提出生成性潜在编码方法,通过在潜在空间中进行变换编码,实现超低比特率下的高真实感和高保真度图像压缩,并在多个数据集上验证了其有效性。

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏