arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 1444
2505.12781 2025-12-19 cs.CL cs.AI

A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

一个标记值超过1000个标记:通过低秩克隆实现高效的知识蒸馏

Jitai Hao, Qiang Huang, Hao Liu, Xinyan Xiao, Zhaochun Ren, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学智能科学与工程学院) Baidu Inc.(百度公司) Leiden University(莱顿大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出低秩克隆方法,通过高效预训练实现小语言模型在训练效率和性能上的突破。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16140 2025-12-19 cs.CV physics.med-ph

ResDynUNet++: A nested U-Net with residual dynamic convolution blocks for dual-spectral CT

ResDynUNet++: 一种带有残差动态卷积块的嵌套U-Net用于双能CT

Ze Yuan, Wenbin Li, Shusen Zhao

机构 * School of Science, Harbin Institute of Technology, Shenzhen, Shenzhen, 518055, China(哈尔滨工业大学深圳校区科学学院) National Center for Applied Mathematics Shenzhen, Southern University of Science(南方科技大学深圳应用数学中心) Detection Institute for Advanced Technology Longhua-Shenzhen, Shenzhen 518000, China(深圳龙华-深圳先进技术检测院)

AI总结 ResDynUNet++通过结合OPMT与深度学习模型,提升双能CT重建的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15069 2025-12-18 cs.CV cs.AI

PMMD: A pose-guided multi-view multi-modal diffusion for person generation

PMMD: 一种基于姿态的多视角多模态扩散用于人物生成

Ziyu Shang, Haoran Liu, Rongchao Zhang, Zhiqian Wei, Tongtong Feng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Hong Kong, Hong Kong, China(香港城市大学) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16380 2025-12-18 eess.IV cs.AI cs.CV

From Pretraining to Privacy: Federated Ultrasound Foundation Model with Self-Supervised Learning

从预训练到隐私:具有自监督学习的联邦超声基础模型

Yuncheng Jiang, Chun-Mei Feng, Jinke Ren, Jun Wei, Zixun Zhang, Yiwen Hu, Yunbi Liu, Rui Sun, Xuemei Tang, Juan Du, Xiang Wan, Yong Xu, Bo Du, Xin Gao, Guangyu Wang, Shaohua Zhou, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong, Shenzhen(深圳FNii,香港中文大学(深圳)) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) West China Hospital of Sichuan University, Chengdu(四川大学华西医院) School of Computer Science, University College Dublin, Ireland(计算机科学学院,都柏林大学(爱尔兰)) College of Computer Science and Software Engineering, Shenzhen University, Shenzhen(计算机科学与软件工程学院,深圳大学) South China Hospital, Health Science Center, Shenzhen University, Shenzhen(南方医院,深圳大学健康科学中心) School of Computer Science, Nanjing University of Posts and Telecommunications, Nanjing(计算机科学学院,南京邮电大学) Affiliated Hospital of North Sichuan Medical College, Sichuan(北川医学院附属医院) North Sichuan Medical College, Sichuan(北川医学院) Shenzhen Research Institute of Big Data, Shenzhen(深圳大数据研究院) Bio-Computing Research Center, Harbin Institute of Technology, Shenzhen(生物计算研究中心,哈尔滨工业大学(深圳)) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学) Computer Science Program, Computer, E(计算机科学项目,计算机)

AI总结 UltraFedFM通过联邦学习和自监督学习,构建了一个隐私保护的超声基础模型,实现了在多种疾病诊断和病变分割上的高准确率,超越了中级医师水平,达到了专家级表现。

Comments npj digital medicine(2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18127 2025-12-17 cs.IR cs.AI cs.CL cs.LG

Holistic Utility Preference Learning for Listwise Alignment

整体效用偏好学习用于列表对齐

Jiacong Zhou, Xianyun Wang, Min Zhang, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(计算机科学与技术学院,杭州电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 DRPO通过整体效用学习提升列表对齐效果,优化响应排名质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12303 2025-12-16 cs.CV

OMUDA: Omni-level Masking for Unsupervised Domain Adaptation in Semantic Segmentation

OMUDA: 用于语义分割中无监督领域适应的多级遮蔽

Yang Ou, Xiongwei Zhao, Xinye Yang, Yihan Wang, Yicheng Di, Rong Yuan, Xieyuanli Chen, Xu Zhu

机构 * School of Mechanical Engineering, Chengdu University(成都大学机械工程学院) School of Information Science and Technology, Harbin Institute of Technology(哈尔滨工业大学信息科学与技术学院) School of Computer Science and Informatics, Cardiff University(卡的夫大学计算机科学与信息学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学与技术学院)

AI总结 OMUDA通过多级遮蔽策略提升无监督领域适应在语义分割中的性能,实现跨领域泛化和精度提升。

Comments Submitted to TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02792 2025-12-16 cs.CV cs.MM

HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval

HUD: 用于组合视频检索的层次不确定性感知网络

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Haokun Wen, Weili Guan

机构 * School of Software Shandong University Jinan China(软件学院 山东大学 济南 中国) School of Data Science City University of Hong Kong Hong Kong China(数据科学学院 香港城市大学 香港 中国) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

AI总结 HUD通过层次不确定性感知网络提升组合视频检索的多模态查询理解与特征学习精度。

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11395 2025-12-15 cs.CV

FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing

FlowDC: 基于流的解耦-衰减用于复杂图像编辑

Yilei Jiang, Zhen Wang, Yanghao Wang, Jun Yu, Yueting Zhuang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 FlowDC通过解耦和衰减技术提升复杂图像编辑的源一致性与语义对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15126 2025-12-15 cs.CV cs.AI

Text-Derived Relational Graph-Enhanced Network for Skeleton-Based Action Segmentation

基于文本的图增强网络用于基于骨架的动作分割

Haoyu Ji, Bowen Chen, Weihong Ren, Wenze Huang, Zhihao Yang, Zhiyong Wang, Honghai Liu

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology Shenzhen(机器人系统国家重点实验室,哈尔滨工业大学深圳)

AI总结 TRG-Net通过文本生成的图增强方法,提升基于骨架的动作分割性能,实现更精确的动作识别与分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14275 2025-12-15 cs.CV

Free-Lunch Color-Texture Disentanglement for Stylized Image Generation

无需调优的色彩-纹理解耦用于风格化图像生成

Jiang Qin, Senmao Li, Alexandra Gomez-Villa, Shiqi Yang, Yaxing Wang, Kai Wang, Joost van de Weijer

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) VCIP, CS, Nankai University, China(南开大学) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机科学系) City University of Hong Kong, HK SAR, China(香港城市大学)

AI总结 本文提出无需调优的SADis方法,通过分离颜色-纹理嵌入提升风格化图像生成的精度与定制能力。

Comments Accepted by NeurIPS2025. Code is available at https://deepffff.github.io/sadis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08169 2025-12-10 cs.CR cs.AI

Information-Dense Reasoning for Efficient and Auditable Security Alert Triage

信息密集推理用于高效且可审计的安全警报分拣

Guangze Zhao, Yongzheng Zhang, Changbo Tian, Dan Xie, Hongri Liu, Bailing Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) CHANG AN communication technology Co., Ltd.(CHANG AN通信技术有限公司) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Industrial Network Security(山东省工业网络信息安全重点实验室)

AI总结 AIDR通过混合云边框架和信息密度优化,实现高效且可审计的安全警报分拣,减少40.6%的延迟并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02530 2025-12-10 cs.AI

Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration

Aetheria:基于多智能体辩论与协作的多模态可解释内容安全框架

Yuxiang He, Jian Zhao, Yuchen Yuan, Tianle Zhang, Wei Cai, Haojie Cheng, Ziyan Shi, Ming Zhu, Haichuan Tang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Sichuan University(四川大学) Peking University(北京大学) Beijing Jiaotong University(北京交通大学) Harbin Institute of Technology(哈尔滨工业大学) China Railway Rolling Stock Corporation Limited(中国铁路滚动股票有限公司)

AI总结 Aetheria通过多智能体辩论与协作机制,实现多模态内容安全的可解释性与高准确性,提升可信AI审查水平。

Comments https://github.com/Herrieson/Aetheria

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14757 2025-12-10 cs.CV cs.LG

Learning effective pruning at initialization from iterative pruning

在初始化时学习有效的剪枝

Shengkai Liu, Yaofeng Cheng, Fusheng Zha, Wei Guo, Lining Sun, Zhenshan Bing, Chenguang Yang

机构 * State Key Laboratory of Robotics and Systems(机器人系统国家重点实验室) Harbin Institute of Technology(哈尔滨工业大学) Technical University of Munich(慕尼黑技术大学) University of Liverpool(利物浦大学)

AI总结 本文提出了一种基于神经网络的初始化剪枝方法,通过学习初始特征与存活分数的关系来提高高稀疏度下的剪枝性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07464 2025-12-09 cs.RO

Gait-Adaptive Perceptive Humanoid Locomotion with Real-Time Under-Base Terrain Reconstruction

具有实时底层地形重建的感知人体机器人运动

Haolin Song, Hongbo Zhu, Tao Yu, Yan Liu, Mingqi Yuan, Wengang Zhou, Hua Chen, Houqiang Li

机构 * Department of Electronic Engineering and Information Science (EEIS), University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) LimX Dynamics(LimX动力学) Hong Kong University of Science and Technology(香港科技大学) School of Mechanics Engineering, Harbin Institute of Technology (HIT)(机械工程学院,哈尔滨工业大学) Department of Computing, The Hong Kong Polytechnic University(计算学院,香港理工大学) Zhejiang University-University of Illinois Urbana-Champaign Institute (ZJUI)(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

AI总结 该研究提出了一种结合地形感知、步态调节和全身控制的强化学习框架,通过实时底层地形重建实现稳健的人形机器人运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07170 2025-12-09 cs.CV cs.AI

Towards Unified Semantic and Controllable Image Fusion: A Diffusion Transformer Approach

迈向统一的语义和可控图像融合:一种扩散变换器方法

Jiayang Li, Chengjie Jiang, Junjun Jiang, Pengwei Liang, Jiayi Ma, Liqiang Nie

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electronic Information School, Wuhan University(武汉大学电子信息学院)

AI总结 DiTFuse通过融合图像与自然语言指令,实现端到端、语义感知的图像融合,统一了多种融合任务并在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06422 2025-12-09 cs.CV

A Perception CNN for Facial Expression Recognition

用于面部表情识别的感知CNN

Chunwei Tian, Jingyuan Xie, Lingjun Li, Wangmeng Zuo, Yanning Zhang, David Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学) School of Software, Northwestern Polytechnical University(软件学院,西北工业大学) School of Software, Zhengzhou University of Light Industry(软件学院,郑州轻工业学院) School of Computer Science, Northwestern Polytechnical University(计算机科学学院,西北工业大学) School of Science and Engineering, Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳))

AI总结 本文提出了一种用于面部表情识别的感知CNN,通过多域交互机制和两阶段损失函数提升识别性能。

Comments in IEEE Transactions on Image Processing (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22634 2025-12-09 cs.RO cs.SE

LabUtopia: High-Fidelity Simulation and Hierarchical Benchmark for Scientific Embodied Agents

LabUtopia:高保真模拟与分层基准用于科学具身智能体

Rui Li, Zixuan Hu, Wenxi Qu, Jinouwen Zhang, Zhenfei Yin, Sha Zhang, Xuantuo Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang, Wanli Ouyang, Lei Bai, Wangmeng Zuo, Ling-Yu Duan, Dongzhan Zhou, Shixiang Tang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 LabUtopia通过高保真模拟和分层基准推动实验室环境中具身智能的发展。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05152 2025-12-08 cs.CV

EFDiT: Efficient Fine-grained Image Generation Using Diffusion Transformer Models

EFDiT:利用扩散变换器模型实现高效的细粒度图像生成

Kun Wang, Donglin Di, Tonghua Su, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究所) Li Auto(利汽车) University of New South Wales(新南威尔士大学)

AI总结 EFDiT通过引入分层嵌入器和ProAttention机制,提升细粒度图像生成的语义信息融合和细节表现,优于现有微调方法。

Comments 6pages, 5figures, published to 2025 IEEE International Conference on Multimedia and Expo (ICME), Nantes, France, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19035 2025-12-05 cs.CV cs.AI

Changes in Gaza: DINOv3-Powered Multi-Class Change Detection for Damage Assessment in Conflict Zones

加沙的变化:基于DINOv3的多类变化检测用于冲突区损害评估

Kai Zheng, Zhenkai Wu, Fupeng Wei, Miaolan Zhou, Kai Lie, Haitao Guo, Lei Ding, Wei Zhang, Hang-Cheng Dong

机构 * School of Computer Science and Technology(计算机科学与技术学院) Zhejiang University(浙江大学) School of Software Technology(软件学院) School of Information Engineering(信息工程学院) North China University of Water Resources and Electric Power(北方水利电力大学) Polytechnic Institute Institute of Systems Engineering(系统工程院) Academy of Military Sciences(军事科学院) Department of Geo-spatial Information(测绘信息学院) Information Engineering University(信息工程大学) School of Instrumentation Science and Engineering(仪器科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

AI总结 本文提出基于DINOv3的MC-DiSNet模型,用于冲突区多类变化检测,通过多尺度交叉注意力机制和差分孪生结构实现细粒度语义变化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03720 2025-12-04 cs.CR cs.AI

Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs

上下文感知的分层学习:一种更安全LLM的两阶段范式

Tengyun Ma, Jiaqi Yao, Daojing He, Shihao Peng, Yu Li, Shaohui Liu, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大贝大学) Zhejiang University(浙江大学)

AI总结 本文提出上下文感知分层学习(CAHL)以提升LLM对工具完成攻击的鲁棒性,通过动态平衡语义理解和指令约束,有效增强模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03592 2025-12-04 cs.CV

Harnessing Hypergraphs in Geometric Deep Learning for 3D RNA Inverse Folding

利用超图在几何深度学习中进行3D RNA反折叠

Guang Yang, Lei Fan

机构 * Faculty of Computing(计算机学院) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出HyperRNA框架,利用超图在几何深度学习中实现3D RNA反折叠,通过编码器-解码器结构生成RNA序列并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03574 2025-12-04 cs.CV

Global-Local Aware Scene Text Editing

全局-局部感知场景文本编辑

Fuxiang Yang, Tonghua Su, Donglin Di, Yin Chen, Xiangqian Wu, Zhongjie Wang, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto Suzhou Research Institute(苏州研究院) University of New South Wales(新南威尔士大学)

AI总结 本文提出GLASTE模型,通过结合全局和局部信息,解决场景文本编辑中的不一致性和长度敏感性问题,提升编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03566 2025-12-04 cs.CV cs.MM

GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models

通过文本引导的扩散模型生成拟人化物体:GAOT

Hao Sun, Lei Fan, Donglin Di, Shaohui Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学)

AI总结 GAOT通过文本引导的扩散模型和超图学习,实现从文本提示到拟人化物体的生成,取得优于现有方法的性能。

Comments Accepted by ACM MM Asia2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09843 2025-12-03 cs.CV cs.RO

ST-Booster: An Iterative SpatioTemporal Perception Booster for Vision-and-Language Navigation in Continuous Environments

ST-Booster: 一种用于连续环境视觉-语言导航的迭代时空感知增强器

Lu Yue, Dongliang Zhou, Liang Xie, Erwei Yin, Feitian Zhang

机构 * Robotics and Control Laboratory, the School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院、湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences(国防创新研究院,军事科学院) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 ST-Booster通过多粒度感知和指令感知推理提升连续环境中视觉-语言导航的性能。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05814 2025-12-03 cs.CR cs.CV cs.LG

Rank Matters: Understanding and Defending Model Inversion Attacks via Low-Rank Feature Filtering

秩至关重要:通过低秩特征过滤理解并防御模型反向攻击

Hongyao Yu, Yixiang Qiu, Hao Fang, Tianqu Zhuang, Bin Chen, Sijin Yu, Bin Wang, Shu-Tao Xia, Ke Xu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出了一种基于低秩特征过滤的防御策略,通过减少中间表示的维度来有效防御模型反向攻击,实现了对多种攻击的有效防护。

Comments KDD 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01896 2025-12-02 cs.CL

OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation

OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现

Jinzheng Yu, Yang Xu, Haozhen Li, Junqi Li, Yifan Feng, Ligu Zhu, Hao Shen, Lei Shi

机构 * Communication University of China(中国传媒大学) Harbin Institute of Technology(哈尔滨工业大学) China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) School of Engineering, Santa Clara University(圣克拉拉大学工程学院)

AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。

Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏