arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-07-21 至 2026-07-21 共收录 4
2605.04445 2026-07-21 cs.CV 版本更新

LEGO: LoRA-Enabled Generator-Oriented Framework for Synthetic Image Detection

LEGO:用于合成图像检测的基于LoRA的面向生成器框架

Yutong Xiao, Ran Ran, Jiwei Wei, Shuchang Zhou, Ke Liu, Zheng Ziqiang, Caiyan Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对生成技术使合成图像难辨真伪,现有检测方法存在泛化和过拟合问题,提出LEGO框架。通过MLP调制多个LoRA模块,分两阶段训练,能提取特定生成器独特伪影,在少数据和少轮次训练下性能优于现有方法。

Comments 10 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24651 2026-07-21 math.NA cs.LG cs.NA 版本更新

WINO: A Weak-Form Physics Informed Neural Operator for Hyperelasticity on Variable Domains

WINO: 一种用于变域超弹性问题的弱形式物理信息神经算子

Bokai Zhu, Yizheng Wang, Qinghui Zhang, Timon Rabczuk

机构 * School of Science, Harbin Institute of Technology, Shenzhen, P. R. China(哈尔滨工业大学深圳校区) School of Science, Harbin Institute of Technology, Shenzhen, Guangdong(哈尔滨工业大学深圳校区) Institute of Structural Mechanics, Bauhaus-Universität Weimar(魏玛 Bauhaus 大学结构力学研究所)

AI总结 提出一种无数据框架WINO,结合神经算子的效率与φ-有限元法的几何灵活性,通过最小化弱形式残差和惩罚项训练,实现高精度且计算时间减少50-80%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏