arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-07-31 至 2026-07-31 共收录 4
2607.27959 2026-07-31 cs.CV cs.IR 新提交

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。

Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27634 2026-07-31 cs.CV 新提交

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

4DHumanDiff:直接基于文本生成4DGS以实现一致的360度动态人类

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

AI总结 针对文本生成360度动态人类的现有方法存在成本高、一致性差的问题,本文提出4DHumanDiff扩散框架,直接基于文本生成4DGS表示的动态人类,结合新数据集与技术,实现高效且一致性更好的生成。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-07-31 cs.CV cs.AI 版本更新

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24162 2026-07-31 cs.CR cs.AI 版本更新

Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation

解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM

Kaisheng Fan, Yishu Gao, Xunzhu Tang, Tegawendé F. Bissyandé, Weizhe Zhang

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) University of Luxembourg(卢森堡大学)

AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏