arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-06-24 至 2026-06-24 共收录 4
2606.24094 2026-06-24 cs.CV 新提交

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

通用指南驱动图像聚类:基于混合LLM代理

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Amazon(亚马逊)

AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09768 2026-06-24 cs.MA

SAGE: Scalable Agentic Grounded Evaluation for Crop Disease Diagnosis

SAGE: 可扩展的代理基于地面评估用于作物疾病诊断

Muhammad Arbab Arshad, Tirtho Roy, Yanben Shen, Dinakaran Elango, Shivani Chiranjeevi, Asheesh K. Singh, Baskar Ganapathysubramanian, Chinmay Hegde, Arti Singh, Soumik Sarkar

AI总结 本文提出SAGE框架,通过构建大规模作物疾病图像-症状数据集,结合自动管道生成基于源的症状描述,并引入自主视觉推理代理提升疾病诊断准确性。

Journal ref CVPR 2026 Workshop on Emerging Directions in Data for Multimodal Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24731 2026-06-24 cs.CV 版本更新

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。

Comments CVPR-2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03739 2026-06-24 cs.LG cs.AI

A&B BNN: Add&Bit-Operation-Only Hardware-Friendly Binary Neural Network

A&B BNN:仅加法与位运算的硬件友好二进制神经网络

Ruichen Ma, Guanchao Qiao, Yian Liu, Liwei Meng, Ning Ning, Yang Liu, Shaogang Hu

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出A&B BNN,通过移除传统二进制神经网络中的乘法操作并替换为位运算,引入mask层和量化RPReLU结构,提升了硬件友好性,在CIFAR-10、CIFAR-100和ImageNet数据集上达到92.30%、69.35%和66.89%的准确率。

Comments CVPR 2024 Accepted

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024, pp. 5704-5713

详情

展开后加载摘要…

URL PDF HTML 收藏