arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

共收录 701
2603.27628 2026-07-29 cs.AI 版本更新

DSevolve: Enabling Real-Time Adaptive Scheduling on Dynamic Flexible Job Shop with LLM-Evolved Heuristic Portfolios

DSevolve:基于LLM进化启发式组合的动态车间实时自适应调度框架

XinLei Zhou, Jin Huang, Jie Yang, Xinyu Li, Liang Gao

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

AI总结 本文提出DSevolve框架,通过离线进化高质量调度规则组合并在突发扰动时快速部署,优于现有AHD框架和经典调度规则,解决动态车间调度的适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23565 2026-07-28 cs.RO cs.LG 新提交

Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter

用于在动态杂波中安全飞行的预期风险引导强化学习

Yuchao Mei, Guohao Zhang, Luxia Ai, Haopeng Chen, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究在动态杂波中四旋翼安全飞行问题,提出预期风险引导强化学习框架,利用特权模拟器状态构建风险地图,通过非对称架构训练网络自我预测风险,结合轻量级编码器提取线索,实验证明该方法有效提高安全裕度和飞行效率,且能实现模拟到现实的零样本转移。

Comments 8 pages, 7 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26795 2026-07-28 cs.AI 版本更新

What Does Chain-of-Thought Contribute at Probe Time? Evidence for Local Co-Occurrence Activation

链式思维在探测时为何有效?局部共现而非全局推导

Xiang Wang, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究链式思维提示在探测时提升语言模型准确率的原因,发现增益主要来自词汇激活和短距离标记共现,而非句子级逻辑推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13335 2026-07-28 cs.CV 版本更新

Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos

Deblur-Avatar:从运动模糊单目视频生成可动画化头像

Xianrui Luo, Juewen Peng, Zhongang Cai, Lei Yang, Fan Yang, Zhiguo Cao, Guosheng Lin

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) S-Lab for Advanced Intelligence, Nanyang Technological University(南洋理工大学先进智能实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) SenseTime Research(商汤科技研究院)

AI总结 该研究针对运动模糊单目视频输入,提出将基于人类运动的运动模糊模型集成到3D高斯平铺的框架,通过优化轨迹和高斯分布重建高质量可动画化头像,实验证明其在渲染质量等方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22072 2026-07-27 cs.CV 新提交

Alleviating Regional Shortcuts for Few-Shot Class-Incremental Learning

缓解少样本类别增量学习中的区域捷径

Haichen Zhou, Yazhe Lyu, Yixiong Zou, Ruixuan Li, Yuhua Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

AI总结 研究少样本类别增量学习中误分类问题,提出基于组合学习的方法,通过学习公共和判别原语集缓解区域捷径,经实验验证该方法在准确性和可解释性上优于现有方法。

Comments Accepted by TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21933 2026-07-27 cs.AI 新提交

Semiotic logical hexagon theory for LLM logical reasoning

用于大语言模型逻辑推理的符号逻辑六边形理论

Yunyao Zhang, Xinglang Zhang, Zeliang Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 研究大语言模型逻辑推理中语义组织的影响,提出HexLogicAgent框架,先组织自然语言含义再结构化验证推理。发现不完整语义表示是推理失败主因,建模语义对立结构可延迟性能下降,实验证明该框架能提高推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14617 2026-07-27 cs.LG 版本更新

HD3C: Efficient Medical Data Classification for Edge Devices

HDC-X:面向嵌入式设备的高效医疗数据分类

Jianglan Wei, Zhenyu Zhang, Pengcheng Wang, Mingjie Zeng, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出HDC-X框架,通过高维超向量编码和聚类原型聚合,实现低功耗医疗数据分类,在心脏病声音分类中比贝叶斯ResNet节能350倍,且具备抗噪声和数据限制的鲁棒性。

Journal ref CAAI International Conference on Artificial Intelligence (CICAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21057 2026-07-24 cs.CV 新提交

Achieving Text-based Person Retrieval with Any Granularity

实现任意粒度的基于文本的行人检索

Jialong Zuo, Hanyu Zhou, Dongyue Wu, Yongtai Deng, Mengdan Tan, Nong Sang, Changxin Gao, Xiang Bai

机构 * National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院多光谱信息智能处理技术国家重点实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 该研究针对基于文本的行人检索中查询粒度不确定问题提出新范式,构建多粒度数据集和评估基准,提出CMAM框架,通过多种策略实现粒度感知检索,实验证明其性能优于现有方法,为行人检索系统奠定基础。

Comments TPAMI-2026 Accepted Paper

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026, pp. 1-18

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07556 2026-07-24 cs.HC cs.AI 版本更新

Backpropagation-Free Test-Time Adaptation for Lightweight EEG-Based Brain-Computer Interfaces

无需反向传播的测试时间适应用于轻量级基于EEG的脑机接口

Siyang Li, Jiayi Ouyang, Zhenyao Cui, Ziwei Wang, Tianwang Jia, Feng Wan, Dongrui Wu

机构 * Ministry of Education Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(教育部长图像处理与智能控制重点实验室,人工智能与自动化学院,华中科技大学) Shenzhen Huazhong University of Science and Technology Research Institute(深圳华中科技大学研究机构) Department of Electrical and Computer Engineering, Faculty of Science and Technology, University of Macau(科技学院电子与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, Institute of Collaborative Innovation, University of Macau(认知与脑科学中心,创新研究院,澳门大学)

AI总结 本文提出无需反向传播的变换(BFT)方法,用于解决EEG解码中的测试时间适应问题,通过样本级变换和学习到排名模块提升鲁棒性和效率,实现轻量级BCI的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19894 2026-07-23 cs.CR cs.AI 新提交

Defense Against LLM Backdoors using Critical Neuron Isolation Pruning

使用关键神经元隔离剪枝防御大语言模型后门攻击

Yuxi Li, Zhibo Zhang, Kailong Wang, Xingshuo Han, Ling Shi, Haoyu Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Nanyang Technological University(南洋理工大学)

AI总结 研究大语言模型后门攻击问题,提出DeCNIP方法,利用表征分析统一识别和中和后门,通过优化交叉熵损失发现潜在威胁,隔离并剪枝后门关键神经元,有效降低攻击成功率,保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17332 2026-07-23 cs.RO 版本更新

Multi-Resolution Voxelized Map-Based Stereo Visual-Inertial Odometry

基于多分辨率体素化地图的立体视觉惯性里程计

Shuyi Pan, Hangtian Wang, Zhaoxing Zhang, Chengliang Zhang, Zikang Yuan, Xin Yang

机构 * Huazhong University of Science and Technology(华中科技大学) AI Chip Center for Emerging Smart Systems (AC-CESS)(新兴智能系统人工智能芯片中心)

AI总结 研究视觉惯性里程计中姿态估计问题,提出多分辨率先验地图构建方法及基于地图的VIO系统,通过体素化地图、锥形索引策略和DDA算法,减少数据传输量与计算负载,实验证明该系统能在少数据传输下实现准确姿态估计。

Comments 9 pages, 4 figures, 6 tables. Accepted to appear in the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11338 2026-07-23 cs.AI 版本更新

AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic

AutoVSR:用于从电路原理图生成符号表达式的自动视觉到符号推理

Zhe Xiao, Longfei Li, Xu He, Haoying Wu, Zixing Zhang, Mingyu Liu

机构 * Hunan University, Changsha, China(湖南大学) Wuhan University of Technology, Wuhan, China(武汉理工大学) Huazhong University of Science and Technology, Wuhan, China(华中科技大学)

AI总结 研究旨在解决从电路原理图生成符号表达式的难题,提出AutoVSR框架,利用视觉语言模型,通过重建电路图为可执行中间表示并借助符号求解器推理,引入两项创新提升准确率,在任务中表现优于其他方法,还降低了推理成本和提高了计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18859 2026-07-22 cs.AI 新提交

PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

PhoenixRepair:重新思考软件代理中的修复策略探索

Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin Li

机构 * Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Huawei CodeArts Model Team(华为代码艺术模型团队)

AI总结 研究针对现有软件代理修复策略探索不足的问题,提出PhoenixRepair多代理框架,通过多位置采样、迭代反思优化等扩大搜索空间,实验表明该框架在解决率和故障定位精度上有提升,实现了7.8%的相对改进及76.0%的最高解决率Pass@1。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07248 2026-07-22 cs.CV 版本更新

IBoxCLA: Towards Robust Box-supervised Segmentation of Polyp via Improved Box-dice and Contrastive Latent-anchors

IBoxCLA:通过改进的盒式骰子和对比潜在锚点实现息肉的鲁棒盒监督分割

Qiang Hu, Ying Chen, Hongkuan Shi, Qiang Li, Zhiwei Wang

机构 * Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(光学电子国家重点实验室,华中科技大学)

AI总结 研究针对盒监督息肉分割中模型形状坍塌问题,提出改进的盒式骰子(IBox)和对比潜在锚点(CLA)两种学习方式,结合训练出IBoxCLA模型,该模型在多数据集实验中表现出色,相比其他盒监督技术有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17849 2026-07-21 cs.HC cs.CL cs.CV 新提交

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

AlphaOracle:通过受人工工作流程启发的深度学习进行甲骨文破译

Yuliang Liu, Haisu Guan, Pengjie Wang, Xinyu Wang, Jinpeng Wan, Kaile Zhang, Handong Zheng, Xingchen Liu, Zhebin Kuang, Huanxin Yang, Bang Li, Yongge Liu, Lianwen Jin, Xiang Bai

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Electronic Information Engineering, South China University of Technology(华南理工大学电子信息学院) Key Laboratory of Oracle Bone Inscriptions Information Processing, Anyang Normal University(安阳师范学院甲骨文信息处理重点实验室)

AI总结 针对约3000个未破译甲骨文字符的问题,提出受人工工作流程启发的AlphaOracle框架,经多阶段管道进行甲骨文破译,与专家解读高度一致,还能减少分析时间,为甲骨文及其他未破译文字研究提供参考。

Comments Accepted by The Innovation 2026

Journal ref The Innovation 7(11), 101462, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16308 2026-07-21 cs.CV cs.AI 新提交

DAUPNet: Domain-Aware Uncertainty Modeling for Reliable Prototype Discrimination in Cross-Domain Few-Shot Semantic Segmentation

DAUPNet:跨域少样本语义分割中用于可靠原型区分的域感知不确定性建模

Lei Yuan, Zhongxu Hu, Jingyi Wen, Pengxing Yi

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对跨域少样本语义分割中因域偏移致原型匹配不可靠的问题,提出DAUPNet框架,通过协调特征、概率表示原型及用不确定性调节优化,在四个标准目标域取得较好平均mIoU,为跨域少样本语义分割提供了可靠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10623 2026-07-21 cs.GR cs.CV 版本更新

LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow

LATO.2:基于顶点和拓扑流的因式分解3D网格生成

Hang Long, Tianhao Zhao, Junkai Lin, Youjia Zhang, Huipeng Guo, Rendong Liang, Jiale Xu, Jozef Hladký, Matthias Nießner, Yuanming Hu, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Meshy AI Technical University of Munich(慕尼黑技术大学)

AI总结 研究针对现有拓扑感知网格生成方法的不足,提出LATO.2框架,将网格生成分解为顶点流和连通性流,由专用变分自编码器支持,具有逐部分生成和拓扑自适应编辑优势,实验证明其超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27088 2026-07-21 cs.CV 版本更新

SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision

SubdivAR: 用于神经网格细分的自回归下一尺度预测

Huipeng Guo, Zikai Song, Hang Long, Jielei Zhang, Wenbing Li, Junkai Lin, Tianhao Zhao, Jinshen Zhang, Tianle Guo, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 提出SubdivAR框架,将网格细分建模为自回归下一尺度预测,利用混合拓扑感知Transformer结合全局语义与局部拓扑特征,在FII-40K数据集上显著降低Hausdorff距离和Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15321 2026-07-20 cs.CV 新提交

Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection

重新思考读出方式:解锁用于人工智能生成视频检测的视频主干网络

Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Vast Intelligence Lab(旷视智能实验室)

AI总结 研究针对AI生成视频检测中视频主干网络表现不佳的问题,提出速度门控补丁速度剖析(V-PVP)方法,通过替换聚合层激活冻结主干网络时间潜力,提升检测性能,在AIGVDBench上达95.28的AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14684 2026-07-17 cs.CV 新提交

GlobalForge: Towards Robust AI-Generated Image Detection

GlobalForge:迈向强大的人工智能生成图像检测

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Tsinghua University(清华大学)

AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏