arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 243
2607.22334 2026-07-27 cs.LG cs.AI cs.CL 新提交

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

基于字节前缀边缘化的跨分词器策略内蒸馏

Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

机构 * University of Chinese Academy of Sciences(中国科学院大学) KwaiKAT Team(快手KwaiKAT团队) Zhejiang University(浙江大学)

AI总结 研究如何通过策略内蒸馏整合不同家族语言模型,提出字节前缀边缘化方法,在共享字节空间重表达教师下一个令牌分布,在数学和编程基准测试中,该方法优于现有跨分词器方法,提升了平均准确率。

Comments Project page: https://bpm-opd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22148 2026-07-27 cs.CV cs.AI 新提交

dRAE: Representation Autoencoder with Hyper-Spherical Codes

dRAE:具有超球面码的表示自编码器

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Peking University(北京大学) Ant Group(蚂蚁集团)

AI总结 研究旨在解决高维视觉表示离散化难题,提出超球面量化(HSQ),其离散表示自编码器(dRAE)能解耦语义与特征幅度,防止码本坍缩,实现高保真重建,实验证明性能提升、码本利用率高且训练流程简化。

Comments Preprint. Project Page: https://drae-hsq.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22039 2026-07-27 cs.CL 新提交

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

过犹不及:强化学习如何减轻大语言模型中任务冲突的综合分析

Zixuan Ren, Jinliang Lu, Junhong Wu, Yang Zhao, Dai Dai, Hua Wu, Haifeng Wang, Chengqing Zong

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

AI总结 研究对比强化学习与监督微调训练的大语言模型的合并行为,经五项任务评估发现强化学习能减少任务冲突及合并后性能下降。通过实验和分析揭示三个关键因素,表明强化学习在模型合并中更具优势。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21610 2026-07-27 cs.AI cs.LG 新提交

SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text

SCOPE和SCION:用于文本模式归纳与融合的基准和可审计参考管道

Miaobo Hu, Xiaobo Guo, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院,北京,中国) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(网络安全学院,中国科学院大学,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

AI总结 研究针对模式图这一信息提取瓶颈,提出SCOPE基准和SCION参考管道。通过从训练文本构建候选空间,经严格JSON合同进行相关操作。在SCOPE核心套件上,SCION-lite表现最佳,SCION-RL减少对专有工程师依赖,还给出标准化结果及相关发布内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20587 2026-07-24 stat.ML cs.LG 新提交

SPECTRA: State-Space Exogenous Context and Temporal-Frequency Resolution Architecture for Probabilistic Energy Forecasting

SPECTRA:用于概率能源预测的状态空间外部上下文和时频分辨率架构

Hang Ye, Xinyan Jiang, Yuedong Shi, Yangxin Zhu, Jianming Wei, Tian Zheng, Xiaoying Zheng, Yongxin Zhu

机构 * Shanghai Advanced Research Institute, Chinese Academy of Sciences(中国科学院上海先进研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Physical Science and Technology, Shanghaitech University(上海科技大学物理科学与技术学院) State Power Investment Corporation Limited(国家电力投资集团有限公司) China University of Petroleum(中国石油大学)

AI总结 针对现代电力系统概率能源预测问题,提出状态空间外部上下文和时频分辨率架构,通过自适应分离、对齐及建模等操作,实现预测。实验表明该方法在多种预测中表现出色,并支持确定性 - 随机分离为有效设计原则。

Comments 10 pages, 4 figures, 3 tables. Submitted to IEEE Transactions on Power Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21438 2026-07-24 cs.CV 新提交

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21404 2026-07-24 cs.CL 新提交

MemTools: A Unified Research Framework for Interoperable Agent Memory

MemTools:用于可互操作智能体内存的统一研究框架

Chengfeng Zhao, Jinhui Chen, Sirui Liang, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 研究针对智能体内存架构碎片化问题,提出MemTools框架,通过解耦组件与环境、规范生命周期、分离数据集与协议、提供统一接口,实现跨系统组件集成等功能,为智能体内存研究提供实用可扩展基础设施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20862 2026-07-24 cs.CL 新提交

CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

CSPF:一种用于不可验证偏好评估的约束共享-私有融合方法

Hehao Zhang, Danli Wang, Xinyuan Wang, Xuange Gao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对不可验证任务评估难问题,提出CSPF方法,将异构冻结奖励模型作互补评估器,在人类偏好监督下整合隐藏状态表示,经实验验证,该方法在主要指标上性能最佳,为不可验证偏好任务提供实用评估途径。

Comments 15 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20486 2026-07-24 cs.AI 新提交

OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining

OPTScientist:用于Transformer预训练的类型化优化器程序的多智能体发现

Zhongzheng Li, Tiancan Feng, Wenhao Li, Qingsong Ran, Shikun Feng, Xiaoyuan Zhang, Yue Wang, Xiaoguang Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村科学院)

AI总结 研究针对深度学习优化器设计难题,提出OPTScientist多智能体框架,在类型化DSL中结合进化搜索与第二阶段机制,发现RS-MR优化器改进Transformer预训练,为自动优化器科学提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20434 2026-07-24 cs.CL cs.AI 新提交

Break Through the Compression Bottleneck: From Theory to Practice

突破压缩瓶颈:从理论到实践

Xiusheng Huang, Lu Wang, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 研究语言模型压缩瓶颈问题,通过数学证明和实验验证低秩分解与量化非正交,组合会致性能降,进而提出对角粘合方法(DAM),可有效结合二者并减轻性能损失,为相关研究奠定基础。

Comments 18 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20174 2026-07-23 cs.CV cs.AI 新提交

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

机构 * Kling AI Research(克林人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) National Cheng Kung University(国立成功大学)

AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。

Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20116 2026-07-23 cs.CV 新提交

RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs

RIM:无人机跨域全局视觉定位的检索匹配框架

Xin Li, Siyuan Duan, Shang Wang, Zhimin Mao, Bingliang Hu, Geng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究无人机跨域全局视觉定位问题,提出检索匹配框架RIM,通过采样参考视图、两阶段微调SALAD及冻结检索器蒸馏解码器等方法,在多数据集零样本评估中表现出色,建立了高效可部署的定位管道。

Comments 56 pages, 10 figures, and 18 tables. Supplementary material is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19040 2026-07-22 cs.CV 新提交

Gaze-DETR: Top-Down Guidance Through Priority Maps for Infrared Weak-Small UAV Detection with DETR

Gaze-DETR:通过优先级地图进行自上而下的引导,用于基于DETR的红外弱小型无人机检测

Nian Liu, Yuxin Yang, Shubo Lin, Sikui Zhang, Liang Li, Boyu Cai, Yizheng Wang, Weiming Hu, Jin Gao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海科技大学) Beijing Institute of Basic Medical Sciences(北京基础医学研究所)

AI总结 针对红外弱小型无人机检测难题,提出Gaze-DETR探测器,通过学习内部优先级地图,经优先级头预测、特征调制和锚点查询注入等步骤,并采用多种监督方案训练,实验证明其能提供预定位指导,补充边界框监督。

Comments Code: https://github.com/nliu-25/Gaze-DETR-Top-Down-Guidance-Through-Priority-Maps-for-Infrared-Weak-Small-UAV-Detection-with-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18508 2026-07-22 cs.CV 新提交

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

形式高于内容:情感描述偏好评估的捷径审计

Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 研究多模态情感理解中EmoPrefer评估指标,通过内容盲探针审计发现仅用描述长度和生成器标识的逻辑回归性能与复杂模型相当,揭示当前得分可不验证描述与视频达成,建议未来评估采用源平衡配对等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17340 2026-07-21 cs.CV 新提交

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection

用于域增量目标检测的正交知识刷新

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究域增量目标检测问题,提出正交知识刷新(OKR)框架,通过构建特定域子空间、采用正交刷新策略和拓扑感知一致性,减少知识干扰和语义碎片化,实验表明该方法在mAP上比最佳无范例方法有显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16007 2026-07-20 cs.CV 新提交

Beyond Unfolding: 60x Faster One-Stage Unmixing for Closely-Spaced Infrared Small Targets

超越展开:用于紧密间隔红外小目标的快60倍的单阶段解混

Ximeng Zhai, Zheng Wang, Yaohong Chen, Hao Wang, Ming-Ming Cheng, Yimian Dai

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(中国科学院西安光学精密机械研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Astronautical Systems Engineering(北京航天自动控制研究所) VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院可视化与计算机图像处理实验室) NKIARI(未提及具体中文名称)

AI总结 研究紧密间隔红外小目标解混问题,提出单阶段轻量级FOCUS方案,受图像超分辨率与CSIST解混同构退化模型启发,转换相关要素,避免几何恢复与伪像抑制纠缠,提升定位和解混精度,推理速度提高60倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15912 2026-07-20 cs.CV 新提交

HETA++: Global Structure-from-Motion with Hybrid Explicit Translation Averaging

HETA++:基于混合显式平移平均的全局运动结构重建

Peilin Tao, Hainan Cui, Mengqi Rong, Shuhan Shen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文针对全局运动结构重建中平移平均的挑战,提出混合显式平移平均框架,结合相对平移与特征轨迹,经多步处理估计相机位置和3D点,最后完整束调整,实验表明该方法在准确性、鲁棒性和可扩展性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15880 2026-07-20 cs.RO cs.LG 新提交

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

用于泛化到未见机器人操作的动力学感知元模仿

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang University of Technology(沈阳工业大学)

AI总结 研究针对机器人模仿学习的数据稀缺与环境泛化问题,提出动力学感知元模仿(DAMI)框架,通过整合元学习、引入视觉运动轨迹模块等方法,有效捕捉任务动力学,在模拟和真实场景实验中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15773 2026-07-20 cs.LG 新提交

From Diffusion to Reaction-Diffusion: A Dynamical-Systems View of Oversmoothing in Hypergraph Neural Networks

从扩散到反应扩散:超图神经网络中过平滑的动力系统视角

Zhiheng Zhou, Mengyao Zhou, Yancheng Chen, Dengyi Zhao, Xingqin Qi, Guiying Yan

机构 * School of Mathematics and Statistics, Shandong University, Weihai(山东大学(威海)数学与统计学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究超图神经网络过平滑问题,从动力系统视角出发,提出反应扩散框架HNRD,通过定义算子解释消息传递为扩散过程,分析得出过平滑是能量耗散现象,HNRD能补偿耗散稳定变化,实验证明其优于基线,为深度超图架构设计提供框架。

Comments 17 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15766 2026-07-20 cs.CL 新提交

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

行动之前:在前瞻性假设发现任务上对大语言模型进行基准测试

Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Alibaba Group(阿里巴巴集团)

AI总结 研究旨在评估大语言模型在开放式结论前阶段的发现能力,引入前瞻性假设发现任务及评估框架HypoArena,提出回顾性上下文回归构建基准数据,实验揭示模型能力分层及效应,结果支持将其作为评估大语言模型制定调查方向的独特目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15563 2026-07-20 cs.CV 新提交

Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

视觉场所识别中所有令牌都必不可少吗?高效推理的令牌约简实证研究

Tong Jin, Yunpeng Liu, Shuyu Hu, Qinghua Zhang, Ruize Han, Song Wang, Feng Lu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 研究视觉场所识别中是否所有令牌都必要,提出首个令牌约简系统基准,在多模型和数据集上评估多种方法,从多视角研究令牌约简,揭示其特性及精度与效率权衡见解,为相关研究奠定基础。

Comments 33 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15128 2026-07-17 cs.CV 新提交

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification

DAPGNet:用于高光谱图像分类的动态自适应物理引导图扩散网络

Pengkun Wang, Weijia Cao, Ning Wang, Xiaofei Yang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Guangzhou University(广州大学)

AI总结 研究针对高光谱图像分类中像素关系建模问题,提出DAPGNet。该网络将物理先验融入图学习,经多步骤构建拓扑、进行图扩散等操作,通过跨尺度融合优化。实验表明其在多个数据集上性能最优,提升了分类准确率,验证了各模块的互补作用。

Comments 9 figures and 9 tables. Pengkun Wang and Weijia Cao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14897 2026-07-17 cs.CV 新提交

Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition

选择性驱动效率:用于视觉场所识别的数据集剪枝

Tong Jin, Yunpeng Liu, Shuyu Hu, Chun Yuan, Song Wang, Feng Lu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Shenzhen University of Advanced Technology(深圳先进技术研究院)

AI总结 针对视觉场所识别中数据集存储和训练成本高的问题,提出场所级数据集剪枝框架,引入IPD和IPS指标评估场所训练价值,构建核心集,实验证明该方法能在不同剪枝率下降低成本并保持高识别性能。

Comments 14 pages,7 figures,15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14631 2026-07-17 cs.CV cs.AI 新提交

Knowing You at First Glance: Inferring Apparent Personality from Faces

一眼识你:从面部推断表面人格

Shuhuan Chen, Xiangyu Zhu, Weisong Zhao, Haichao Shi, Xiao-Yu Zhang, Zhen Lei

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, CAS(中国科学院香港创新研究院人工智能与机器人中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, M.U.S.T(澳门科技大学创新工程学院计算机科学与工程系)

AI总结 研究从面部图像推断表面人格,提出GlanceFace框架,利用视觉语言模型、语义增强模块及不确定性感知学习策略,在基于MBTI的基准测试中表现出色,揭示面部特征与人格特质关系,助力具身智能体交互策略。

Comments Accepted by The 9th Chinese Conference on Pattern Recognition and Computer Vision, PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14536 2026-07-17 cs.LG 新提交

Muse: Representation Geometry of Muon Beyond Normalized Momentum

缪子:超越归一化动量的μ子表示几何

Da Chang, Qiankun Shi, Lvgang Zhang, Di He, Yaoshuai Ma, Ganzhao Yuan, Yongxiang Liu

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究μ子风格优化器中表示选择对优化器几何的影响,引入{\方法}族优化器,通过预训练实验及固定动量诊断发现平衡非原生表示可匹配原生表示性能,减小较短维度会改变优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13646 2026-07-16 cs.CV cs.AI 新提交

Human4K: A Large-Scale 4K Multi-View Mocap Dataset for Whole-Body 3D Human Reconstruction

Human4K:用于全身3D人体重建的大规模4K多视图动作捕捉数据集

Tianshun Han, Ziyu Shi, Lijian Liu, Ajian Liu, Benjia Zhou, Hugo Jair Escalante, Yanyan Liang, Sergio Escalera, Zhen Lei, Jun Wan

机构 * Macau University of Science and Technology(澳门科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Technology(北京理工大学) Instituto Nacional de Astrofísica, Óptica y Electrónica(国家天体物理、光学和电子学研究所) CINVESTAV Zacatenco(墨西哥国立自治大学科研与高级研究中心萨卡特enco分校) Computer Vision Center(计算机视觉中心) Universitat de Barcelona(巴塞罗那大学) Aalborg University(奥尔堡大学)

AI总结 针对现有3D人体重建模型在现实场景的不足,提出含动作捕捉精确标注的Human4K数据集,由八视图相机与Vicon动作捕捉同步拍摄,经模块处理,实验证明其能提升全身重建性能,尤其对手、脚和深度模糊肢体配置效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏