arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 265
2606.07636 2026-07-20 cs.CV cs.CL cs.MA 版本更新

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing

Crayotter: 用于长视频编辑的可追踪多智能体工作流

Lecheng Yan, Yichong Zhang, Xiantao Xu, Jianze Lin, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Jiahui Geng, Ruizhe Li, Fengyu Cai, Jingcheng Niu, Raymond Li, Wenxi Li, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出Crayotter,一个开源多模态多智能体系统,通过三阶段工作流(材料准备、基于工件的编辑研究、工具驱动的执行)实现长视频编辑的可追踪性和选择性修订,在人类评估中优于基线方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19356 2026-07-20 cs.CV 版本更新

Rethinking Reward Signals in Video GRPO: When Scores Become Targets

重新思考视频GRPO中的奖励信号:当分数成为目标

Rui Li, Yuanzhi Liang, Ziqi Ni, Haibin Huang, Chi Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

AI总结 本文提出TaRoS框架,通过组件级评估和组内稀疏性解决GRPO中奖励信号失真问题,提升视频生成的视觉质量和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25796 2026-07-17 cs.CR cs.AI cs.CL 版本更新

SAMark: A Self-Anchored Text Watermarking with Paragraph-Level Paraphrase Robustness

SAMark: 一种具有段落级释义鲁棒性的自锚文本水印

Jiahao Huo, Wenjie Qu, Yibo Yan, Kening Zheng, Jiaheng Zhang, Xuming Hu, Philip S. Yu, Mingxun Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出SAMark自锚水印框架,通过建立语义空间中与句子顺序无关的逐步独立绿色区域,结合多通道双曲评分机制和多样性感知过滤策略,在段落级释义攻击下实现高检测率并打破鲁棒性-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22809 2026-07-17 cs.CV 版本更新

PhotoAgent: Exploratory Visual Aesthetic Planning with Large Vision Models

PhotoAgent: 带探索性视觉审美规划的代理照片编辑

Mingde Yao, Zhiyuan You, King-Man Tam, Menglu Wang, Tianfan Xue

机构 * MMLab, CUHK(CUHK媒体实验室) Shanghai AI Lab(上海AI实验室) USTC(中国科学技术大学) Institute of Science Tokyo(东京科学研究所) CPII under InnoHK(创新香港下的CPII)

AI总结 PhotoAgent通过探索性视觉审美规划实现自主照片编辑,无需用户逐步提示,提升图像质量和指令遵循度。

Comments ICML 2026 Oral. A fully automated, intelligent photo-editing agent that autonomously plans multi-step aesthetic enhancements, smartly chooses diverse editing tools, and enables everyday users to achieve professional-looking results without crafting complex prompts. Project page: https://mdyao.github.io/PhotoAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29846 2026-07-16 cs.RO cs.HC 版本更新

Legible Shared Autonomy: Implicit Communication of Robot Belief through Motion

可理解的共享自主:通过运动隐式传达机器人信念

Jinwei Liu, Pengfei Li, Shaofeng Chen, Tao Wang, Yun-Bo Zhao

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) Department of Automation, Hefei University of Technology(自动化系,合肥工业大学) National Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)

AI总结 针对共享自主系统中机器人意图不透明导致用户控制效率低的问题,提出通过可理解运动隐式传达机器人信念,并基于置信度自适应分配控制权,实验证明该方法显著提升用户对机器人信念的理解并减少控制负担。

Comments Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-07-16 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05494 2026-07-16 cs.CL cs.AI 版本更新

A Multi-Model Metric-based Selection Framework for Abstractive Text summarization

MASF:面向抽象式文本摘要的多模型自适应选择框架

Ahmed Alansary, Ali Hamdi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种多模型自适应选择框架,通过集成多个微调的Transformer模型并基于自动评估指标选择最佳摘要,在CNN/DailyMail数据集上BERTScore达88.63%,优于GPT3-D2等大模型。

Comments 6 pages, 3 figures, IMSA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24602 2026-07-16 cs.CV cs.AI 版本更新

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory

纠正注意力分散引起的视觉模糊以减少幻觉:算法与理论

Quanjiang Li, Zhiming Liu, Wei Luo, Tingjin Luo, Chenping Hou

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文揭示多模态大语言模型中的物体幻觉与类人注意力分散现象相关,并提出一种无需额外训练的注意力聚焦方法(AFIP)通过跨头注意力增强和动态历史注意力强化来纠正视觉模糊,从而减少幻觉。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23620 2026-07-16 cs.RO 版本更新

Move-Then-Operate: Behavioral Phasing for Human-Like Robotic Manipulation

移动-然后-操作:用于类人机器人操作的行为相位

Haoming Xu, Lei Lei, Jie Gu, Chu Tang, Jingmin Chen, Ruiqi Wang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China.(杭州高等研究院,中国科学院大学,中国杭州) University of Science and Technology of China, Hefei, China.(中国科学技术大学,中国合肥) School of Aritificial intelligence, Institute of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China(人工智能学院,人工智能研究院,北京科技大学,中国北京)

AI总结 本文提出Move-Then-Operate框架,将机器人操作分为粗略移动和接触关键交互两个阶段,通过双专家策略提升操作精度与效率。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12783 2026-07-15 cs.IR cs.AI 版本更新

SQuTR: A Robustness Benchmark for Spoken Query to Text Retrieval under Acoustic Noise

SQuTR:一种在语音噪声下 spoken query 到文本检索的鲁棒性基准

Yuejie Li, Ke Yang, Yueying Hua, Berlin Chen, Jianhao Nie, Yueping He, Caixin Kang

机构 * Huazhong University of Science and Technology(华中科技大学) The University of Hong Kong(香港大学) Soochow University(苏州大学) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Tsinghua University(清华大学) The University of Tokyo(东京大学)

AI总结 SQuTR通过大规模数据集和统一评估协议,评估语音检索系统在复杂噪声环境下的鲁棒性,揭示了极端噪声下检索性能显著下降的问题。

Comments Accepted by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31027 2026-07-14 cs.LG 版本更新

Multi-Scale Separable Fourier Neural Networks for Solving High-Frequency PDEs

多尺度可分离傅里叶神经网络用于求解高频偏微分方程

Qihong Yang, Qiaolin He

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出多尺度可分离傅里叶神经网络(MS-SFNN),通过可分离表示、随机固定权重和傅里叶特征嵌入,高效精确求解线性和非线性高频偏微分方程。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24956 2026-07-14 cs.CL 版本更新

NITP: Next Implicit Token Prediction for LLM Pre-training

NITP:面向LLM预训练的下一隐式令牌预测

Xiangdong Zhang, Debing Zhang, Shaofeng Zhang, Xiaohan Qin, Yu Cheng, Junchi Yan

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出NITP方法,通过在表示空间中添加密集连续监督来增强离散令牌预测,以解决标准下一令牌预测中潜在表示空间约束不足的问题,并在0.5B至9B参数模型上取得一致性能提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18601 2026-07-14 cs.CV 版本更新

Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models

Incantation: 自然语言作为多实体视频世界模型的动作接口

Shangwen Zhu, Qianyu Peng, Zhao Pu, Zhilei Shu, Xiangrui Ke, Zhaohu Xing, Zizhao Tong, Zeqing Wang, Xinyu Cui, Zian Zheng, Huangji Wang, Jian Zhao, Yeying Jin, Fan Cheng, Ruili Feng

机构 * SJTU(上海交通大学) NVIDIA Research(英伟达研究) USTC(中国科学技术大学) UCAS(乌兹别克斯坦科学院) NUS(新加坡国立大学) UWaterloo(滑铁卢大学) HKUST(香港理工大学) HKU(香港大学) ZGCA(浙江大学)

AI总结 本研究提出了一种基于自然语言的动作接口,用于多实体视频世界模型,解决了传统接口在细粒度多实体控制和跨实体、跨世界泛化能力上的不足,通过引入自然语言条件化实现了更强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25115 2026-07-14 cs.AI 版本更新

When Sensing Varies with Contexts: Context Probing for Tactile Few-Shot Class-Incremental Learning

当感知随情境变化时:情境作为变换的触觉少样本类增量学习

Yifeng Lin, Aiping Huang, Wenxi Liu, Si Wu, Tiesong Zhao, Zechao Li, Zheng-Jun Zha

机构 * Fujian Key Laboratory for Intelligent Processing and Wireless Transmission of Media Information, College of Physics and Information Engineering, Fuzhou University(福建省媒体信息智能处理与无线传输重点实验室,物理与信息工程学院,福州大学) College of Computer and Data Science, Fuzhou University(计算机与数据科学学院,福州大学) School of Computer Science and Engineering, South China University of Technology(计算机科学与工程学院,华南理工大学) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(教育部类脑智能感知与认知重点实验室,中国科学技术大学)

AI总结 本文提出CaT-FSCIL方法,通过分解触觉感知情境为低维结构成分和高维残差成分,利用伪情境一致性损失和UCPC缓解设备差异影响,在HapTex和LMT108上验证了其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09172 2026-07-14 cs.LG 版本更新

BalDRO: A Distributionally Robust Optimization based Framework for Large Language Model Unlearning

BalDRO:一种基于分布鲁棒优化的大语言模型遗忘框架

Pengyang Shao, Naixin Zhai, Lei Chen, Yonghui Yang, Fengbin Zhu, Xun Yang, Meng Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 针对大语言模型遗忘中样本不均衡问题,提出BalDRO框架,将遗忘设为最小-上确界过程,通过内、外步更新参数,经BalDRO-G和BalDRO-DV变体实例化,实验显示其在遗忘质量和模型效用上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03564 2026-07-14 cs.LG 版本更新

CoGenCast: A Coupled Autoregressive-Flow Generative Framework for Time Series Forecasting

CoGenCast:用于时间序列预测的耦合自回归流生成框架

Mingyue Cheng, Yaguo Liu, Daoyu Wang, Xiaoyu Tao, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

AI总结 针对时间序列预测需兼顾语义理解与随机建模的问题,提出CoGenCast框架,将预训练大语言模型与流匹配机制结合,通过修改注意力拓扑重配置模型,集成流匹配机制捕捉动态,实现多模态预测和跨域统一训练,实验显示性能具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02245 2026-07-14 cs.CV 版本更新

SparseLGS: Sparse View Language Embedded Gaussian Splatting

SparseLGS:稀疏视图语言嵌入高斯溅射

Jun Hu, Zhang Chen, Zhong Li, Yi Xu, Juyong Zhang

机构 * School of Mathematical Science, University of Science and Technology of China(科学技术大学数学科学学院) Meta Apple Inc.(苹果公司) Alpha Labs at Goertek(Goertek的Alpha实验室)

AI总结 研究针对无姿态和稀疏视图输入图像的3D场景理解难题,提出SparseLGS方法。利用密集立体模型与区域匹配法,提取低维信息并引入重建损失。实验表明该方法用较少输入重建语义场质量可比SOTA,且速度提升5倍。

Comments Project Page: https://ustc3dv.github.io/SparseLGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23128 2026-07-08 cs.RO 版本更新

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

$\pi_0$-EqM:闭环视觉-语言-动作控制的均衡匹配

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出$\pi_0$-EqM,用均衡匹配解码器替换$\pi_0$中的流匹配专家,在固定预算下提升机器人操作成功率,并发现残差与成功率之间的非单调关系。

Comments Preprint. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25126 2026-07-07 cs.IR cs.AI 版本更新

MCLMR: A Model-Agnostic Causal Learning Framework for Multi-Behavior Recommendation

MCLMR:一种多行为推荐的模型无关因果学习框架

Ranxu Zhang, Junjie Meng, Ying Sun, Ziqi Xu, Bing Yin, Hao Li, Yanyong Zhang, Chao Wang

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) RMIT University(皇家墨尔本理工大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK Research, iFLYTEK(科大讯飞研究院)

AI总结 MCLMR提出一种模型无关的因果学习框架,解决多行为推荐中因果效应建模、辅助行为聚合和语义对齐的问题,通过因果图和混合专家模块提升推荐性能。

Comments Accepted by WWW 2026(oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17176 2026-07-07 cond-mat.mtrl-sci cs.AI physics.comp-ph 版本更新

NextCrystal: a Symmetry-Driven Generative Framework for Crystal Structure Prediction

NextCrystal:用于晶体结构预测的对称驱动生成框架

Jinming Mu, Lixin He, Xudong Zhu, Shi Yin

机构 * Laboratory of Quantum Information, University of Science and Technology of China(量子信息实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

AI总结 研究针对晶体结构预测难题,引入NextCrystal框架,用大语言模型编码化学语义,经启发式波束搜索和扩散主干,实现从原子化学计量比直接生成精细Wyckoff位点模式,性能达最优并发现新相。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03955 2026-07-07 cs.LG cs.AI 版本更新

GIPO: Gaussian Importance Sampling Policy Optimization

GIPO:高斯重要性采样策略优化

Chengxuan Lu, Zhenquan Zhang, Shukuan Wang, Qunzhi Lin, Baigui Sun, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14192 2026-07-07 cs.AI cs.CL 版本更新

Toward Efficient Agents: Memory, Tool learning, and Planning

迈向高效智能体:记忆、工具学习与规划

Xiaofang Yang, Lijun Li, Heng Zhou, Tong Zhu, Xiaoye Qu, Yuchen Fan, Qianshan Wei, Rui Ye, Li Kang, Yiran Qin, Daizong Liu, Qi Li, Ning Ding, Siheng Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

AI总结 研究将大语言模型扩展到智能体系统中的效率问题,从记忆、工具学习和规划三个核心组件考虑成本,回顾多种方法并详细讨论,以两种方式刻画效率,还探讨关键挑战与未来方向。

Comments 63 pages, 244 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01687 2026-07-07 cs.CV 版本更新

Structure-Guided Self-Supervised Matching for One-Shot Medical Landmark Detection

用于一次性医学地标检测的结构引导自监督匹配

Qingsong Yao, Zhen Huang, Ao Wang, Rongsheng Wang, Hanxue Zhang, Jiangji Wang, S. Kevin Zhou

机构 * Department of Computer Science(计算机科学系) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) School of Biomedical Engineering(生物医学工程学院) School of Artificial Intelligence(人工智能学院) Shanghai Jiaotong University(上海交通大学) Department of Orthopedics(骨科系) Affiliated Hospital of Guizhou Medical University(贵州医科大学附属医院) Yale University(耶鲁大学)

AI总结 研究仅单张标注模板图像的一次性医学地标检测,提出SGB-Match框架,通过自监督从无标注图像对学习对应关系,经结构引导偏差改进对比目标,采用全局到局部设计,实验证明其性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09188 2026-07-03 cs.SD 版本更新

LatentFlowSR: High-Fidelity Audio Super-Resolution via Noise-Robust Latent Flow Matching

LatentFlowSR: 通过噪声鲁棒的潜在流匹配实现高质量音频超分辨率

Fei Liu, Yang Ai, Hui-Peng Du, Yu-Fei Shi, Zhen-Hua Ling

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出LatentFlowSR方法,利用条件流匹配在潜在空间中实现音频超分辨率,通过噪声鲁棒的自动编码器和ODE求解器生成高分辨率音频,实验表明其在多种音频类型和设置中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏