arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-07-07 至 2026-07-07 共收录 25
2607.04360 2026-07-07 stat.ML cs.LG 新提交

Optimal Mixture-of-Experts Model Averaging for Conditional Generative Models

面向条件生成模型的最优专家混合模型平均方法

Shijin Gong, Baihua He, Xinyu Zhang

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

AI总结 针对条件生成模型多候选生成器性能随场景波动的问题,提出无需可处理密度的样本驱动最优模型平均框架,含静态与输入自适应方法,经多模态实验验证效果优于基线。

Comments 32 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05056 2026-07-07 cs.CV 新提交

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

一致且可编辑:文本引导视频编辑的平衡框架

Tao Jin, Li Xiao

机构 * USTC(中国科学技术大学)

AI总结 针对视频编辑中时间一致性和可编辑性难以平衡的问题,提出EquiEdit框架。通过时间Mamba模块增强时间一致性,设计基于频谱变换的噪声注入策略提升可编辑性,实验证明该方法有效。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04851 2026-07-07 cs.MM cs.LG 新提交

SleepBand: Single-Source Domain Generalization for Sleep Staging via Physiologically Structured Spectral Modeling

SleepBand:通过生理结构谱建模实现睡眠分期的单源域泛化

Zhi Lu, Yang Hu, Yan Chen

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院)

AI总结 针对睡眠分期模型跨数据集泛化难题及单源域泛化的严格实际场景,提出SleepBand框架,利用可学习的Morlet滤波器组和结构化管道嵌入振荡先验,提升单源域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04816 2026-07-07 cs.RO 新提交

CAC-VLA: Context-Gated Action Conditioning for Vision-Language-Action Models

CAC-VLA:用于视觉-语言-动作模型的上下文门控动作条件调节

Yifu Xiong, Wenhao Yu, Jiaxuan Lin, Bojun Zou, Jiahao Li, Lu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 研究视觉-语言-动作模型,提出上下文门控动作条件调节框架CAC-VLA,在视觉语言模型中学习轻量级潜在动作接口,训练模型预测潜在动作并通过上下文门调节动作专家,实验验证其有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04740 2026-07-07 cs.CV 新提交

DriftST: One-Step Generative Inference of Spatial Transcriptomics from H\&E Histology

DriftST:从苏木精和伊红(H&E)组织学进行空间转录组学的一步生成推理

Yuhang Yang, Yonggan Bu, Shengyuan Zhou, Yiming Luo, Kai Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Peking University Cancer Hospital(北京大学肿瘤医院)

AI总结 研究旨在从H&E图像推断空间解析基因表达。提出DriftST框架,基于细胞漂移生成模型,引入STransformer捕捉基因结构,能处理不同层级数据,实验表明其在两种分辨率下均达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04625 2026-07-07 cs.CV cs.AI 新提交

Hierarchical Evidence-Driven Reasoning for Long Document Understanding

用于长文档理解的分层证据驱动推理

Junyu Xiong, Yonghui Wang, Rongjian Gu, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院)

AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04350 2026-07-07 cs.CL 新提交

WPG-MoE: Weak-Prior-Guided Dense Mixture-of-Experts for User-Level Social Media Depression Detection

WPG-MoE:用于用户级社交媒体抑郁症检测的弱先验引导密集专家混合模型

Xian Li, Yuanhe Tian, Yang Yang, Guoqing Wang, Yan Song

机构 * University of Electronic Science and Technology of China(电子科技大学) Zhongguancun Academy(中关村科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究社交媒体抑郁症检测,提出基于共享大语言模型骨干的WPG-MoE框架,通过推导用户级弱语义先验将用户软路由到匹配的专家,以解决单一检测器决策问题,实验表明其性能优于基线。

Comments 23 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04270 2026-07-07 cs.IR cs.AI 新提交

LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation

LBR:减轻用于推荐的大语言模型中的长度偏差

Hongchen Li, Bohao Wang, Jingbang Chen, Weiqin Yang, Hang Pan, Bingde Hu, Can Wang, Jiawei Chen

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Bangsun Technology(Bangsun科技)

AI总结 研究大语言模型用于推荐时的长度偏差问题,提出LBR框架。通过长度感知注意力校准减轻输入偏差,引入有效信息长度归一化处理输出偏差,实验证明该框架能减轻偏差并提升推荐准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04156 2026-07-07 cs.AI cs.SC 新提交

Language models guide symbolic equation discovery by controlling search

语言模型通过控制搜索来指导符号方程发现

Zikai Xie, Wenmei Li, Man Luo, Jun Jiang, Linjiang Chen

机构 * State Key Laboratory of Precision and Intelligent Chemistry, Hefei National Research Center for Physical Sciences at the Microscale, School of Chemistry and Materials Science, University of Science and Technology of China(精确与智能化学国家重点实验室,合肥微尺度物理科学国家研究中心,化学与材料科学学院,中国科学技术大学) Center for Scientific Intelligence Innovation, Hefei, China(智能创新研究中心,合肥,中国) School of Chemistry, School of Computer Science, University of Birmingham(化学系,计算机科学学院,伯明翰大学)

AI总结 研究科学方程发现,对比语言模型不同角色设定,提出语言模型作搜索控制器的方式(LLM-PySR),经实验其在多任务中平衡了准确率、复杂度等,还发现新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03883 2026-07-07 cs.CV 新提交

SGF-CDNet: A Consistency-Discrepancy Graph Network over Semantic-Geometric Fused Nodes for Face Forgery Detection

SGF-CDNet:基于语义-几何融合节点的一致性-差异图网络用于人脸伪造检测

Jiayao Jiang, Bin Liu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

AI总结 针对人脸伪造检测,提出SGF-CDNet,通过融合语义与几何信息构建节点,利用双路径CD-GNN在一致性和差异两维度并行推理,有效识别面部组件间不和谐关系,实验证明性能优越。

Comments 6 pages, 4 figures. This work has been accepted at ICMEW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03758 2026-07-07 cs.RO cs.CR 新提交

Occluding the Solution Space: Planner-Agnostic Adversarial Attacks on Tolerance-Aware Manipulation

遮挡解空间:针对容错感知操纵的与规划器无关的对抗攻击

Keke Tang, Tianyu Hao, Weilong Peng, Hao Jiang, Feng Wu, Peican Zhu, Jianmin Ji, Zhihong Tian

机构 * Guangzhou University(广州大学) University of Science and Technology of China(中国科学技术大学) Northwestern Polytechnical University(西北工业大学)

AI总结 提出针对容错感知操纵的与规划器无关攻击框架,通过运动学占用热图刻画机器人能力,将攻击设为预算最大覆盖优化,实验表明该方法能可靠引发规划失败,优于基线。

Comments Accepted by IROS'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03512 2026-07-07 cs.RO 新提交

High-Precision Formation Control for Heterogeneous Multi-Robot Systems via Hierarchical Hybrid Physics-Informed Deep Reinforcement Learning

基于分层混合物理信息深度强化学习的异构多机器人系统高精度编队控制

Yanzhou Li, Guangli Chen, Xiao-Meng Li, Wenjian Zhong, Yongkang Lu, Shenghuang He

机构 * Dongguan Key Laboratory of Intelligent Equipment and Smart Industry, School of Advanced Engineering, Great Bay University(东莞智能装备与智能产业重点实验室,大湾区大学先进工程学院) Technische Universität Dresden(德累斯顿工业大学) School of Mechanical and Electrical Engineering, Guangzhou University(广州大学机电工程学院) University of Science and Technology of China(中国科学技术大学) College of Computer Science, Dongguan University of Technology(东莞理工学院计算机科学与技术学院)

AI总结 针对异构多机器人系统编队控制问题,提出分层混合物理信息深度强化学习框架。上层用深度强化学习设计领导者导航策略网络,下层整合多种控制器构建编队控制策略网络,设计分层奖励函数训练跟随者,实验验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03327 2026-07-07 cs.CV 新提交

From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition

从通用动作到特定领域监测:基于骨架的动作识别的先验自适应迁移

Hao Wang, Di Yang, Jiangtao Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 研究基于骨架的动作识别模型在特定领域任务中表现不佳的问题,提出先验自适应迁移框架PATS,通过选择性保留相关先验并过滤冗余,经实验在阿尔茨海默病检测和跌倒检测任务中提升性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02957 2026-07-07 cs.CV 新提交

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal

ReLo-IRR:用于图像反射去除的反射引导LoRA框架

Chaoqun Wang, Yuehuan Wei, Haoxiang Cao, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(南方科技大学人工智能学院) University of Science and Technology of China(中国科学技术大学)

AI总结 针对单图像反射去除问题,提出基于整流流模型的ReLo-IRR框架。设计轻量级估计器预测反射强度描述符,引入时间条件机制,联合建模反射强度和去噪动态,有效抑制不同反射条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02912 2026-07-07 cs.CV cs.HC cs.MM 新提交

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition

看见情感:用于脑电图情感识别的面部表情符号代理建模

Jingjing Hu, Guo Dan, Haofan Cheng, Ying Zeng, Zhan Si, Jinxing Zhou, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) PLA Information Engineering University(中国人民解放军信息工程大学) University of Science and Technology of China(中国科学技术大学) MBZUAI

AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02873 2026-07-07 cs.SE cs.AI cs.CR 新提交

Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究

Romain Gerard, Assmaa Zeghaider, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州研究院)

AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-07-07 cs.CV cs.LG 新提交

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments Technical report(work-in-progress). Code will be available at \url{https://github.com/buptyqx/H-OPD}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02542 2026-07-07 cs.AI cs.CV 新提交

iFLYTEK-Embodied-Omni Technical Report

科大讯飞-具身全能技术报告

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

机构 * iFLYTEK LindenBot University of Science and Technology of China(中国科学技术大学)

AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12913 2026-07-07 cs.LG cs.CV 新提交

Selecting Samples on Graphs: A Unified Dataset Pruning Framework for Lossless Training Acceleration

图上的样本选择:用于无损训练加速的统一数据集剪枝框架

Dongyue Wu, Zilin Guo, Xiaoyu Li, Jiajia Liu, Jingdong Chen, Nong Sang, Changxin Gao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于图的统一数据集剪枝框架,将数据集建模为加权图,通过最大权重团问题选择样本,并设计贪心算法,在多种剪枝比例下优于现有方法,实现ImageNet-1k上40%以上训练加速且不损失精度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏