arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2210
2507.06219 2026-06-05 cs.RO cs.AI cs.LG

Is Diversity All You Need for Scalable Robotic Manipulation?

多样性是否是可扩展机器人操作的全部需求?

Modi Shi, Li Chen, Jin Chen, Yuxiang Lu, Chiming Liu, Guanghui Ren, Ping Luo, Di Huang, Maoqing Yao, Hongyang Li

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究了数据多样性在机器人学习中的作用,发现任务多样性比单任务演示量更重要,多身体预训练数据在跨身体转移中可选,专家多样性可能对策略学习产生干扰,提出分布去偏方法提升性能。

Comments Code is available at https://github.com/OpenDriveLab/AgiBot-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06434 2026-06-05 cs.CV cs.LG

Unifying Dataset Pruning and Distillation for Efficient Large-scale Compression

统一数据集剪枝与蒸馏以实现高效大规模压缩

Lingao Xiao, Songhua Liu, Yang He, Xinchao Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出一个统一的数据集压缩基准,探讨数据集剪枝与蒸馏的收敛趋势,发现软标签蒸馏在小数据集上表现不如剪枝,提出基于硬标签的数据集压缩方法,通过PCA框架提升图像质量和存储效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06259 2026-06-05 eess.AS cs.SD

Leveraging Prompt Learning and Pause Encoding for Alzheimer's Disease Detection

利用提示学习和暂停编码进行阿尔茨海默病检测

Yin-Long Liu, Rui Feng, Jia-Hong Yuan, Zhen-Hua Ling

机构 * National Social Science Foundation of China(中华人民共和国国家社会科学基金) Supercomputing Center of the USTC(中国科学技术大学超算中心)

AI总结 本文提出通过提示学习和暂停信息编码改进基于转录文本的阿尔茨海默病检测,利用提示模板将分类任务转化为掩码语言建模任务,并通过比较不同自动语音识别模型和集成技术,达到95.8%的检测准确率。

Comments Accepted by ISCSLP 2024

Journal ref Proc. IEEE ISCSLP 2024, pp. 486-490, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05073 2026-06-04 cs.LG

Learning What Not to Impute: An Uncertainty-Aware Diffusion Framework for Meaningful Missingness

学习什么不该插补:一种面向有意义缺失的不确定性感知扩散框架

Lixing Zhang, Yidong Ouyang, Weifu Li, Shixiang Zhu, Guang Cheng, Liyan Xie

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出Diff-Joint扩散框架,通过联合建模表格数据和潜在缺失掩码,交替进行条件采样和不确定性感知聚合,以区分有意义缺失和需插补的缺失,实现选择性插补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04968 2026-06-04 cs.RO

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

势引导的流匹配用于视觉-语言-动作策略改进

Yunpeng Mei, Jiakai He, Hongjie Cao, Chenyu Wang, Xiaowen Zhu, Yihan Zhou, Jiamin Wang, Chenbo Xin, Peng Cheng, Yuxuan Yang, Yijie Wang, Xinhu Zheng, Gao Huang, Jie Chen, Gang Wang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出ForesightFlow,一种自引导流匹配策略,通过解耦优势加权流匹配和一步边界估计器,无需外部评论家即可改进视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04769 2026-06-04 cs.CR cs.AI cs.SE

Description-Code Inconsistency in Real-world MCP Servers: Measurement, Detection, and Security Implications

现实世界 MCP 服务器中的描述-代码不一致性:测量、检测与安全影响

Yutao Shi, Xiaohan Zhang, Xiangjing Zhang, Xihua Shen, Hui Ouyang, Huming Qiu, Mi Zhang, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对 MCP 服务器中工具描述与代码实现不一致的问题,提出结合结构感知静态分析与 Direct-Reverse-Arbitration 提示方法的自动检测框架 DCIChecker,并在大规模数据集上揭示 9.93% 的不一致率及其安全风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04767 2026-06-04 cs.LG cs.CV

Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms

通过Fisher信息度量模型鲁棒性:谱界、理论保证与实用算法

Chong Zhang, Xiang Li, Jia Wang, Qiufeng Wang, Xiaobo Jin

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于Fisher信息矩阵谱范数的攻击无关鲁棒性度量,理论推导常见架构的闭式谱界,并开发高效估计算法,实验验证其与对抗脆弱性的强相关性。

Comments 35 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04737 2026-06-04 cs.CV

Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment

基于物理信息的视频生成:通过混合专家潜在对齐

Cong Wang, Hanxin Zhu, Jiayi Luo, Yonglin Tian, Xiaoqian Cheng, Peiyan Tu, Xin Jin, Long Chen, Zhibo Chen

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) ZGCA(浙江大学) USTC(中国科学技术大学) BUAA(北京航空航天大学) ZJU(浙江大学) EIT(欧洲工业技术学院)

AI总结 提出PILA框架,通过混合专家潜在对齐将物理结构化潜在引导注入预训练视频模型的冻结流匹配动力学,以提升生成视频的物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04684 2026-06-04 cs.CV cs.AI

Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation

基于YOLOv8、SORT跟踪与时间数据插值的实时自动车牌识别

Mirza Muhammad Mobeen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一个五阶段端到端算法流程,结合YOLOv8目标检测、SORT多目标跟踪和时间数据插值,解决动态交通监控中因光照变化、遮挡等导致的识别率低和跟踪路径断裂问题。

Comments 7 Pages, For Accessing code:https://github.com/ mobeen-pmo/Automatic-License-Plate-Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04594 2026-06-04 cs.DC cs.AI cs.SE

Ekka: Automated Diagnosis of Silent Errors in LLM Inference

Ekka: LLM推理中静默错误的自动诊断

Yile Gu, Zhen Zhang, Shaowei Zhu, Xinwei Fu, Jun Wu, Yida Wang, Baris Kasikci

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出Ekka系统,通过差分调试对齐比较中间执行状态,自动诊断LLM推理框架中的静默错误,在真实错误基准上达到80% pass@1和88% pass@5的诊断准确率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04527 2026-06-04 cs.MM cs.CV cs.GR

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

Echo-Infinity: 学习演化记忆用于实时无限视频生成

Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Joy Future Academy, JD(京东探索研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。

Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04410 2026-06-04 cs.CV

Ultra-Fast Neural Video Compression

超快神经视频压缩

Jiahao Li, Wenxuan Xie, Zhaoyang Jia, Bin Li, Zongyu Guo, Xiaoyi Zhang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出基于块的编码框架DCVC-UF,通过联合时空建模和并行重建实现超快编解码,显著提升率失真-复杂度权衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04388 2026-06-04 cs.CR cs.AI cs.LG

TITAN-FedAnil+: Trust-Based Adaptive Blockchain Federated Learning for Resource-Constrained Intelligent Enterprises

TITAN-FedAnil+:面向资源受限智能企业的基于信任的自适应区块链联邦学习

Muhammad Hadi, Muhammad Jahangir, Talha Shafique, Muhammad Khuram Shahzad

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出TITAN-FedAnil+框架,通过基于亲和传播的自适应聚类聚合过滤恶意更新、GPU加速向量化提升效率及有符号状态跳变机制实现轻量级区块链重同步,在资源受限边缘设备上内存开销降低81%。

Comments 8 pages, 5 figures; code available at https://github.com/error8149/FedAnilPlus-Optimized

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04338 2026-06-04 cs.LG cs.CR

Federated Learning for Multi-Center Sepsis Early Prediction with Privacy-Preserving

联邦学习用于隐私保护的多中心脓毒症早期预测

Xixi Tian, Di Wu, Xiang Liu, Yiziting Zhu, Yujie Li, Xin Shu, Bin Yi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对多中心医疗数据的隐私和分布式特性,提出基于联邦学习的分布式协作建模方法,实现与集中式模型相当的预测精度并避免隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04248 2026-06-04 cs.RO

RSC: Decentralized Rigid Formation Flocking for Large-Scale Swarms via Hybrid Predictive Control and Online Reconfiguration

RSC:通过混合预测控制与在线重配置实现大规模集群的分散式刚性编队集群

Ganyu Zou, Linhan Wang, Chen Dai, Siji Chen, Chang-Tien Lu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种分散式控制框架RSC,结合有限时域轨迹预测与反应式人工势场安全控制器,并引入在线领航-跟随重配置机制,在25架无人机杂乱环境中实现83%的编队保持、避障与目标跟踪成功率。

Comments 8 pages, 4 figures, two-column format

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04061 2026-06-04 cs.CV

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

模态内邻居从不说谎:基于图模态内推理纠正模态间噪声对应

Yang Liu, Wentao Feng, Shu-Dong Huang, Yalan Ye, Jiancheng Lv

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出IN2R框架,利用模态内数据的几何稳定性,通过图精炼器对动态跨模态记忆中的邻居进行关系推理,合成连续软原型以纠正模态间噪声对应,显著提升跨模态检索性能。

Journal ref International Conference of Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04046 2026-06-04 cs.CV cs.AI cs.CL cs.LG cs.RO

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

深入场景:通过焦点计划生成打破视觉-语言决策中的感知瓶颈

Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding, Kun Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 提出SceneDiver方法,通过从粗到细的焦点计划生成,逐步构建场景图并分解任务,减少视觉幻觉,提升视觉-语言模型和视觉-语言-动作模型在具身决策任务中的表现。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03972 2026-06-04 cs.CV

AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation

AAD-1:用于一步自回归视频生成的非对称对抗蒸馏

Haobo Li, Yanhong Zeng, Yunhong Lu, Jiapeng Zhu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yujun Shen, Zhipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出非对称对抗蒸馏框架AAD-1,通过打破生成器与判别器的对称性以及分阶段训练策略,解决一步自回归视频生成中的运动崩溃和训练不稳定问题,实现最先进性能。

Comments ICML 2026. Project page: \url{https://aad-1.github.io/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29584 2026-06-04 cs.CL

GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering

GAPD:面向知识库问答中智能体强化学习的金动作策略蒸馏

Xin Sun, Jianan Xie, Zhongqi Chen, Qiang Liu, Shu Wu, Bowen Song, Weiqiang Wang, Zilei Wang, Liang Wang

机构 * University of Science and Technology of China(中国科学技术大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ShanghaiTech University(上海科技大学) Ant Group(蚂蚁集团)

AI总结 提出GAPD框架,通过中间锚点匹配将金动作序列与在线策略对齐,为基于强化学习的知识库问答提供密集的令牌级指导,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05725 2026-06-04 cs.LG math.OC stat.ML

Muon in Associative Memory Learning: Training Dynamics and Scaling Laws

联想记忆学习中的Muon:训练动力学与缩放定律

Binghui Li, Kaifei Wang, Han Zhong, Pinyan Lu, Liwei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文在联想记忆模型中研究Muon优化器的训练动力学和缩放定律,证明其相比梯度下降在无噪声情况下实现指数加速,在有噪声情况下具有更优的缩放效率。

Comments Published as a conference paper at ICML 2026; 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20654 2026-06-04 cs.LG cs.AI

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

REFLECTOR: 内化逐步反思以对抗间接越狱

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18879 2026-06-04 cs.LG cs.AI cs.CL

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn:大语言模型中的少样本知识遗忘

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出ZeroUnlearn框架,通过模型编辑将机器遗忘重新定义为精确的知识重映射问题,利用封闭解乘法参数更新实现高效、定向的少样本遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14054 2026-06-04 cs.AI cs.CV

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning

Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出一种基于强化学习的模态感知信用分配框架(MoCA),通过感知验证和结构化口头验证解决视觉语言模型中感知与推理的权衡问题,实现多任务性能提升。

Comments Accepted by ICML 2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10630 2026-06-04 cs.LG cs.AI

Time Series Forecasting as Reasoning: A Slow-Thinking Approach with Reinforced LLMs

时间序列预测作为推理:一种基于强化LLM的慢思考方法

Yitong Zhou, Yucong Luo, Mingyue Cheng, Qi Liu, Jiahao Wang, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

AI总结 提出Time-R1框架,通过两阶段强化微调(监督微调+强化学习)训练LLM进行多步推理,以提升时间序列预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05881 2026-06-04 cs.CL

Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation

回答前先置信:高效LLM不确定性估计的范式转变

Changcheng Li, Jiancan Wu, Hengheng Zhang, Zhengsu Chen, Guo An, Junxiang Qiu, Xiang Wang, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc.(华为公司)

AI总结 提出CoCA框架,通过GRPO强化学习联合优化置信度校准与答案准确性,实现回答前输出置信度,提升不确定性估计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12147 2026-06-04 cs.LG

It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks

是时候了:迈向下一代时间序列预测基准

Zhongzheng Qiao, Sheng Pan, Anni Wang, Viktoriya Zhukova, Yong Liu, Xudong Jiang, Qingsong Wen, Mingsheng Long, Ming Jin, Chenghao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 针对现有时间序列基准在数据组成、完整性、任务设计和分析视角上的局限,提出TIME基准,包含50个新数据集和98个预测任务,采用人机协作管道确保数据完整性,并引入模式级评估视角,对12个基础模型进行多粒度排名。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08498 2026-06-04 cs.CL

Characterizing, Evaluating, and Optimizing Complex Reasoning

表征、评估与优化复杂推理

Haoran Zhang, Yafu Li, Zhi Wang, Zhilin Wang, Shunkai Zhang, Xiaoye Qu, Yu Cheng

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学) Nanjing University, Suzhou, Jiangsu, China(南京大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出ME$^2$原则来表征推理质量,基于有向无环图(DAG)的成对评估方法,并构建TRM-Preference数据集训练Thinking Reward Model(TRM),以优化推理过程。

Comments Code and data are available at https://github.com/Simplified-Reasoning/TRM

详情

展开后加载摘要…

URL PDF HTML 收藏