arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-07-01 至 2026-07-01 共收录 5
2606.30599 2026-07-01 cs.CV 版本更新

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Goku:百万级通用指令视频编辑数据集与基准

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tencent Hunyuan(腾讯混元)

AI总结 提出首个百万级多任务视频编辑数据集Goku,包含200万高质量指令对齐对,并设计高效数据合成流程和渐进过滤系统,基于此提出双分支模型Goku-Edit及包含1000个测试用例的基准Goku-Bench,在指令遵循上提升8%。

Comments Project Page: https://flying-sky999.github.io/Goku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30577 2026-07-01 cs.CV 版本更新

APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms

APRIL-MedSeg: 一个拥抱现代范式的模块化医学图像分割工具箱

Juntao Jiang, Jinsheng Bai, Linxuan Fan, Yali Bi, Jiangning Zhang, Yong Liu

机构 * Zhejiang University, APRIL Lab(浙江大学APRIL实验室) Vanderbilt University(范德比尔特大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出YAML驱动的模块化框架APRIL-MedSeg,将分割网络分解为可复用组件,集成半监督、域适应、知识蒸馏、弱监督、文本引导分割及基础模型支持,通过注册配置系统实现灵活可复现的实验管理。

Comments 31 pages, 1 figure, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21351 2026-07-01 cs.RO 版本更新

Learn Weightlessness: Imitate Non-Self-Stabilizing Motions on Humanoid Robot

学习失重:在人形机器人上模仿非自稳定动作

Yucheng Xin, Jiacheng Bao, Haoran Yang, Wenqiang Que, Dong Wang, Junbo Tan, Xueqian Wang, Bin Zhao, Xuelong Li

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University, China(人工智能与机器人中心,深圳国际研究生院,清华大学,中国) Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 本文提出了一种基于生物机制的失重机制,用于在人形机器人上实现非自稳定动作的模仿与环境交互,通过动态确定放松关节及程度,提升环境适应性与动作稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08758 2026-07-01 eess.IV cs.CV 版本更新

M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding

M3CoTBench:医学图像理解中多模态大语言模型的思维链基准测试

Juntao Jiang, Jiangning Zhang, Yali Bi, Jinsheng Bai, Weixuan Liu, Weiwei Jin, Zhucun Xue, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) Zhejiang Provincial People’s Hospital(浙江省人民医院) National University of Singapore(新加坡国立大学)

AI总结 提出M3CoTBench基准,通过多层级难度数据集和专用评估指标,系统评测多模态大语言模型在医学图像理解中的思维链推理正确性、效率、影响和一致性。

Comments 39 pages, 8 figures; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03031 2026-07-01 cs.LG 版本更新

Step-Level Sparse Autoencoder for Reasoning Process Interpretation

步骤级稀疏自编码器用于推理过程解释

Xuan Yang, Jiayu Liu, Yuhang Lai, Hao Xu, Zhenya Huang, Ning Miao

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出步骤级稀疏自编码器(SSAE),通过条件稀疏化形成信息瓶颈,将推理步骤中的增量信息与背景信息分离为稀疏特征,用于解释大语言模型的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏