arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-07-27 至 2026-07-27 共收录 10
2607.22334 2026-07-27 cs.LG cs.AI cs.CL 新提交

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

基于字节前缀边缘化的跨分词器策略内蒸馏

Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

机构 * University of Chinese Academy of Sciences(中国科学院大学) KwaiKAT Team(快手KwaiKAT团队) Zhejiang University(浙江大学)

AI总结 研究如何通过策略内蒸馏整合不同家族语言模型,提出字节前缀边缘化方法,在共享字节空间重表达教师下一个令牌分布,在数学和编程基准测试中,该方法优于现有跨分词器方法,提升了平均准确率。

Comments Project page: https://bpm-opd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22148 2026-07-27 cs.CV cs.AI 新提交

dRAE: Representation Autoencoder with Hyper-Spherical Codes

dRAE:具有超球面码的表示自编码器

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Peking University(北京大学) Ant Group(蚂蚁集团)

AI总结 研究旨在解决高维视觉表示离散化难题,提出超球面量化(HSQ),其离散表示自编码器(dRAE)能解耦语义与特征幅度,防止码本坍缩,实现高保真重建,实验证明性能提升、码本利用率高且训练流程简化。

Comments Preprint. Project Page: https://drae-hsq.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22039 2026-07-27 cs.CL 新提交

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

过犹不及:强化学习如何减轻大语言模型中任务冲突的综合分析

Zixuan Ren, Jinliang Lu, Junhong Wu, Yang Zhao, Dai Dai, Hua Wu, Haifeng Wang, Chengqing Zong

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

AI总结 研究对比强化学习与监督微调训练的大语言模型的合并行为,经五项任务评估发现强化学习能减少任务冲突及合并后性能下降。通过实验和分析揭示三个关键因素,表明强化学习在模型合并中更具优势。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21610 2026-07-27 cs.AI cs.LG 新提交

SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text

SCOPE和SCION:用于文本模式归纳与融合的基准和可审计参考管道

Miaobo Hu, Xiaobo Guo, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院,北京,中国) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(网络安全学院,中国科学院大学,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

AI总结 研究针对模式图这一信息提取瓶颈,提出SCOPE基准和SCION参考管道。通过从训练文本构建候选空间,经严格JSON合同进行相关操作。在SCOPE核心套件上,SCION-lite表现最佳,SCION-RL减少对专有工程师依赖,还给出标准化结果及相关发布内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13731 2026-07-27 cs.SC cs.LG 版本更新

Breaking the Data Barrier in Learning Symbolic Computation: A Case Study on Variable Ordering Suggestion for Cylindrical Algebraic Decomposition

突破学习符号计算的数据障碍:变量顺序建议的圆柱代数分解案例研究

Rui-Juan Jing, Yuegang Zhao, Changbo Chen

机构 * School of Mathematical Sciences, Jiangsu University(江苏大学数学科学学院) Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

AI总结 本研究通过预训练和微调Transformer模型,改进了圆柱代数分解中变量顺序建议的效率,提升了符号计算的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05394 2026-07-27 cs.CV 版本更新

Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability

深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性

Shizhan Liu, Xinran Deng, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Jie Tang

机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12393 2026-07-27 cs.CL cs.AI 版本更新

MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph

MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架

Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Kyoto University(京都大学) Tsinghua University(清华大学) East China Normal University(华东师范大学) Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院) GenBio AI

AI总结 研究针对医学文献增长带来的知识结构化挑战,引入MedKGent框架,利用PubMed摘要通过两个智能体每日增量构建医学知识图谱,经评估其三元组有效性高,能显著改进大语言模型在医学问答基准上的检索增强生成。

Comments Accepted by Npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏