arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2778
2509.18898 2026-06-01 cs.CV

DeblurSplat: SfM-free 3D Gaussian Splatting with Event Camera for Robust Deblurring

DeblurSplat:基于事件相机的无SfM三维高斯泼溅鲁棒去模糊方法

Pengteng Li, Yunfan Lu, Pinhao Song, Weiyu Guo, Huizai Yao, F. Richard Yu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) KU Leuven(卢森堡大学) Carleton University(卡尔顿大学)

AI总结 提出首个无需运动恢复结构的去模糊三维高斯泼溅方法,利用密集立体模块和事件流实现高质量新视图合成与高效渲染。

Comments Accepted by TMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20478 2026-06-01 cs.CV

Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding

Video-MTR: 用于长视频理解的多轮强化推理

Yuan Xie, Tianshui Chen, Zheng Ge, Lionel Ni

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Guangdong University of Technology(广东工业大学) X-Era AI Lab(X-Era人工智能实验室)

AI总结 提出Video-MTR框架,通过强化多轮推理迭代选择关键视频片段并理解问题,结合门控双层奖励系统实现端到端训练,在长视频理解基准上提升准确率和效率。

Comments Accepted by ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30334 2026-05-29 cs.AI cs.CL

Demystifying Data Organization for Enhanced LLM Training

揭秘数据组织以增强大语言模型训练

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文系统探索数据组织对大语言模型训练的影响,提出边界锐化、循环调度、课程连续性和局部多样性四项优化准则,并基于此设计了两种新的数据排序方法STR和SAW,实验验证了其在预训练和微调阶段的有效性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30263 2026-05-29 cs.CV

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

minWM: 用于实时交互式视频世界模型的全栈开源框架

Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

机构 * ShengShu(盛书) THU(清华大学) RUC(中国人民大学) HKUST(香港科技大学) UT-Austin(德克萨斯大学奥斯汀分校)

AI总结 提出minWM全栈开源框架,通过因果强制/因果强制++流水线将双向视频扩散模型转化为可控制、低延迟的自回归世界模型,支持相机控制与多种骨干架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30245 2026-05-29 cs.CL

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

知道在如何解决之前该解决什么:预规划赋能的大语言模型数学推理

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出PPC框架,通过引入显式的问题理解阶段(预规划)来弥补现有规划推理方法中“如何解决”与“该解决什么”之间的范式差距,在多个数学推理基准上取得最佳结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29900 2026-05-29 cs.LG cs.IT math.IT

OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment

OVA-IB:用于多模态对齐的一对多信息瓶颈

Tianchao Li, Shujian Yu, Xinrui Zu, Zhaolong Wei, Jeremy Gummeson, Jack C. P. Cheng, Robert Jenssen

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT – The Arctic University of Norway(挪威北极大学) University of Copenhagen(哥本哈根大学) Norwegian Computing Center(挪威计算中心) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 提出基于信息瓶颈的一对多对齐框架OVA-IB,通过充分性对比下界和最小性正则化实现任意数量模态的对齐,在分类、回归和跨模态检索任务中表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29894 2026-05-29 cs.CV

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

训练智能体而非专家:学习利用异构专家进行多轮视觉推理

Yaowu Fan, Tao Han, Dazhao Du, Andy J. Ma, Jia Wan

机构 * Sun Yat-sen University(中山大学) HKUST(香港科技大学) Harbin Institute of Technology(哈尔滨理工大学)

AI总结 提出VisHarness,一种可训练的视觉智能体,通过解耦高层感知推理与低层任务执行,学习利用异构视觉专家模型,以轻量训练实现多轮交互下的通用视觉任务求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29856 2026-05-29 cs.CV

Building and Road Recognition in Dense Urban Informal Settlements: A Dataset and Benchmark

密集城市非正规住区中的建筑与道路识别:数据集与基准

Hongyu Long, Jiaxuan Liu, Rui Cao

机构 * Guangdong Provincial Project(广东省项目) Guangzhou-HKUST(GZ) Joint Funding Program(广州-香港科技大学联合基金计划) AI Research and Learning Base of Urban Culture Project(城市文化AI研究与学习基地项目)

AI总结 针对城市村等高密度非正规住区缺乏精细标注数据的问题,构建了首个高分辨率遥感数据集DenseUIS,并评估了现有深度学习模型,揭示了其在处理密集非正规形态上的局限性,为复杂高密度环境下的精细城市制图提供了基准。

Comments 5 pages, 4 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29790 2026-05-29 cs.MA cs.AI

Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems

像团队一样进化:基于LLM的多智能体系统的协作自我进化

Zhezheng Hao, Tianfu Wang, Huanshuo Dong, Ziyan Liu, Hong Wang, Xiankun Lin, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

AI总结 提出Meta-Team框架,通过协作自我进化机制,基于执行经验改进多智能体系统的行为、协调和团队组织,在长周期任务中显著优于单智能体、手工MAS及先前进化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29716 2026-05-29 cs.AI

NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs

NaRA: 面向扩散大语言模型参数高效微调的噪声感知LoRA

Shuaidi Wang, Zhan Zhuang, Ruping Huang, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系,香港,中国) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港理工大学计算机科学与工程系,香港,中国)

AI总结 针对扩散大语言模型,提出噪声感知低秩适配(NaRA),通过噪声条件超网络生成低秩核心矩阵,实现沿去噪轨迹连续变化的更新矩阵,在常识推理、数学推理和代码生成基准上优于噪声无关基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29583 2026-05-29 cs.CV

BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression

BitC-3DGS: 基于位压缩的高容量3D高斯泼溅水印技术

Yuquan Bi, Baosheng Yu, Yingke Lei, Jianwei Yang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科金医学院) College of Electronic Engineer, National University of Defense and Technology(国防科技大学电子工程学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究所) School of Computer Science and Engineering, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, Southeast University(东南大学计算机科学与工程学院,教育部新一代人工智能技术及其交叉应用重点实验室) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Faculty of Science and Technology, UOW College Hong Kong(UOW学院香港科技学院理学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程学院)

AI总结 提出BitC-3DGS框架,通过位压缩令牌化、双分支架构和硬消息采样策略,突破CLIP文本编码器77位消息限制,实现高容量3DGS水印嵌入与恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22616 2026-05-29 cs.CL

Chinese sensorimotor and embodiment norms for 3,000 lexicalized concepts

3000个词汇化概念的中文感觉运动与具身规范

Jing Chen, Gábor Parti, Yin Zhong, Chu-Ren Huang, Marco Marelli

机构 * Department of Psychology(心理学系) University of Milano-Bicocca(米兰-比科卡大学) Department of Chinese and Bilingual Studies(中文与双语研究系) The Hong Kong Polytechnic University(香港理工大学) Center for Language Education(语言教育中心) The Hong Kong University of Science and Technology(香港科学大学)

AI总结 本研究为3000个中文词汇化概念提供了11维感觉运动评分和单维具身评分,验证了其高信度和效度,并发现感觉运动信息对词汇加工有促进作用,且可从语言表征中部分恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20612 2026-05-29 cs.LG

Matryoshka Concept Bottleneck Models

Matryoshka 概念瓶颈模型

Ziye Chen, Hongbin Lin, Jie Li, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出 Matryoshka 概念瓶颈模型 (MCBM),通过嵌套层次结构实现自适应概念利用,将预期干预成本从线性降低到对数阶 O(log K),同时保证单调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26506 2026-05-29 cs.CL cs.CR

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

SafeReview: 防御基于LLM的评审系统免受对抗性隐藏提示攻击

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Backes, Yue Zhang, Linyi Yang

机构 * CISPA Westlake University(西交利物浦大学) Southern University of Science and Technology(南方科技大学) HKUST (Guangzhou)(香港科技大学(广州))

AI总结 提出SafeReview,一种共进化对抗训练框架,通过联合训练生成器和防御者模型,增强基于LLM的同行评审系统对对抗性隐藏提示的鲁棒性。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10219 2026-05-29 cs.AI

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉

Zhe Qian, Yanbiao Ma, Zhuohan Ouyang, Zhonghua Wang, Zhongxing Xu, Fei Luo, Xinyu Liu, Zongyuan Ge, Yike Guo, Jungong Han

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) South China Agricultural University(华南农业大学) South China Normal University(华南师范大学) Monash University(莫纳什大学) Jishou University(吉首大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21909 2026-05-29 cs.AI cs.CL

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

从元思维到执行:面向通用且可靠的大语言模型推理的认知对齐后训练

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出一种认知启发的两阶段后训练框架,通过元思维链监督学习通用策略和置信度校准强化学习优化执行可靠性,在分布内和分布外分别提升2.10%和3.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12500 2026-05-29 cs.CV

Video Individual Counting and Tracking from Moving Drones: A Benchmark and Methods

来自移动无人机的视频个体计数与跟踪:基准与方法

Yaowu Fan, Jia Wan, Tao Han, Andy J. Ma, Wanli Ouyang, Antoni B. Chan

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) school of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Chinese University of Hong Kong(香港中文大学)

AI总结 针对大规模密集人群场景,提出移动无人机视频数据集MovingDroneCrowd++,并设计基于最优传输和描述子投票的计数与跟踪方法GD3A和DVTrack,显著降低计数误差并提升跟踪精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21979 2026-05-29 cs.CV cs.AI

Benchmarking and Mitigating Sycophancy in Medical Vision Language Models

医疗视觉语言模型中的谄媚行为基准测试与缓解

Juangui Xu, Zikun Guo, Jingwei Lv, Hongbin Lin, Shu Yang, Jun Wen, Di Wang, Lijie Hu

机构 * MBZUAI Saarland University(萨尔兰大学) HKUST(GZ)(香港科技大学(广州)) KAUST(卡塔尔大学)

AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。

Comments 19figures, 61pages. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15180 2026-05-29 cs.AI

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data

PuzzleClone: 一种基于DSL的可验证数据合成框架

Kai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu

机构 * HiThink Research(HiThink研究院) HKUST(香港科技大学) Zhejiang University(浙江大学)

AI总结 提出PuzzleClone框架,通过DSL驱动的方法合成大规模、高可靠、多样化的可验证数学逻辑数据集,并构建PC-83K基准,实验表明后训练能显著提升LLM在逻辑与数学任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29543 2026-05-29 cs.LG cs.AI cs.CL cs.HC cs.IR

SCOPE: A Lightweight-training LLM Framework for Air Traffic Control Readback Monitoring

SCOPE:一种用于空中交通管制复诵监控的轻量训练LLM框架

Qihan Deng, Minghua Zhang, Yang Yang, Zhenyu Gao

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) School of Electronic and Information Engineering, Beihang University(北航电子与信息工程学院) State Key Laboratory of CNS/ATM(国家空管自动化系统实验室)

AI总结 提出SCOPE框架,通过冻结LLM结合插件式开放集分类器和上下文学习机制,实现高效准确的空管复诵监控,在少样本设置下开放集检测准确率达91.05%,异常纠正率96.63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23345 2026-05-29 cs.CV

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

Zizhao Tong, Yeying Jin, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室) Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 提出SCOPE方法,通过在每个Transformer块中插入条件模块,将特征重塑为逐像素时间序列,以分离FPS游戏中局部作用域(scope)内的操作效果与全局生成,并引入跨游戏数据集CrossFPS,实现零样本迁移。

Comments Project page: https://z2tong.github.io/SCOPE/. Code is available at https://github.com/z2tong/SCOPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01194 2026-05-29 cs.RO

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

VLA-ATTC:基于相对动作评判模型的VLA模型自适应测试时计算

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu

机构 * University of Sydney(悉尼大学) Central South University(中央南大学) University of Science and Technology of China(中国科学技术大学) Sensetime Research(商汤科技研究院) Hong Kong University of Science and Technology(香港理工大学)

AI总结 提出VLA-ATTC框架,通过不确定性驱动的“认知离合器”和相对动作评判模型(RAC)实现自适应测试时计算,在LIBERO-LONG基准上将SOTA模型PI0.5的失败率降低50%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17220 2026-05-29 cs.CL

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

心智景观感知的检索增强生成以改进长上下文理解

Yuqing Li, Jiangnan Li, Zheng Lin, Ziyan Zhou, Junjie Wu, Weiping Wang, Jie Zhou, Mo Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) WeChat AI, Tencent(腾讯微信AI) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出MiA-RAG框架,通过层次化摘要构建心智景观并统一检索与生成的条件,实现全局语义表示指导下的长上下文检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22884 2026-05-29 cs.AI

InsightEval: An Expert-Curated Benchmark for Assessing Insight Discovery in LLM-Driven Data Agents

InsightEval:用于评估LLM驱动数据代理洞察发现能力的专家策划基准

Zhenghao Zhu, Yuanfeng Song, Xin Chen, Chengzhong Liu, Yakun Cui, Caleb Chen Cao, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港理工大学) ByteDance(字节跳动)

AI总结 针对现有洞察发现基准InsightBench的缺陷,提出数据整理流程构建新基准InsightEval,并引入新指标衡量代理的探索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02537 2026-05-29 cs.LG

Solved in Unit Domain: JacobiNet for Differentiable Coordinate-Transformed PINNs

在单位域中求解:用于可微坐标变换PINNs的JacobiNet

Xi Chen, Jianchuan Yang, Junjie Zhang, Runnan Yang, Xu Liu, Hong Wang, Tinghui Zheng, Ziyu Ren, Wenqi Hu

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科技大学机械与航空航天工程系) Department of Mechanics & Engineering, College Architecture & Environment, Sichuan University(四川大学力学与工程学院) School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程与自动化学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) West China Biomedical Big Data Center, West China Hospital, Sichuan University(四川大学西昌生物医学大数据中心,西昌医院)

AI总结 提出JacobiNet,一种基于学习的可微坐标变换PINN框架,通过端到端可微架构统一域映射与PDE求解,解决不规则边界域中PINNs的归一化、边界强制和损失项不平衡问题,显著提升精度和效率。

Comments Accepted by Journal of Computational Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28490 2026-05-28 cs.CV cs.AI

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

SSR3D-LLM: 通过潜在步骤实现结构化空间推理以实现统一3D-LLM中的细粒度定位

Jiawei Li, Ziyi Liu, Weijie Shi, Long Chen, Jiajie Xu, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学)

AI总结 针对统一3D-LLM中细粒度查询的脆弱性,提出SSR3D-LLM,通过潜在空间推理步骤和几何感知评分器逐步精炼候选排名,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28247 2026-05-28 cs.LG cs.AI

IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage

IRDS: 通过验证器耦合的稀疏自编码器覆盖实现可解释的RLVR数据选择

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

AI总结 提出IRDS方法,基于稀疏自编码器簇和验证器耦合的覆盖目标,选择模型失败但可学习的RLVR训练实例,提升数学推理准确率并降低计算成本。

Comments 24 pages,3 figures,18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28203 2026-05-28 cs.LG

Refining Multidimensional Video Reward Models via Disentangled Influence Functions

通过解耦影响函数优化多维视频奖励模型

Muyao Wang, Zeke Xie, Hideki Nakayama

机构 * The University of Tokyo(东京大学) HKUST (Guangzhou)(香港科技大学(广州))

AI总结 针对文本到视频生成任务中训练样本在不同评估维度上可靠性不一致的问题,提出解耦影响框架以估计维度特定监督风险,并设计维度解耦剪枝与重加权策略,显著提升多维视频奖励模型与真实标注的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28173 2026-05-28 cs.CV

MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation

MangaFlow: 一种用于可控故事到漫画生成的端到端代理框架

Muyao Wang, Zeke Xie, Yanhao Chen, Lixin Xiu, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出MangaFlow代理框架,通过将漫画创作分解为规划、定位、布局构建、参考条件渲染、合成和文字放置等步骤,实现可控的长篇漫画生成,支持布局和视觉参考作为显式中间变量,并引入故事段落记忆以保持跨面板一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏