arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2801
2601.03198 2026-01-07 cs.LG

Empowering Reliable Visual-Centric Instruction Following in MLLMs

赋能多模态大语言模型中的可靠指令跟随

Weilei He, Feng Ju, Zhiyuan Fan, Rui Min, Minhao Cheng, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Penn State(宾夕法尼亚州立大学)

AI总结 本文提出VC-IFEval基准,通过引入视觉依赖性约束,系统评估多模态大语言模型在指令跟随任务中的性能与改进。

Comments Submitted to ARR Jan

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02968 2026-01-07 cs.AI

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02943 2026-01-07 cs.LG cs.MA

MixTTE: Multi-Level Mixture-of-Experts for Scalable and Adaptive Travel Time Estimation

MixTTE:多级专家混合模型用于可扩展和自适应的行程时间估计

Wenzhao Jiang, Jindong Han, Ruiqian Han, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 MixTTE通过多级专家混合模型整合链路级建模与工业级TTE系统,提升大规模交通预测的准确性和稳定性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02917 2026-01-07 cs.CL cs.AI

RAL2M: Retrieval Augmented Learning-To-Match Against Hallucination in Compliance-Guaranteed Service Systems

RAL2M:检索增强的学习-匹配以对抗幻觉在合规保障服务系统中

Mengze Hong, Di Jiang, Jiangtao Wen, Zhiyang Su, Yawen Li, Yanjie Sun, Guan Wang, Chen Jason Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) New York University Shanghai(纽约大学上海分校) Hong Kong University of Science and Technology(香港科技大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 RAL2M通过检索增强的学习-匹配框架,利用众智消除生成幻觉,提升合规保障服务系统的响应可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21710 2026-01-07 cs.CL

Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval

Think-on-Graph 3.0: 通过多智能体双进化上下文检索实现高效自适应的异构图LLM推理

Xiaojun Wu, Cehao Yang, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Yuanliang Sun, Hui Xiong, Jia Li, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(IDEA研究院,国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) DataArc Tech Ltd.(数据弧科技有限公司) Hithink RoyalFlush Information Network Co., Ltd(慧思皇家Flush信息网络有限公司)

AI总结 Think-on-Graph 3.0通过多智能体双进化上下文检索机制,实现高效自适应的异构图LLM推理,提升轻量级模型在复杂推理任务中的性能。

Comments add: reranker agent and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16941 2026-01-07 stat.ML cs.LG stat.ME

SPARKLE: A Nonparametric Approach for Online Decision-Making with High-Dimensional Covariates

SPARKLE:一种用于高维协变量在线决策的非参数方法

Wenjia Wang, Qingwen Zhang, Xiaowei Zhang

机构 * Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科学与技术大学新兴跨学科领域分校) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科学与技术大学工业工程与决策分析系)

AI总结 SPARKLE是一种基于稀疏加法奖励模型的非参数上下文老虎机算法,通过双重惩罚估计器和自适应筛选平衡探索与利用,首次在高维协变量中实现子线性遗憾界。

Comments Main body: 35 pages, 7 figures; supplemental material: 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23564 2026-01-07 cs.AI cs.CL cs.LG

ReCode: Unify Plan and Action for Universal Granularity Control

ReCode:统一计划与行动以实现通用粒度控制

Zhaoyang Yu, Jiayi Zhang, Huixue Su, Yufan Zhao, Yifan Wu, Mingyi Deng, Jinyu Xiang, Yizhang Lin, Lingxiao Tang, Yuyu Luo, Bang Liu, Chenglin Wu

机构 * DeepWisdom The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 ReCode通过递归代码生成统一规划与行动,实现通用粒度控制,提升智能体在不同决策粒度上的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06311 2026-01-07 cs.CR cs.AI

Defending against Indirect Prompt Injection by Instruction Detection

对抗间接提示注入的指令检测

Tongyu Wen, Chenglong Wang, Xiyuan Yang, Haoyu Tang, Yueqi Xie, Lingjuan Lyu, Zhicheng Dou, Fangzhao Wu

机构 * Renmin University of China(中国人民大学) Peking University Shenzhen Graduate School(北京大学深圳研究生院) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Sony AI(索尼人工智能) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出InstructDetector,通过检测LLMs行为状态来识别IPI攻击,实现高检测准确率和低攻击成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04833 2026-01-07 cs.CV cs.AI cs.CL

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03527 2026-01-07 cs.CV

HAPNet: Toward Superior RGB-Thermal Scene Parsing via Hybrid, Asymmetric, and Progressive Heterogeneous Feature Fusion

HAPNet:通过混合、不对称和渐进式异构特征融合实现更优的RGB-热场景解析

Jiahang Li, Peng Yun, Yang Xu, Ye Zhang, Mingjian Sun, Qijun Chen, Ilin Alexander, Rui Fan

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU-BIT University(深圳MSU-BIT大学应用数学联合研究中心) Qingdao Innovation and Development Base, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)青岛创新与发展基地) Department of Control Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学控制科学与工程系) Harbin Institute of Technology at Weihai(哈尔滨工业大学(威海)) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究所) Faculty of Computational Mathematics and Cybernetics, Lomonosov Moscow State University(莫斯科罗蒙诺夫莫斯科国立大学计算数学与自动化系)

AI总结 HAPNet通过混合、不对称和渐进式异构特征融合提升RGB-热场景解析性能,实现最佳效果。

Comments 16 pages, 4 figures. Accepted to the Biomimetic Intelligence and Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01765 2026-01-06 cs.AI cs.SE

A New Benchmark for the Appropriate Evaluation of RTL Code Optimization

为RTL代码优化提供新的基准测试

Yao Lu, Shang Liu, Hangan Zhou, Wenji Fang, Qijun Zhang, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出RTL-OPT基准测试,用于评估大语言模型在RTL代码优化中的能力,通过手工设计的36个数字电路和人工优化的参考代码,提供标准化的评估框架以量化PPA改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01222 2026-01-06 cs.CV

UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass

UniSH:在单次前向传递中统一场景和人体重建

Mengfei Li, Peng Li, Zheng Zhang, Jiahao Lu, Chengfeng Zhao, Wei Xue, Qifeng Liu, Sida Peng, Wenxiao Zhang, Wenhan Luo, Yuan Liu, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 UniSH通过统一前馈框架实现场景和人体的联合重建,利用野外数据提升泛化能力,实现高保真度的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01046 2026-01-06 cs.CL

KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs

KV-Embedding: 通过解码器-only LLMs中的内部KV重路由实现无训练文本嵌入

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 KV-Embedding通过内部KV重路由实现解码器-only LLMs的无训练文本嵌入,提升性能达10%并保持长序列鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24181 2026-01-06 cs.CL

MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring

MedKGI: 基于医学知识图谱和信息引导提问的迭代诊断

Qipeng Wang, Rui Sheng, Yafei Li, Huamin Qu, Yushi Sun, Min Zhu

机构 * Sichuan University(四川大学) HKUST(香港科技大学)

AI总结 MedKGI通过整合医学知识图谱和信息引导提问,提升临床诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23650 2026-01-06 cs.RO

Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

你有即兴能力吗?通过音频控制实现 expressive 人形 locomotion

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang

机构 * BAAI(北京人工智能研究院) University of Sydney(悉尼大学) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 RoboPerform 是首个通过音频直接生成音乐舞蹈和语音手势的人形运动框架,实现了低延迟、高保真的即兴运动表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22909 2026-01-06 math.OC cs.LG cs.NA math.NA stat.ML

A first-order method for nonconvex-strongly-concave constrained minimax optimization

非凸-强凹约束极小极大优化问题的一种一阶方法

Zhaosong Lu, Sanyou Mei

机构 * University of Minnesota(明尼苏达大学) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出了一种用于非凸-强凹约束极小极大优化问题的一阶方法,通过利用强凹结构实现了更高效的运算复杂度。

Comments Accepted by Optimization Methods and Software

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22808 2026-01-06 cs.CV cs.AI

EgoReAct: Egocentric Video-Driven 3D Human Reaction Generation

EgoReAct:基于第一人称视频的3D人体反应生成

Libo Zhang, Zekun Li, Tianyu Li, Zeyu Cao, Rui Xu, Xiaoxiao Long, Wenjia Wang, Jingbo Wang, Yuan Liu, Wenping Wang, Daquan Zhou, Taku Komura, Zhiyang Dou

机构 * THU(清华大学) Brown(布朗大学) Georgia Tech(佐治亚理工学院) Cambridge(剑桥大学) HKU(香港大学) NJU(南京大学) CUHK(香港中文大学) HKUST(香港科技大学) TAMU(德克萨斯大学奥斯汀分校) PKU(北京大学) MIT(麻省理工学院)

AI总结 EgoReAct通过构建HRD数据集,首次实现从第一人称视频实时生成3D对齐的人体反应运动,提升生成的现实感和空间一致性。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22455 2026-01-06 cs.LG cs.CL

AFA-LoRA: Enabling Non-Linear Adaptations in LoRA with Activation Function Annealing

AFA-LoRA:通过激活函数退火在LoRA中实现非线性适应

Jiacheng Li, Jianchao Tan, Zhidong Yang, Feiye Huo, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan, Beijing, China(美团,北京,中国) Hong Kong University of Science and Technology(香港科技大学)

AI总结 AFA-LoRA通过退火激活函数在LoRA中引入非线性表达能力,提升参数高效适应的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16760 2026-01-06 cs.RO

Vision-Language-Action Models for Autonomous Driving: Past, Present, and Future

面向自动驾驶的视觉-语言-动作模型:过去、现在与未来

Tianshuai Hu, Xiaolu Liu, Song Wang, Yiyao Zhu, Ao Liang, Lingdong Kong, Guoyang Zhao, Zeying Gong, Jun Cen, Zhiyu Huang, Xiaoshuai Hao, Linfeng Li, Hang Song, Xiangtai Li, Jun Ma, Shaojie Shen, Jianke Zhu, Dacheng Tao, Ziwei Liu, Junwei Liang

机构 * HKUST(香港科技大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) HKUST(GZ)(香港科技大学(广州)) DAMO Academy, Alibaba(阿里巴巴达摩院) University of California, Los Angeles(加州大学洛杉矶分校) Xiaomi EV(小米电动车) Xi'an Jiaotong University(西安交通大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

AI总结 本文探讨了自动驾驶中视觉-语言-动作模型的发展历程,提出两种主要范式并分析其挑战与未来方向。

Comments Survey; 47 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-vla-for-ad

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26122 2026-01-06 cs.CL

Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking

推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考

Feng Ju, Zeyu Qin, Rui Min, Zhitao He, Lingpeng Kong, Yi R. Fung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学)

AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23019 2026-01-06 cs.RO

Stairway to Success: An Online Floor-Aware Zero-Shot Object-Goal Navigation Framework via LLM-Driven Coarse-to-Fine Exploration

通往成功的阶梯:一种通过LLM驱动的粗到细探索的在线楼层感知零样本物体-目标导航框架

Zeying Gong, Rong Li, Tianshuai Hu, Ronghe Qiu, Lingdong Kong, Lingfeng Zhang, Guoyang Zhao, Yiyi Ding, Junwei Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学)

AI总结 本文提出ASCENT框架,通过LLM驱动的粗到细探索实现在线楼层感知零样本物体-目标导航,无需预建地图或重新训练,适用于多楼层环境。

Comments Accepted to IEEE Robotics and Automation Letters (RAL). Project Page at https://zeying-gong.github.io/projects/ascent

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18608 2026-01-06 cs.CV

Spiking Neural Networks Need High Frequency Information

脉冲神经网络需要高频信息

Yuetong Fang, Deming Zhou, Ziqing Wang, Hongwei Ren, ZeCui Zeng, Lusong Li, Shibo Zhou, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Brain Mind Innovation INC(脑科学与创新有限公司) JD Explore Academy(京东探索研究院) Northwestern University(西北大学)

AI总结 本文提出Max-Former通过增强高频信号提升脉冲神经网络性能,其在ImageNet上达到82.39%的top-1准确率,优于Spikformer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02566 2026-01-06 stat.ML cs.LG stat.CO

MFAI: A Scalable Bayesian Matrix Factorization Approach to Leveraging Auxiliary Information

MFAI: 一种可扩展的贝叶斯矩阵分解方法,用于利用辅助信息

Zhiwei Wang, Fa Zhang, Cong Zheng, Xianghong Hu, Mingxuan Cai, Can Yang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Department of Biostatistics, City University of Hong Kong(香港城市大学生物统计学系)

AI总结 MFAI通过整合梯度提升树的贝叶斯矩阵分解方法,有效利用辅助信息提升数据质量差下的建模能力。

Journal ref Journal of Computational and Graphical Statistics 33 (2024) 1339-1349

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24818 2026-01-05 cs.LG

Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback

零和博弈中的无正则化线性收敛性:从偏好反馈出发

Shulun Chen, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) HKUST(香港科技大学)

AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23537 2026-01-05 cs.CV cs.AI

AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization

AnyMS: 从下到上注意力解耦用于布局引导和无训练多主体定制

Binhe Yu, Zhen Wang, Kexin Li, Yuqian Yuan, Wenqiao Zhang, Long Chen, Juncheng Li, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Zhejiang Tobacco Monopoly Administration(浙江烟草专卖局)

AI总结 AnyMS通过从下到上的双层注意力解耦机制,实现无训练的布局引导多主体定制,有效解决文本对齐、主体身份保持和布局控制的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22905 2026-01-05 cs.CV

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22428 2026-01-05 cs.LG stat.ML

Causality-Inspired Safe Residual Correction for Multivariate Time Series

基于因果的多变量时间序列安全残差校正

Jianxiang Xie, Yuncheng Hua, Mingyue Cheng, Flora Salim, Hao Xue

机构 * University of New South Wales(新南威尔士大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出基于因果的安全残差校正框架CRC,通过分而治之的策略确保多变量时间序列预测的非退化性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21890 2026-01-05 cs.CV

CrownGen: Patient-customized Crown Generation via Point Diffusion Model

CrownGen: 通过点扩散模型实现患者定制的牙冠生成

Juyoung Bae, Moo Hyun Son, Jiale Peng, Wanting Qu, Wener Chen, Zelin Qiu, Kaixin Li, Xiaojuan Chen, Yifan Lin, Hao Chen

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Hong Kong University of Science and Technology(香港科学与技术大学) Division of Pediatric Dentistry and Orthodontics, Faculty of Dentistry(牙科学院儿童牙科与正畸科) University of Hong Kong(香港大学) Department of Chemical and Biological Engineering(化学与生物工程系) Division of Life Science(生命科学系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港联合创新研究院) State Key Laboratory of Nervous System Disorders(神经系统疾病国家重点实验室) Delun Dental Hospital(德尔润牙科医院)

AI总结 CrownGen通过点扩散模型实现患者定制的牙冠自动化生成,提升了牙科修复的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏