arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2404.12352 2026-03-24 cs.CV

Point-In-Context: Understanding Point Cloud via In-Context Learning

点在上下文:通过上下文学习理解点云

Mengyuan Liu, Zhongbin Fang, Xia Li, Joachim M. Buhmann, Deheng Ye, Xiangtai Li, Chen Change Loy

机构 * State Key Laboratory of General Artificial Intelligence(国家一般人工智能重点实验室) Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) School of Intelligent Systems Engineering(智能系统工程学院) Sun Yat-sen University(中山大学) ETH Zurich(苏黎世联邦理工学院) Tencent Inc.(腾讯公司) S-Lab(S实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Point-In-Context框架,利用上下文学习实现多任务处理,通过联合采样模块和创新训练策略提升点云分割性能,无需微调即可泛化到新领域。

Comments Project page: https://fanglaosi.github.io/Point-In-Context_Pages. arXiv admin note: text overlap with arXiv:2306.08659

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20887 2026-03-24 cs.CV

Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning

基于场景图的细粒度SegCaptioning Transformer用于可控视频分割与标注

Xu Zhang, Jin Yuan, BinHong Yang, Xuan Liu, Qianjun Zhang, Yuyi Wang, Zhiyong Li, Hanwang Zhang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院和机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) CRRC Zhuzhou Institute Company Ltd.(中车株洲院有限公司) Nanyang Technological University(南洋理工大学)

AI总结 本文提出可控视频分割与标注任务,通过Scene Graph-guided Fine-grained SegCaptioning Transformer框架,结合提示引导时间图模块和细粒度掩码-语言解码器,实现用户意图的精准捕捉与多模态输出生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14469 2026-03-24 cs.RO cs.LG

Physics-Informed Policy Optimization via Analytic Dynamics Regularization

通过解析动力学正则化实现物理信息的策略优化

Namai Chandra, Liu Mohan, Zhihao Gu, Lin Wang

机构 * EmPACT Lab, Nanyang Technological University, Singapore(EmPACT实验室,南洋理工大学,新加坡)

AI总结 本文提出PIPER框架,通过在神经策略优化中引入解析软物理约束,提升机器人控制的效率和物理一致性。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13275 2026-03-24 cs.LG cs.AI

PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation

PREBA:通过PCA加权检索增强LLMs和贝叶斯平均聚合进行手术持续时间预测

Wanyin Wu, Kanxue Li, Baosheng Yu, Haoyun Zhao, Yibing Zhan, Dapeng Tao, Hua Jin

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) First People’s Hospital of Yunnan Province(云南省第一人民医院)

AI总结 PREBA通过PCA加权检索增强和贝叶斯平均聚合,结合机构特定临床证据和统计先验,提升手术持续时间预测的准确性和稳定性,实验显示其性能显著优于零样本推理方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15130 2026-03-24 cs.GR cs.AI cs.CV

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

通过零样本相机控制驯服视频模型以实现3D和4D生成

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。

Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09899 2026-03-24 cs.LG

Variational Neural Networks for Observable Thermodynamics (V-NOTS)

变分神经网络用于可观测量热力学(V-NOTS)

Christopher Eldred, François Gay-Balmaz, Vakhtang Putkaradze

机构 * Computer Science Research Institute, Sandia National Laboratory(沙氏国家实验室计算机科学研究院) Division of Mathematical Sciences, Nanyang Technological University(南洋理工大学数学科学系) Department of Mathematics, University of Alabama(阿拉巴马大学数学系)

AI总结 本文提出基于可观测量的变分神经网络框架,用于描述相空间演化,通过热力学拉格朗日方法和神经网络保证熵非递减性,以高效预测未观测的系统演化。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20348 2026-03-24 cs.CV

Toward a Multi-View Brain Network Foundation Model: Cross-View Consistency Learning Across Arbitrary Atlases

迈向多视角脑网络基础模型:跨视角一致性学习在任意脑图谱上的应用

Jiaxing Xu, Jingying Ma, Xin Lin, Yuxiao Liu, Kai He, Qika Lin, Yiping Ke, Yang Li, Dinggang Shen, Mengling Feng

机构 * Saw Swee Hock School of Public Health at National University of Singapore(国立新加坡大学 Saw Swee Hock 公共卫生学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学 生物医学工程学院及先进医学材料与设备国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 计算与数据科学学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室) Shanghai United Imaging Intelligence(上海联合影像智能有限公司) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

AI总结 本文提出MV-BrainFM多视角脑网络基础模型,通过跨视角一致性学习在任意脑图谱上学习通用且可扩展的表示,提升跨图谱的鲁棒性和一致性,实验表明其在20000+受试者数据集上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20122 2026-03-23 cs.CR cs.AI

Evolving Jailbreaks: Automated Multi-Objective Long-Tail Attacks on Large Language Models

进化式越狱:针对大语言模型的自动化多目标长尾攻击

Wenjing Hong, Zhonghua Rong, Li Wang, Feng Chang, Jian Zhu, Ke Tang, Zexuan Zhu, Yew-Soon Ong

机构 * School of Artificial Intelligence(人工智能学院) Brain-Inspired Technology Co.,Ltd(脑启发技术有限公司) Department of Computer Science and Engineering(计算机科学与工程系) Southern University of Science and Technology(南方科技大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出EvoJail框架,通过多目标进化搜索自动发现长尾分布攻击,提升对大语言模型安全性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19741 2026-03-23 cs.LG cs.CL

FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment

FedPDPO:联邦个性化直接偏好优化用于大语言模型对齐

Kewen Zhu, Liping Yi, Zhiming Zhao, Zhuang Qi, Han Yu, Qinghua Hu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

AI总结 本文提出FedPDPO,一种联邦个性化直接偏好优化框架,通过参数高效微调和个性化奖励头解决非iid数据下的大语言模型对齐问题,实验显示在联邦内域和跨域设置中平均准确率提升达4.80%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19637 2026-03-23 cs.CV

UniBioTransfer: A Unified Framework for Multiple Biometrics Transfer

UniBioTransfer: 多生物特征转移的统一框架

Caiyi Sun, Yujing Sun, Xiangyu Li, Yuhang Zheng, Yiming Ren, Jiamin Wang, Yuexin Ma, Siu-Ming Yiu

机构 * The University of Hong Kong(香港大学) Digital Trust Centre, Nanyang Technological University(南洋理工大学数字信任中心) ShanghaiTech University(上海科技大学)

AI总结 UniBioTransfer 提出了一种统一框架,能够处理多种深度面部生成任务,通过统一数据构建策略和创新的BioMoE模型,解决数据不足和跨任务冲突问题,实现高效泛化和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19633 2026-03-23 cs.LG stat.ML

Alternating Diffusion for Proximal Sampling with Zeroth Order Queries

交替扩散用于带有零阶查询的近端采样

Hirohane Takagi, Atsushi Nitanda

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) Institute of High Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出一种仅利用零阶信息的近端采样器,通过直接模拟动力学而非拒绝采样,将中间粒子分布视为高斯混合分布,从而获得蒙特卡洛分数估计器,在等周条件下继承指数收敛性,并通过并行计算实现快速收敛。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08898 2026-03-23 cs.AI

Preference-Driven Multi-Objective Combinatorial Optimization with Conditional Computation

基于偏好驱动的多目标组合优化与条件计算

Mingfeng Fan, Jianan Zhou, Yifeng Zhang, Yaoxin Wu, Jinbiao Chen, Guillaume Adrien Sartoretti

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Eindhoven University of Technology(埃因霍温理工大学) Sun Yat-sen University(中山大学)

AI总结 本文提出POCCO框架,通过条件计算块动态选择子问题模型结构,并利用偏好信号优化,提升多目标组合优化性能。

Comments 22 pages, 6 figures, 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19255 2026-03-23 cs.CL cs.AI

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

LARFT:为大语言模型的长度指令跟随缩小认知-行动差距

Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 LARFT通过结合强化学习与 hindsight 长度意识,提升大语言模型对输出长度的控制能力,在多个基准测试中取得显著提升。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19231 2026-03-20 cs.CV

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt:基于渐进结构推理的单目关节3D重建

Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, 637335 Singapore(南洋理工大学S实验室)

AI总结 MonoArt通过渐进结构推理实现单目关节3D重建,无需外部运动模板或多阶段流程,提升重建精度和推理速度,并扩展至机器人操作和关节场景重建。

Comments Project page: https://lihaitian.com/MonoArt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19227 2026-03-20 cs.CV

Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer

通过扩散基离散运动分词器弥合语义与运动条件

Chenyang Gu, Mingyuan Zhang, Haozhe Xie, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出三阶段框架,结合连续扩散模型与离散分词生成器,通过MoTok分词器实现语义与运动控制的结合,提升运动生成的可控性与保真度。

Comments Project Page: https://rheallyc.github.io/projects/motok GitHub: https://github.com/rheallyc/MoTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19077 2026-03-20 cs.CV

Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline

多模态大规模小变化建筑物变化检测:基准与基线

Ye Wang, Wei Lu, Zhihui You, Keyan Chen, Tongfei Liu, Kaiyu Li, Hongruixuan Chen, Qingling Shu, Sibao Chen

机构 * MOE Key Lab of ICSP, Anhui Provincial Key Lab of Multimodal Cognitive Computation, IMIS Lab of Anhui Province, School of Computer Science and Technology, Anhui University, Hefei, China(教育部信息与通信领域重点实验室、安徽省多模态认知计算重点实验室、安徽省IMIS实验室、计算机科学与技术学院、安徽大学、合肥,中国) School of Public Safety and Emergency Management, Anhui University of Science and Technology, Hefei 231131, China(公共安全与应急管理学院、安徽理工大学、合肥231131,中国) College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院、南洋理工大学、新加坡639798) Shaanxi Joint Laboratory of Artificial Intelligence, Shaanxi University of Science and Technology, Xi’an 710021, China(人工智能联合实验室、陕西科技大学、西安710021,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an 710049, China(软件工程学院、西安交通大学、西安710049,中国) Graduate School of Frontier Sciences, The University of Tokyo, Chiba, 277-8561, Japan(前沿科学研究生院、东京大学、千叶,日本)

AI总结 本文提出LSMD多模态数据集和MSCNet网络,通过融合RGB和NIR信息提升小变化检测精度,验证了多模态特征融合的有效性。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17927 2026-03-20 cs.RO

RoboForge: Physically Optimized Text-guided Whole-Body Locomotion for Humanoids

RoboForge:物理优化的文本引导全身体态运动为人形机器人

Xichen Yuan, Zhe Li, Bofan Lyu, Kuangji Zuo, Yanshuo Lu, Gen Li, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

AI总结 本文提出RoboForge框架,通过物理优化解决文本生成与机器人运动控制的耦合问题,提升运动精度与稳定性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09255 2026-03-20 cs.CL

DSPO: Stable and Efficient Policy Optimization for Agentic Search and Reasoning

DSPO:用于代理搜索和推理的稳定高效策略优化

Chenyang Gu, Yewen Pu, Bruce Yang, Xiaofan Li, Huan Gao

机构 * Sapiens AI Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

AI总结 DSPO通过序列级优化和动态样本过滤提升代理训练稳定性,使7B模型在多个问答基准上超越前作34.1%,在复杂多跳问答中甚至超越14B模型9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18567 2026-03-20 cs.LG cs.AI cs.CL

SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decoding

SpecForge:一种灵活且高效的开源训练框架用于推测解码

Shenggui Li, Chao Wang, Yikai Zhu, Yubo Wang, Fan Yin, Shuai Shi, Yefei Chen, Xiaomin Dong, Qiaoling Chen, Jin Pan, Ji Li, Laixin Xie, Yineng Zhang, Lei Yu, Yonggang Wen, Ivor Tsang, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出SpecForge,一种支持EAGLE-3的开源框架,通过解耦目标与草案模型、混合并行等技术,显著提升Qwen3-235B-A22B的训练速度,并发布SpecBundle草案模型以解决高质量草案稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18432 2026-03-20 cs.LG

MLOW: Interpretable Low-Rank Frequency Magnitude Decomposition of Multiple Effects for Time Series Forecasting

MLOW:多效应时间序列预测的可解释低秩频率幅度分解

Runze Yang, Longbing Cao, Xiaoming Wu, Xin You, Kun Fang, Jianxun Li, Jie Yang

机构 * Macquarie University(麦考瑞大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 MLOW通过低秩频率幅度分解方法,实现时间序列中多效应的可解释分解,解决了传统模型在可解释性、效率和泛化性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16426 2026-03-20 cs.CV

DynamicVis: Dynamic Visual Perception for Efficient Remote Sensing Foundation Models

DynamicVis: 面向高效遥感基础模型的动态视觉感知

Keyan Chen, Chenyang Liu, Bowen Chen, Wenyuan Li, Zhengxia Zou, Shijian Lu, Zhenwei Shi

机构 * Beihang University(北航大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学)

AI总结 本文提出DynamicVis,针对遥感图像稀疏性设计,通过动态区域感知SSM和元嵌入MIL预训练,提升稀疏目标感知性能,尤其在小目标检测和变化检测中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17671 2026-03-19 cs.CV

Few-Step Diffusion Sampling Through Instance-Aware Discretizations

通过实例感知离散化实现少步扩散采样

Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出实例感知离散化框架,通过输入依赖先验调整时间步分配,提升生成质量,减少训练和推理开销。

Comments 24 pages, 20 figures. code: https://github.com/851695e35/INDIS

详情

展开后加载摘要…

URL PDF HTML 收藏