arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2380
2605.09701 2026-05-12 cs.CV

DriveFuture: Future-Aware Latent World Models for Autonomous Driving

DriveFuture: 用于自动驾驶的面向未来的潜在世界模型

Yufeng Hong, Xiaotian Zhou, Yingyan Li, Xiangpo Zhou, Lin Liu, Yadan Luo, Shaoqing Xu, Lei Yang, Ziying Song

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Beijing Jiaotong University(北京交通大学) The University of Queensland(昆士兰大学) University of Macau(澳门大学) Nanyang Technological University(南洋理工大学) School of Artificial Intelligence ( School of Software), Yanshan University(燕山大学人工智能学院(软件学院))

AI总结 本文提出DriveFuture,一种面向未来的潜在世界建模框架,通过将未来世界状态条件化于当前潜在状态建模过程,提升自动驾驶轨迹规划性能。

Comments 24pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09584 2026-05-12 cs.CL cs.AI cs.LG

CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

CLR-voyance:通过结果感知的评分表强化住院患者临床决策支持中的开放性推理

Aishik Nagar, Arun-Kumar Kaliya-Perumal, Yu-Hsuan Han, Andrew Sheng-Han Huang, Kristen Kee, Yushi Cao, Yiming Chen, Hongchao Jiang

机构 * ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS)) Rehabilitation Research Institute of Singapore, Nanyang Technological University(新加坡康复研究院,南洋理工大学) Department of Family Medicine, Taipei Veterans General Hospital(台北荣民总医院家庭医学部) School of Medicine, National Yang Ming Chiao Tung University(国家阳明交通大学医学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院)

AI总结 CLR-voyance将住院患者推理建模为POMDP,通过结果感知和临床验证的奖励机制提升决策支持,实现住院患者临床推理的最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09378 2026-05-12 cs.CV cs.AI cs.CL

EduStory: A Unified Framework for Pedagogically-Consistent Multi-Shot STEM Instructional Video Generation

EduStory: 一个统一框架,用于教学一致的多镜头STEM教学视频生成

Xinyi Wu, Jayant Teotia, Shuai Zhao, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出EduStory框架,通过整合教学状态建模、脚本引导的结构控制和学习导向评估指标,解决多镜头STEM教学视频中知识一致性与教学叙事连贯性的问题,并引入EduVideoBench基准测试以评估生成视频的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09360 2026-05-12 cs.LG cs.AI cs.CL cs.SE

Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码

Zhenghan Song, Yulong Liu, Cheng Wan, Chenjun Li, Lingfu Liu, Yunyi Li, Congcong Yuan

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05736 2026-05-12 cs.AI

SDFlow: Similarity-Driven Flow Matching for Time Series Generation

SDFlow:基于相似度的流匹配用于时间序列生成

Wei Li, Shibo Feng, Pengcheng Wu, Xingyu Gao, Min Wu, Peilin Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院) Institute for Infocomm Research, A*STAR(信息通信研究院,A*STAR)

AI总结 SDFlow通过非自回归框架在冻结的VQ潜在空间中实现并行序列生成,解决曝光偏差问题,降低高维性,引入离散监督,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17283 2026-05-12 cs.CL cs.AI

Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective

迈向跨语言价值判断:一种共识多元主义视角

Yukun Chen, Xinyu Zhang, Boyi Deng, Jialong Tang, Yu Wan, Fei Huang, Yuxi Zhou, Baosong Yang, Yiming Li

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出X-Value基准,用于评估LLM跨语言判断内容深层价值的能力,通过两阶段人机协作标注框架解决文化多样性和学科复杂性挑战,涵盖14种语言7大全球议题类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05214 2026-05-12 cs.LG

Disentangled Representation Learning via Flow Matching

通过流匹配实现解耦表示学习

Jinjin Chi, Taoping Liu, Mengtao Yin, Ximing Li, Yongcheng Jing, Jialie Shen, Leszek Rutkowski, Dacheng Tao

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) City St George’s, University of London(伦敦大学城市圣乔治学院) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所)

AI总结 本文提出基于流匹配的框架,通过在紧凑潜在空间中学习因子条件流来实现解耦表示学习,引入非重叠正则化以增强语义对齐,实验表明在多个数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06216 2026-05-12 cs.LG

Adaptive Multi-view Graph Contrastive Learning via Fractional-order Neural Diffusion Networks

自适应多视图图对比学习:通过分数阶神经扩散网络

Yanan Zhao, Feng Ji, Jingyang Dai, Jiaze Ma, Keyue Jiang, Kai Zhao, Wee Peng Tay

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) University College London, London, U.K.(伦敦大学学院)

AI总结 本文提出一种无增强的多视图图对比学习框架,利用分数阶连续动力学生成连续视图谱,通过调整分数阶导数阶数α实现自适应扩散尺度,提升多尺度结构模式的表征能力。

Comments Machine learning, diffusion neural networks. arXiv admin note: text overlap with arXiv:2504.16748

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09592 2026-05-12 cs.CL

Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models

有意识说话:一种双脑方法用于语音语言模型中的实时推理

Donghang Wu, Haoyang Zhang, Jun Chen, Xiangyu, Zhang, Hexin Liu, Eng Siong Chng, Fei Tian, Xuerui Yang, Xiangyu Zhang, Daxin Jiang, Gang Yu

机构 * StepFun Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出Mind-Paced Speaking方法,通过双脑架构实现语音语言模型的实时推理,显著提升推理性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25742 2026-05-12 cs.LG

Less is More: Towards Simple Graph Contrastive Learning

少即是多:迈向简单的图对比学习

Yanan Zhao, Feng Ji, Jingyang Dai, Jiaze Ma, Wee Peng Tay

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院)

AI总结 本文提出一种简单的图对比学习方法,通过聚合图结构特征来减少节点特征噪声,无需数据增强或负采样,在异质图基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09238 2026-05-12 cs.LG cs.AI

Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds

内在缪子:在黎曼矩阵流形上的谱优化

Yibang Li, Bihari Lal Pandey, Ravi Sah, Andi Han, Cyrus Mostajeran, Pratik Jawanpuria, Bamdev Mishra

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Indian Institute of Technology Bombay, India(印度理工学院班加罗尔,印度) University of Sydney, Australia(悉尼大学,澳大利亚) Microsoft India(微软印度)

AI总结 本文提出内在缪子框架,通过在固定秩、SPD、Stiefel和Grassmann流形上实现闭式更新,解决传统缪子在流形参数上的泛化问题,并提供收敛保证。

Comments Code: https://github.com/1bang118/manifold-intrinsic-muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09041 2026-05-12 cs.CL cs.CR

BiAxisAudit: A Novel Framework to Evaluate LLM Bias Across Prompt Sensitivity and Response-Layer Divergence

BiAxisAudit:一种评估大语言模型偏见的新框架,跨提示敏感性和响应层分歧

Jialing Gan, Junhao Dong, Songze Li

机构 * Southeast University, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 本文提出BiAxisAudit框架,通过双轴评估方法揭示LLM偏见的跨提示敏感性和响应层分歧,解决单一指标无法捕捉的偏见问题。

Comments 24 pages, 10 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09019 2026-05-12 quant-ph cs.LG

Learning Pure Quantum States in Any Dimension (Almost) Without Regret

在任意维度下几乎无遗憾地学习纯量子态

Josep Lumbreras, Marco Tomamichel

机构 * Centre for Quantum Technologies, National University of Singapore, Singapore(量子技术中心,新加坡国立大学) Nanyang Quantum Hub, School of Physical and Mathematical Sciences, Nanyang Technological University, Singapore(南洋量子枢纽,南洋理工大学物理与数学科学学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(电子与计算机工程系,新加坡国立大学)

AI总结 本文提出一种在任意有限维中学习纯量子态的方法,通过局部线性模型和鲁棒估计器实现无累积干扰的量子态重构,其在T次测量后累积遗憾为O(d³log²T)。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-05-12 cs.CV cs.AI

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments Code: https://github.com/nguyentthong/video_hallucination

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08820 2026-05-12 cs.CV cs.AI cs.CR

FraudBench: A Multimodal Benchmark for Detecting AI-Generated Fraudulent Refund Evidence

FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据

Xinyu Yan, Boyang Chen, Jiaming Zhang, Tiantong Wu, Hong Xi Tae, Yichen He, Tiantong Wang, Yachun Mi, Yurong Hao, Yilei Zhao, Lei Xiao, Longtao Huang, Pengjun Xie, Wei Liu, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08809 2026-05-12 cs.CL cs.AI

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization

SimReg:通过嵌入相似性正则化提升预训练性能

Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang

机构 * Baidu Inc.(百度公司) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出SimReg,通过增强相同标签嵌入的相似性与不同标签嵌入的对比,提升预训练效率和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08737 2026-05-12 cs.LG cs.CL

The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs

近确定性结构输出在线策略蒸馏中的外推悬崖

Xin Li, Hao Jiang, Annan Wang, Yichi Zhang, Chau Yuen

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文研究了在线策略蒸馏中近确定性结构输出任务的外推悬崖问题,推导了基于模态概率、预热质量及重要性采样剪切强度的闭式安全阈值,并展示了在Amazon Fashion数据集上通过调整参数实现模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08727 2026-05-12 cs.CV cs.AI cs.LG

Control Your View: High-Resolution Global Semantic Manipulation in Learned Image Compression

掌控你的视角:高分辨率全球语义操控在学习图像压缩中的应用

Jiaming Liang, Chi-Man Pun, Weisi Lin, Greta Seng Peng Mok

机构 * University of Macau(澳门大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出了一种新的方法,用于在学习图像压缩中实现高分辨率全球语义操控,通过改进的周期几何衰减调度策略,克服了现有方法在高分辨率语义操控中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08670 2026-05-12 cs.AI cs.CL cs.MA

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

MIND-Skill: 通过多智能体归纳与演绎保证技能质量

Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Waseda University(早稻田大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 本文提出MIND-Skill框架,通过归纳与演绎自动生成可复用的技能,结合三种损失函数保证质量,实验显示其在AppWorld和BFCL-v3上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03544 2026-05-12 cs.CV cs.AI cs.CR

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

PromptGuard: 基于软提示的文本到图像模型不安全内容审查

Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Bo Li

机构 * Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Kahlert School of Computing, The University of Utah(犹他大学Kahlert计算学院) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院)

AI总结 PromptGuard通过引入软提示机制,有效抑制文本到图像模型生成不安全内容,同时保持生成质量,且比现有方法快3.8倍。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10433 2026-05-12 cs.CV cs.LG eess.SP

Implicit Neural Compression of Point Clouds

隐式神经网络点云压缩

Hongning Ruan, Yulin Shao, Qianqian Yang, Liang Zhao, Zhaoyang Zhang, Dusit Niyato

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 本文提出NeRC³框架,利用隐式神经表示实现点云的高效压缩,通过坐标基神经网络编码几何与属性,并扩展至动态点云压缩,实验验证其在静态和动态点云压缩中的优越性能。

Journal ref IEEE Transactions on Image Processing, vol. 35, pp. 260-275, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08181 2026-05-12 cs.CV cs.AI cs.LG

Text-Guided Multi-Scale Frequency Representation Adaptation

基于文本的多尺度频率表示适应

Weicai Yan, Xinhua Ma, Wang Lin, Tao Jin

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出FreqAdapter,通过在频域进行多尺度信号微调,结合文本信息减少信息冗余,提升多模态模型的性能与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15016 2026-05-12 cs.LG

DLink: Distilling Layer-wise and Dominant Knowledge from EEG Foundation Models

DLink:从EEG基础模型中蒸馏分层和主导知识

Jingyuan Wang, Zhihao Jia, Chenyu Liu, Xinliang Zhou, Haoran Luo, Ziyu Jia, Yong Li, Fang Li, Junfeng Yao, Yi Ding

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southeast University(东南大学)

AI总结 DLink通过输入条件化层路由和频谱引导蒸馏,有效蒸馏EEG基础模型知识,提升紧凑学生模型性能,减少参数和计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08043 2026-05-11 cs.CV cs.AI

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07950 2026-05-11 cs.LG

Slowly Annealed Langevin Dynamics: Theory and Applications to Training-Free Guided Generation

缓慢退火 Langevin 动力学:理论及其在无训练引导生成中的应用

Atsushi Nitanda, Dake Bu, Yueming Lyu, Tanya Veeravalli

机构 * Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出缓慢退火 Langevin 动力学(SALD)理论,用于跟踪移动的目标分布路径并通过时间减缓近似终端目标,引入了Velocity-Aware SALD(VA-SALD)以提升无训练引导生成的性能,提供了收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏