arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2379
2607.25136 2026-07-29 cs.AI 新提交

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24863 2026-07-29 cs.RO 新提交

Steeringless Drifting: Differential-Torque Control of a Four-Wheel Independently Driven Vehicle

无舵漂移:四轮独立驱动车辆的差动扭矩控制

Sheng Zhao, Zexin Wu, Dongyang Zhou, Bolin Zhao, Xiaodong Wu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院)

AI总结 研究针对无舵四轮独立驱动车辆,提出基于双轨车辆模型的差动扭矩漂移控制方法,经仿真和实验验证,该方法能使车辆实现特定角度的稳定圆周漂移及8字漂移跟踪,证明了仅用差动轮扭矩漂移控制的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24794 2026-07-29 cs.AI cs.CV 新提交

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-07-29 cs.CV 版本更新

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27351 2026-07-29 cs.CV 版本更新

Feedforward 3D Editing Learns from Semantic-Part Transformation

前馈3D编辑从语义部分变换中学习

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。

Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18379 2026-07-29 cs.LG eess.SP physics.geo-ph physics.space-ph 版本更新

Forecasting Ionospheric Irregularities on GNSS Lines of Sight Using Dynamic Graphs with Ephemeris Conditioning

利用动态图与轨道数据条件化预测GNSS视线上电离层不规则性

Mert Can Turkmen, Eng Leong Tan, Yee Hui Lee

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出利用动态图和轨道数据条件化预测GNSS视线上电离层不规则性,通过构建动态图结构提升预测精度,实验结果显示模型在BSS和PR-AUC指标上均优于传统方法。

Comments 17 pages, 8 figures, submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23835 2026-07-28 cs.CV 新提交

Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations

一致证据,稳健识别:几何变换下的忠实归因正则化

Xianghao Jiao, Ruoyu Chen, Wei Wang, Jiazi Hu, Jiawei Liang, Shangquan Sun, Shiming Liu, Qunli Zhang, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation, Nanjing University of Information Science and Technology(南京信息工程大学自动化学院) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 研究针对归因方法在几何变换下的不足,提出基于图像区域子模搜索的无注释归因正则化框架,通过子模排序损失正则化归因及证据选择过程,实验表明该方法能提升归因稳定性且性能损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22661 2026-07-28 cs.AI 新提交

TRE: Training-Free Hallucination Detection for Diffusion Language Models

TRE:用于扩散语言模型的无训练幻觉检测

Pengcheng Weng, Yanyu Qian, Yue Tan, Yixin Liu

机构 * University of Bern(伯尔尼大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

AI总结 针对扩散语言模型的幻觉问题,现有方法有局限。本文提出无训练的TRE指标,通过在模型解码过程中沿时空维度提取熵信号来估计幻觉风险,经实验验证其性能有竞争力,具有泛化性、效率和鲁棒性等优点。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22569 2026-07-28 cs.AI cs.SE 新提交

Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines

软件工程流水线中编码代理的基于执行的安全测试

Yifei Ge, Weisong Sun, Jinkun Xiao, Yuchen Chen, Yebo Feng, Peizhuo Lv, Xia Feng, Chunrong Fang, Zhihong Zhao, Zhenyu Chen, Yang Liu

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Hainan University(海南大学)

AI总结 研究针对软件工程流水线中编码代理的安全问题,提出基于执行的红队测试框架,利用沙盒证据探测安全边界,将不安全操作嵌入工作负载并借助执行预言机优化,通过实验大幅增加不安全执行验证率,凸显编码代理需更强安全测试。

Comments Preprint. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11976 2026-07-28 cs.LG 版本更新

LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

LiteTopK:利用维度诅咒设计长上下文稀疏注意力中的融合索引器 - TopK 内核

Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) ETH Zurich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究针对现有 GPU 索引器 - TopK 内核效率低的问题,利用维度诅咒设计 LITETOPK 内核,通过采样估计得分范围划分候选结果桶,降低内存开销,在实际部署中加速 GLM 5.2 预填充阶段,提升了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16170 2026-07-28 cs.IR cs.AI 版本更新

EGRA:Toward Enhanced Behavior Graphs and Representation Alignment for Multimodal Recommendation

EGRA:迈向用于多模态推荐的增强行为图和表示对齐

Xiaoxiong Zhang, Xin Zhou, Zhiwei Zeng, Yongjie Wang, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

AI总结 针对多模态推荐现有方法不足,EGRA通过纳入预训练模型生成表示构建的项-项图减轻稀疏性,引入双层动态对齐加权机制提升模态-行为表示对齐,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13335 2026-07-28 cs.CV 版本更新

Deblur-Avatar: Animatable Avatars from Motion-Blurred Monocular Videos

Deblur-Avatar:从运动模糊单目视频生成可动画化头像

Xianrui Luo, Juewen Peng, Zhongang Cai, Lei Yang, Fan Yang, Zhiguo Cao, Guosheng Lin

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) S-Lab for Advanced Intelligence, Nanyang Technological University(南洋理工大学先进智能实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) SenseTime Research(商汤科技研究院)

AI总结 该研究针对运动模糊单目视频输入,提出将基于人类运动的运动模糊模型集成到3D高斯平铺的框架,通过优化轨迹和高斯分布重建高质量可动画化头像,实验证明其在渲染质量等方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22386 2026-07-27 cs.CV cs.CR 新提交

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

用于扩散模型的相关感知和高斯性保持的鲁棒潜在角水印

Yebin Zheng, Haonan An, Guang Hua, Zhiping Lin, Yuguang Fang

机构 * Singapore Institute of Technology(新加坡理工学院) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学)

AI总结 研究扩散模型潜在域水印问题,提出潜在角水印(LAW)及变体LAW-M,通过对映角编码保持高斯性,解决现有方法易受攻击及相关性退化问题,理论上严格表征相关性退化并推导自相关结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22375 2026-07-27 cs.AI 新提交

IDEAgent: Agentic Quality-Diversity Search for Research Idea Generation

IDEAgent:用于研究想法生成的智能体质量多样性搜索

Varun Gumma, Navonil Majumder, Soumitra Sinhahajari, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(声明实验室,南洋理工大学)

AI总结 研究针对大语言模型在生成研究想法时质量与多样性独立导致的局限,提出将研究构思视为质量多样性搜索。介绍多智能体框架IDEAgent,通过多目标反馈驱动质量,轻量级记忆等实现多样性,开发Yield指标评估,实验表明其性能优于基线,还证实修复改进对质量提升的重要性并开源。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22302 2026-07-27 cs.CV 新提交

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction

fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架

Jingyang Huo, Xiangru Huang, Chentao Shen, Yikai Wang, Yun Wang, Jianxiong Gao, Shihao Jin, Yanwei Fu, Jianfeng Feng

机构 * Fudan University(复旦大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Xmov(未提及通用中文名,可音译为艾莫夫)

AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22098 2026-07-27 cs.AI cs.LG 新提交

Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪

Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Zhejiang University(浙江大学) Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

AI总结 针对大型推理模型中推理痕迹含噪声影响幻觉检测的问题,提出REDE框架,利用最终答案注意力塑造表示空间去噪,经实验验证,该框架能有效提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17770 2026-07-27 cs.AI cs.CL 版本更新

Entropy-Gradient Inversion: Moving Toward Internal Mechanism of Large Reasoning Models

熵梯度反转:迈向大型推理模型的内部机制

Junyao Yang, Chen Qian, Kun Wang, Linfeng Zhang, Quanshi Zhang, Yong Liu, Dongrui Liu

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01006 2026-07-27 cs.CL cs.CY 版本更新

Can AI Debias the News? LLM Interventions Improve Cross-Partisan Receptivity but LLMs Overestimate Their Own Effectiveness

AI能否去偏新闻?LLM干预提升了跨党派接受度但LLM高估了自身效果

Faisal Feroz, Jonas R. Kunst

机构 * Department of Experimental Psychology, University of Oxford(心理学实验系,牛津大学) Uehiro Oxford Institute, University of Oxford(牛津大学欧胡罗研究所) Psychology Programme, School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院心理学项目) Department of Communication and Culture, BI Norwegian Business School(BI挪威商学院传播与文化系)

AI总结 研究探讨LLM对新闻去偏的影响,发现实质性重构干预提升保守派对左派新闻的信任度,但LLM高估自身效果,需人类监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06064 2026-07-27 cs.CV 版本更新

PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers

PersonaGesture: 单参考共语手势个性化用于未见说话人

Xiangyue Zhang, Yiyi Cai, Kunhang Li, Kaixing Yang, You Zhou, Zhengqing Li, Xuangeng Chu, Jiaxu Zhang, Haiyang Liu

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所) Nanyang Technological University(南洋理工大学) Renmin University(中国人民大学)

AI总结 本文提出PersonaGesture,一种基于扩散的管道,用于未见说话人的单参考共语手势个性化。通过编码参考视频并分离身份证据与残差统计修正,提升未见说话人的个性化效果。

Comments Needs to be improved

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07025 2026-07-27 cs.CL 版本更新

Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision

面向多语言指令遵循语音大语言模型的语言感知蒸馏:仅使用ASR监督

Shreyas Gopal, Donghang Wu, Ashutosh Anshul, Yeo Yue Heng, Yizhou Peng, Haoyang Li, Hexin Liu, Eng Siong Chng

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) AI Singapore(AI新加坡) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I$^2$R)(信息通信研究所) A$^{*}$STAR(A*星)

AI总结 本文提出一种语言感知蒸馏方法,通过查询库和门控网络提升多语言指令遵循语音大语言模型的性能,实现在Audio-MLQA基准上比现有基线提升32%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21588 2026-07-24 cs.RO 新提交

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

机构 * Axis Robotics(轴机器人公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德州农工大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

Comments Project Website: https://axisaiorg.github.io/AXIS-V1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21138 2026-07-24 cs.CV 新提交

DTIF: Robust Loop Closure Detection via Delaunay Triangle Topology in Complex Forests

DTIF:通过复杂森林中的德劳内三角拓扑进行稳健的回环检测

Xin Zhao, Jianping Li, Qin Zou, Fuxun Liang, Zhen Dong, Bisheng Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Urban Design, Wuhan University(武汉大学城市设计学院) LIESMARS, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

AI总结 针对森林环境中合并局部地图的难题,提出DTIF框架。通过提取树干地标、德劳内拓扑编码、统计筛选、一致性验证等步骤构建加权顶点对应,纳入可靠性权重到姿态估计器。实验证明该方法在边缘平台上兼顾鲁棒性、效率与可部署性,实现准确配准。

Comments 19 pages, 6 figures, 4 tables. Submitted to IEEE Transactions on Geoscience and Remote Sensing

详情

展开后加载摘要…

URL PDF HTML 收藏