arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1182
2601.17301 2026-01-27 cs.LG

Tabular Foundation Models are Strong Graph Anomaly Detectors

表格基础模型是强大的图异常检测器

Yunhui Liu, Tieke He, Yongchao Liu, Can Yi, Hong Jin, Chuntao Hong

机构 * State Key Laboratory for Novel Software Technology Nanjing University Nanjing China(新型软件技术国家重点实验室 南京大学 南京 中国) State Key Laboratory for Novel Software Technology Nanjing University(新型软件技术国家重点实验室 南京大学)

AI总结 本文提出TFM4GAD,利用表格基础模型解决图异常检测问题,通过增强特征表和上下文学习提升跨领域泛化能力。

Comments Accepted by WWW 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14746 2026-01-27 cs.LG

RefProtoFL: Communication-Efficient Federated Learning via External-Referenced Prototype Alignment

RefProtoFL:通过外部参考原型对齐实现高效的联邦学习

Hongyue Wu, Hangyu Li, Guodong Fan, Haoran Zhu, Shizhan Chen, Zhiyong Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Yunnan Key Lab. of Service Computing, Yunnan University of Finance and Economics(云南服务计算重点实验室,云南财经大学)

AI总结 RefProtoFL通过外部参考原型对齐和自适应概率更新丢弃技术,实现高效联邦学习,提升异构客户端下的分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06400 2026-01-27 cs.CV

PyMAF-X: Towards Well-aligned Full-body Model Regression from Monocular Images

PyMAF-X:迈向从单目图像中恢复对齐的完整身体模型

Hongwen Zhang, Yating Tian, Yuxiang Zhang, Mengcheng Li, Liang An, Zhenan Sun, Yebin Liu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Department of Computer Science and Technology, Nanjing University(计算机科学与技术系,南京大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

AI总结 PyMAF-X通过改进的回归方法实现从单目图像中准确恢复对齐的完整身体模型,提升了网格与图像的对齐性能。

Comments Article in IEEE TPAMI 2023, Update project page: https://zhanghongwen.cn/pymaf-x, An eXpressive extension of PyMAF [arXiv:2103.16507] for monocular human/hand/face/whole-body motion capture

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10759 2026-01-26 stat.ML cs.LG

Mass Distribution versus Density Distribution in the Context of Clustering

密度分布与质量分布在聚类中的对比

Kai Ming Ting, Ye Zhu, Hang Zhang, Tianrun Liang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China 210023(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China 210023(人工智能学院,南京大学,南京,中国) School of IT, Deakin University, Geelong, Australia 3125(信息技术学院,德金大学,Geelong,澳大利亚)

AI总结 本文提出质量最大化聚类算法,用于克服密度分布的高密度偏见问题,以发现任意形状和密度的聚类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15240 2026-01-22 cs.SD eess.AS

WeDefense: A Toolkit to Defend Against Fake Audio

WeDefense:一种用于对抗假音频的工具包

Lin Zhang, Johan Rohdin, Xin Wang, Junyi Peng, Tianchi Liu, You Zhang, Hieu-Thi Luong, Shuai Wang, Chengdong Liang, Anna Silnova, Nicholas Evans

机构 * Johns Hopkins University(约翰霍普金斯大学) Brno University of Technology(布拉格技术大学) National Institute of Informatics(国家信息研究所) National University of Singapore(新加坡国立大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) WeNet Opensource Community(WeNet开源社区) EURECOM

AI总结 WeDefense是一个开源工具包,旨在提供标准化的假音频检测与定位解决方案,包含灵活的输入增强、校准、分数融合和标准化评估指标等核心功能。

Comments This is an ongoing work. v1 corresponds to the version completed by June 4, 2025 and previously submitted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14550 2026-01-22 cs.RO

TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks

TacUMI: 一种多模态通用操控接口用于接触密集型任务

Tailai Cheng, Kejia Chen, Lingyun Chen, Liding Zhang, Yue Zhang, Yao Ling, Mahdi Hamad, Zhenshan Bing, Fan Wu, Karan Sharma, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Agile Robots SE(敏捷机器人公司) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室及科学与技术学院(苏州校区)) Shanghai University(上海大学)

AI总结 TacUMI通过整合多种传感器,提供了一种多模态数据采集系统,用于提高接触密集型任务中多模态演示的分割和收集效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14283 2026-01-22 cs.LG cs.AI

Beyond Affinity: A Benchmark of 1D, 2D, and 3D Methods Reveals Critical Trade-offs in Structure-Based Drug Design

超越亲和力:一种1D、2D和3D方法的基准测试揭示了基于结构的药物设计中的关键权衡

Kangyu Zheng, Kai Zhang, Jiale Tan, Xuehan Chen, Yingzhou Lu, Zaixi Zhang, Lichao Sun, Marinka Zitnik, Tianfan Fu, Zhiding Liang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系伦塞拉尔理工学院) Department of Computer Science and Engineering Lehigh University(计算机科学与工程系莱斯大学) Department of Computer Science University of Southern California(计算机科学系南加州大学) Stanford Medicine Department of Pathology Stanford University(斯坦福医学部病理学系斯坦福大学) Princeton University(普林斯顿大学) Harvard Medical School(哈佛医学院) State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) Department of Computer Science and Engineering The Chinese University of Hong Kong(计算机科学与工程系香港中文大学)

AI总结 本文通过对比1D、2D和3D方法,揭示了基于结构的药物设计中不同算法的性能差异及关键权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14103 2026-01-21 cs.CV

Interp3D: Correspondence-aware Interpolation for Generative Textured 3D Morphing

Interp3D: 基于对应关系的生成式纹理3D变形

Xiaolu Liu, Yicong Li, Qiyuan He, Jiayin Zhu, Wei Ji, Angela Yao, Jianke Zhu

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学) State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 Interp3D提出一种无需训练的纹理3D变形方法,通过结构化潜在引导和渐进对齐实现几何与纹理一致性,提升3D变形的平滑度和合理性。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13849 2026-01-21 eess.AS cs.LG eess.SP

Co-Initialization of Control Filter and Secondary Path via Meta-Learning for Active Noise Control

通过元学习进行控制滤波器和二次路径的联合初始化以实现主动噪声控制

Ziyi Yang, Li Rao, Zhengding Luo, Dongyuan Shi, Qirui Huang, Woon-Seng Gan

机构 * Key Laboratory of Modern Acoustics, Institute of Acoustics, Nanjing University, Nanjing, China(现代声学关键实验室,声学研究所,南京大学,中国) Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国)

AI总结 本文提出通过元学习联合初始化控制滤波器和二次路径模型,提升主动噪声控制在环境变化下的快速适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13546 2026-01-21 cs.AI

ChatAD: Reasoning-Enhanced Time-Series Anomaly Detection with Multi-Turn Instruction Evolution

ChatAD: 基于推理增强的多轮指令演化的时序异常检测

Hui Sun, Chang Xu, Haonan Xie, Hao Li, Yuhao Huang, Chuheng Zhang, Ming Jin, Xiaoguang Liu, Gang Wang, Jiang Bian

机构 * Nankai University(南开大学) Microsoft Research Asia(微软亚洲研究院) Huanjiang Laboratory(焕江实验室) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) Griffith University(格里菲斯大学)

AI总结 ChatAD通过多智能体演化算法和Kahneman-Tversky优化,提升了时序异常检测的推理能力和跨任务泛化性能,实现了显著的准确率和F1值提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11089 2026-01-21 cs.AI

MiCA: A Mobility-Informed Causal Adapter for Lightweight Epidemic Forecasting

MiCA: 一种基于移动性的因果适配器用于轻量级流行病预测

Suhan Guo, Jiahong Deng, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)

AI总结 MiCA是一种轻量级的因果适配器,通过因果发现和门控残差混合整合移动性信息,提升流行病预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20339 2026-01-21 cs.SD

MMEDIT: A Unified Framework for Multi-Type Audio Editing via Audio Language Model

MMEDIT: 一种基于音频语言模型的多类型音频编辑统一框架

Ye Tao, Wen Wu, Chao Zhang, Mengyue Wu, Shuai Wang, Xuenan Xu

机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能莫埃实验室、X-LANCE实验室、上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

AI总结 MMEdit提出一种基于音频语言模型的统一框架,通过扩展任务定义和设计数据合成管道,实现多类型音频编辑的高精度与高保真度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02751 2026-01-21 cs.LG cs.AI

SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference

SmallKV: 小模型辅助补偿KV缓存压缩以实现高效大语言模型推理

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Hai Zhao, Xiaoming Fu

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen(计算机科学研究所,哥廷根大学)

AI总结 SmallKV通过小模型辅助补偿KV缓存压缩,提升大语言模型在资源受限环境下的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01389 2026-01-21 cs.LG quant-ph

Surrogate Modeling via Factorization Machine and Ising Model with Enhanced Higher-Order Interaction Learning

通过因子机和异或模型的增强高阶交互学习构建替代模型

Anbang Wang, Dunbo Cai, Yu Zhang, Yangqing Huang, Xiangyang Feng, Zhihong Zhang

机构 * Future Science and Technology Research Lab(未来科技研究实验室) China Mobile (Suzhou) Software Technology Company Limited(中国移动(苏州)软件技术有限公司) Graduate School of China Academy of Engineering Physics(中国工程物理研究院研究生部) National Laboratory of Solid State Microstructures(固态微结构国家实验室) School of Physics, Nanjing University(南京大学物理学院) BrightGene Bio-Medical Technology Co., Ltd(BrightGene生物医学技术有限公司)

AI总结 本文提出了一种结合因子机和异或模型的增强替代模型,通过引入松弛变量提升高阶特征交互能力,用于预测药物组合效应,实验表明性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04359 2026-01-19 cs.AI

Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning

基于语义和token熵的高效强化学习用于LLM推理

Hongye Cao, Zhixin Bai, Ziyue Peng, Boyan Wang, Tianpei Yang, Jing Huo, Yuyao Zhang, Yang Gao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) China Mobile NineVerse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九章人工智能技术(北京)有限公司) Institute of Artificial Intelligence, NineVerse, Beijing(九章人工智能研究院,北京)

AI总结 本文提出基于语义和token熵的高效强化学习框架,通过优化数据组织和算法设计缓解熵崩溃,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10061 2026-01-16 cs.CV cs.AI

CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation

CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成

Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06821 2026-01-15 cs.CL cs.AI cs.SE

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

LLMs能否生成可靠的测试用例生成器?对竞赛级编程问题的研究

Yuhan Cao, Zian Chen, Kun Quan, Ziliang Zhang, Yu Wang, Xiaoning Dong, Yeqi Feng, Guanzhong He, Jingcheng Huang, Jianhao Li, Yixuan Tan, Jiafu Tang, Yilin Tang, Junlei Wu, Qianyu Xiao, Can Zheng, Shouchen Zhou, Yuxiang Zhu, Yiming Huang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) Fuzhou University(福州大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

AI总结 本文研究LLMs在生成竞赛级编程问题测试用例生成器方面的能力,提出TCGBench基准测试,并通过实验发现LLMs在生成针对性测试用例以暴露代码缺陷方面存在不足。

Comments 37 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08942 2026-01-15 cs.CL

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08198 2026-01-14 cs.CL cs.LG

Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs

三元组优于对:迈向稳定且有效的自play微调方法用于大语言模型

Yibo Wang, Hai-Long Sun, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(人工智能学院) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

AI总结 T-SPIN通过引入历史优势和熵约束,提升自play微调在稀缺标注数据下的稳定性和性能

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06002 2026-01-14 cs.CL cs.AI

The Molecular Structure of Thought: Mapping the Topology of Long Chain-of-Thought Reasoning

思维的分子结构:映射长链推理的拓扑结构

Qiguang Chen, Yantao Du, Ziniu Li, Jinhao Liu, Songyao Duan, Jiarui Guo, Minghao Liu, Jiaheng Liu, Tong Yang, Ge Zhang, Libo Qin, Wanxiang Che, Wenhao Huang

机构 * LARG, SCIR, Harbin Institute of Technology(LARG、SCIR、哈尔滨工业大学) Peking University(北京大学) Nanjing University(南京大学) Central South University(中南大学)

AI总结 本文提出通过分子结构类比理解长链推理的拓扑特性,引入有效语义异构体概念,并提出Mole-Syn方法提升长链推理性能和稳定性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08399 2026-01-14 cs.LG cs.AI cs.CV

Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment

通过不一致来对齐:面向多模态对齐的边界感知课程学习

Hua Ye, Hang Ding, Siyuan Chen, Yiyang Jiang, Changyuan Zhang, Xuan Zhang

机构 * Nanjing University(南京大学) Airon Technology CO., LTD(艾润科技有限公司) Shanghai Jiao Tong University(上海交通大学) University of Bristol(布里斯托大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出BACL方法,通过边界感知负样本采样和局部注意力损失,提升多模态对齐性能,在多个基准上取得优于CLIP的成果。

Comments 24 pages, 6 figures, 5 tables. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07198 2026-01-14 cs.LG

Synergy over Discrepancy: A Partition-Based Approach to Multi-Domain LLM Fine-Tuning

协同优于差异:一种基于分区的多领域LLM微调方法

Hua Ye, Siyuan Chen, Haoliang Zhang, Weihao Luo, Yanbin Li, Xuan Zhang

机构 * Nanjing University(南京大学) Airon Technology CO., LTD(艾瑞森技术有限公司) University of Bristol(布里斯托大学) The University of Oklahoma(俄克拉荷马大学) Donghua University(东华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于分区的多领域LLM微调方法,通过平衡领域差异与协同效应,有效减少领域间干扰,提升多领域适应性能。

Comments 20 pages, 5 figures, 21 tables. Accepted at NeurIPS 2025. Corresponding author: Xuan Zhang (xuanzhang2199@gmail.com)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07237 2026-01-13 eess.AS cs.SD

The ICASSP 2026 Automatic Song Aesthetics Evaluation Challenge

2026年ICASSP自动歌曲美学评估挑战

Guobin Ma, Yuxuan Xia, Jixun Yao, Huixin Xue, Hexin Liu, Shuai Wang, Hao Liu, Lei Xie

机构 * Shanghai Conservatory of Music, Shanghai, China(上海音乐学院,中国上海) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Nanjing University, Suzhou, China(南京大学,中国苏州)

AI总结 2026年ICASSP挑战通过预测AI生成歌曲的美学评分,推动了音乐生成系统与人类审美偏好的对齐方法发展。

Comments Official summary paper for the ICASSP 2026 ASAE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07178 2026-01-13 cs.CV cs.AI

DIVER: Dynamic Iterative Visual Evidence Reasoning for Multimodal Fake News Detection

DIVER: 动态迭代视觉证据推理用于多模态虚假新闻检测

Weilin Zhou, Zonghao Ying, Chunlei Meng, Jiahui Liu, Hengyang Zhou, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * Xinjiang University(新疆大学) AI Security Lab(360人工智能安全实验室) Beihang University(北航) Fudan University(复旦大学) Central South University(中南大学) Nanjing University(南京大学)

AI总结 DIVER通过动态迭代视觉证据推理提升多模态虚假新闻检测性能,利用文本和视觉证据融合优化检测效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01753 2026-01-13 cs.RO eess.SP

AgriLiRa4D: A Multi-Sensor UAV Dataset for Robust SLAM in Challenging Agricultural Fields

AgriLiRa4D:一种多传感器无人机数据集,用于在具有挑战性的农业田间实现鲁棒SLAM

Zhihao Zhan, Yuhang Ming, Shaobin Li, Jie Yuan

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) TopXGun Robotics(TopXGun机器人公司) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

AI总结 AgriLiRa4D提供多传感器数据集,用于在农业环境中实现鲁棒SLAM,支持多种SLAM研究和评估

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05572 2026-01-12 cs.CV

Towards Generalized Multi-Image Editing for Unified Multimodal Models

面向统一多模态模型的通用多图像编辑

Pengcheng Xu, Peng Tang, Donghao Luo, Xiaobin Hu, Weichu Cui, Qingdong He, Zhennan Chen, Jiangning Zhang, Charles Ling, Boyu Wang

机构 * Western University(西方大学) Tencent YouTu Lab(腾讯优图实验室) Nanjing University(南京大学)

AI总结 本文提出了一种面向统一多模态模型的通用多图像编辑框架,通过可学习的潜在分离器和正弦索引编码提升多图像编辑任务中的视觉一致性和泛化能力。

Comments Project page: https://github.com/Pengchengpcx/MIE-UMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏