arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2605.03804 2026-05-26 cs.AI

ScrapMem: A Bio-inspired Framework for On-device Personalized Agent Memory via Optical Forgetting

ScrapMem: 一种基于生物启发的光学遗忘机制用于设备端个性化智能体记忆

Jiale Chang, Yuxiang Ren

机构 * Nanjing Agricultural University(南京农业大学) Nanjing University(南京大学)

AI总结 提出ScrapMem框架,通过光学遗忘机制压缩旧记忆并构建情节记忆图,在资源受限设备上实现高效多模态长期记忆,在ATM-Bench上取得51.0% Joint@10新最优,存储降低93%,召回率提升至70.3%。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24621 2026-05-26 cs.CV

FreeRet: MLLMs as Training-Free Retrievers

FreeRet: 无需训练的多模态大语言模型检索器

Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Institute of Science Tokyo(东京科学研究院) Zhejiang University(浙江大学)

AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24945 2026-05-26 cs.LG cs.AI physics.ao-ph

RealBench: Benchmarking Data-Driven Numerical Weather Forecasting Under Operational Conditions and Extreme Event Challenges

RealBench: 在操作条件和极端事件挑战下对数据驱动数值天气预报的基准测试

Ruize Li, Zhibin Wen, Tao Han, Hao Chen, Fenghua Ling, Wei Zhang, Song Guo, Lei Bai

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Southern University of Science and Technology(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai TechWind Technology Co., Ltd.(上海技风科技有限公司)

AI总结 提出RealBench基准,通过使用低延迟操作分析和全球10,000+站点观测数据,在严格分布外测试集上评估AI天气预报模型,揭示再分析指标与实际性能的显著差异,特别是极端事件方面。

Comments 35 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24870 2026-05-26 cs.CV

Trajectory-Consistent Calibration for Cache-Accelerated Diffusion Models

轨迹一致校准用于缓存加速扩散模型

Mingyu Liang, Dingkun Xu, Jingwei Xu

机构 * Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术实验室)

AI总结 针对缓存加速扩散模型中表示偏差导致生成质量下降的问题,提出无训练的轨迹一致校准方法,通过离线迭代校准缓存表示,在PixArt-alpha和DiT-XL/2上持续改善FID。

Comments 23 pages, 8 figures, 8 tables. Code is available at https://github.com/NJUDeepEngine/TCC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20334 2026-05-26 cs.SE cs.AI

Procedural Refinement by LLM-driven Algorithmic Debugging for ARC-AGI-2

基于LLM驱动的算法调试的程序化精炼用于ARC-AGI-2

Yu-Ning Qiu, Lin-Feng Zou, Jiong-Da Wang, Xue-Rong Yuan, Wang-Zhou Dai

机构 * Nanjing University(南京大学)

AI总结 提出一种神经符号精炼方法ABPR,结合LLM与Prolog元解释器,通过证明树推导进行语义重检,在ARC-AGI-2上实现高通过率,并扩展到RAVEN风格推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20477 2026-05-26 cs.LG

Bi-CoG: Bi-Consistency-Guided Self-Training for Vision-Language Models

Bi-CoG:面向视觉语言模型的双一致性引导自训练

Rui Zhu, Song-Lin Lv, Zi-Kang Wang, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

AI总结 针对半监督微调中模型偏差和超参数敏感问题,提出一种利用模型间和模型内一致性以及误差感知动态伪标签分配策略的即插即用方法Bi-CoG,在14个数据集上显著提升现有方法性能。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23518 2026-05-25 cs.CV

VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset

VINS-120K:基于大规模数据集的超高分辨率图像编辑

Zhizhou Chen, Shanyan Guan, Zhanxin Gao, En Ci, Yanhao Ge, Wei Li, Zhenyu Zhang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) vivo

AI总结 提出首个大规模指令式超高分辨率图像编辑数据集VINS-120K(120K三元组,每张图像≥4K分辨率),并开发高频感知后适应策略以扩展预训练模型至UHR领域,提升细粒度细节合成与纹理真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23263 2026-05-25 cs.RO cs.AI cs.SY eess.SP eess.SY

6G Communication Networks Enabling Embodied Agents: Architecture and Prototype

6G通信网络赋能具身智能体:架构与原型

Lipeng Dai, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Institute of Intelligent Networks and Communications (NINE), Nanjing University (Suzhou Campus)(南京大学智能网络与通信研究所(苏州校区))

AI总结 本文提出一种分层通信架构(包括人类意图感知层、基于O-RAN的传输层、智能中间层和具身层),并通过集成触觉设备、工业机械臂、中间平台和5G O-RAN测试床的原型验证了毫秒级延迟和稳定闭环操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23245 2026-05-25 cs.CV cs.AI

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

SimInsert: 通过区域稀疏注意力融合实现无缝视频对象插入

Xinyu Chen, Yuyi Qian, Jiang Lin, Shenyi Wang, Gao Wang, Zhiqiu Zhang, Jizhi Zhang, Mingjie Wang, Qiang Tang, Qian Wang, Song Wu, Zili Yi

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) JIUTIAN Research(JIUTIAN研究机构) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhejiang Sci-Tech University(浙江科技学院) The University of British Columbia(不列颠哥伦比亚大学)

AI总结 提出SimInsert,一种无需训练的视频对象插入方法,利用图像到视频扩散模型的先验和区域稀疏注意力融合,实现时空一致和交互真实感,在PSNR、SSIM和LPIPS上分别提升18.8%、20.1%和降低44.1%。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21198 2026-05-25 cs.DC cs.AI cs.LG

ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling

ZipMoE:通过无损压缩和缓存亲和调度实现高效的设备端MoE服务

Yuchen Yang, Yaru Zhao, Pu Yang, Shaowei Wang, Zhi-Hua Zhou

机构 * School of Electronic Science and Engineering, Nanjing University, China.(南京大学电子科学与工程学院) National Key Laboratory for Novel Software Technology, Nanjing University, China.(南京大学新型软件技术国家重点实验室)

AI总结 提出ZipMoE系统,通过缓存-调度协同设计利用边缘设备硬件特性和MoE参数统计冗余,实现无损且高效的设备端MoE推理,显著降低延迟并提升吞吐量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12173 2026-05-25 cs.LG cs.AI

SkillTree: Explainable Skill-Based Deep Reinforcement Learning for Long-Horizon Control Tasks

SkillTree: 面向长时域控制任务的可解释基于技能的深度强化学习

Yongyan Wen, Siyuan Li, Rongchang Zuo, Lei Yuan, Hangyu Mao, Peng Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) National Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Polixir Technologies SenseTime Research(商汤科技研究院)

AI总结 提出SkillTree框架,通过可微决策树将连续动作空间离散化为技能空间,实现技能级可解释性,在复杂机器人臂控制任务中达到与基于技能的神经网络相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22552 2026-05-22 cs.CV cs.MM

FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning

FashionLens:通过任务自适应学习实现多功能时尚图像检索

Haokun Wen, Xuemeng Song, Xinghao Xie, Xiaolin Chen, Xiangyu Zhao, Weili Guan

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出FashionLens框架,通过任务自适应学习实现多功能时尚图像检索,解决现有方法无法处理多样检索需求的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22535 2026-05-22 cs.AI

TerminalWorld: Benchmarking Agents on Real-World Terminal Tasks

TerminalWorld: 在真实世界终端任务上评估智能体的基准测试

Zhaoyang Chu, Jiarui Hu, Xingyu Jiang, Pengyu Zou, Han Li, Chao Peng, Peter O'Hearn, Earl T. Barr, Mark Harman, Federica Sarro, He Ye

机构 * University College London(伦敦大学学院) Nanjing University(南京大学) Tencent(腾讯)

AI总结 本文提出TerminalWorld,一个可扩展的数据引擎,能够自动从真实世界终端记录中反向工程高保真的评估任务。通过处理80,870条终端记录,生成1,530个经过验证的任务,涵盖18个真实世界类别,从短日常操作到超过50步的工作流,覆盖1,280个唯一命令。从中精选出200个代表性任务作为Verified子集。在八个前沿模型和六个智能体上全面评估发现,当前系统仍难以处理真实终端工作流,最高通过率为62.5%。此外,TerminalWorld捕捉到与现有专家整理的基准(如Terminal-Bench)不同的真实终端能力,仅与它们的分数有弱相关性(Pearson r=0.20)。自动化引擎使TerminalWorld本身具有真实性和可扩展性,使其能够评估智能体在真实终端环境中随着开发者实践的发展而变化。数据和代码可在https://github.com/EuniAI/TerminalWorld获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22338 2026-05-22 cs.LG

Physics-Informed Generative Solver: Bridging Data-Driven Priors and Conservation Laws for Stable Spatiotemporal Field Reconstruction

物理引导的生成求解器:连接数据驱动先验与守恒定律以稳定时空场重建

Ziyuan Zhu, Keyu Hu, Zhifei Chen, Yuhao Shi, Ming Bao, Jing Zhao, Gang Wang, Haitan Xu, Jiadong Li, Qijun Zhao, Xiaodong Li, Minghui Lu, Yanfeng Chen

机构 * School of Advanced Manufacturing Engineering, Nanjing University(南京大学先进制造工程学院) National Laboratory of Solid State Microstructures, Nanjing University(南京大学固态微结构国家实验室) Suzhou Acoustics Industry Technology Research Institute Co., Ltd.(苏州声学工业技术研究所有限公司) School of Mechanical and Electric Engineering, Soochow University(苏州大学机械与电子工程学院) Shishan Laboratory, Nanjing University(仙山实验室)

AI总结 本文提出了一种物理引导的生成求解器,通过分离稳定的先验学习与推理时的守恒定律强制执行,解决了从稀疏测量中重建连续物理场的问题,同时在声学和气象学中实现了高效且稳定的场重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22287 2026-05-22 cs.AI

SciCore-Mol: Augmenting Large Language Models with Pluggable Molecular Cognition Modules

SciCore-Mol: 通过可插拔分子认知模块增强大语言模型

Yuxuan Chen, Changwei Lv, Yunduo Xiao, Zhongjing Du, Daquan Zhou, Yukun Yan, Zheni Zeng, Zhiyuan Liu

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(电子与计算机工程学院,北京大学深圳校区) Tsinghua University, Beijing, China(清华大学,北京) School of Intelligence Science and Technology, Nanjing University, Suzhou, China(智能科学与技术学院,南京大学苏州校区)

AI总结 本文提出SciCore-Mol框架,通过三个深度集成的可插拔认知模块解决大语言模型处理异构科学数据(如分子)时的语义鸿沟问题,实现分子理解、生成、反应预测和化学知识的综合性能提升。

Comments 15 pages, 4 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22090 2026-05-22 cs.AI

A Camera-Cooperative ISAC Framework for Multimodal Non-Cooperative UAVs Sensing

一种用于多模非合作无人机感知的相机协作ISAC框架

Wenfeng Wu, Luping Xiang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Institute of Intelligent Networks and Communications (NINE)(智能网络与通信研究院) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(南京大学智能软件与工程学院(苏州校区))

AI总结 本文提出了一种相机协作ISAC框架,通过多模感知实现高效的无人机波束定向和跟踪,提升了感知精度和资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04062 2026-05-22 cs.LG cs.AI

EdgeRazor: A Lightweight Framework for Large Language Models via Mixed-Precision Quantization-Aware Distillation

EdgeRazor: 一种通过混合精度量化感知蒸馏实现大语言模型轻量化的框架

Shu-Hao Zhang, Le-Tong Huang, Xiang-Sheng Deng, Xin-Yi Zou, Chen Wu, Nan Li, Shao-Qun Zhang, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Microsoft AI(微软AI)

AI总结 本文提出EdgeRazor框架,通过混合精度量化感知蒸馏方法,在资源受限设备上部署大语言模型,实现了更高的压缩比和更高效的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05536 2026-05-22 cs.LG cs.AI cs.CL cs.CV

When Shared Knowledge Hurts: Spectral Over-Accumulation in Model Merging

当共享知识有害:模型融合中的谱过积累

Yayuan Li, Ze Peng, Jian Zhang, Jintao Guo, Yue Duan, Yinghuan Shi

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China.(新型软件技术国家重点实验室,南京大学,南京210023,中国。) Institute of Brain-Computer Interface, Nanjing University, Nanjing 210023, China.(脑机接口研究院,南京大学,南京210023,中国。)

AI总结 本文研究了模型融合中共享知识过积累的问题,提出SVC方法通过校准奇异值来恢复谱平衡,提升了模型融合和任务算术的性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23224 2026-05-22 cs.CV

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3:长视频多跳推理的原生交错线索搜索

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本研究提出Video-o3框架,通过迭代发现显著视觉线索、细粒度检查关键片段以及适应性终止,提升长视频多跳推理能力,实验表明其在MLVU和Video-Holmes上分别达到72.1%和46.5%的准确率。

Comments 27 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07603 2026-05-22 cs.CV

UIKA: Fast Universal Head Avatar from Pose-Free Images

UIKA:从无姿态图像快速生成通用头身模型

Zijian Wu, Boyao Zhou, Liangxiao Hu, Hongyu Liu, Yuan Sun, Xuan Wang, Xun Cao, Yujun Shen, Hao Zhu

机构 * Nanjing University(南京大学) Ant Group(蚂蚁集团) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出UIKA,一种从任意数量的无姿态输入(包括单张图像、多视角捕捉和手机拍摄视频)生成可动画的高斯头身模型。与传统头身模型不同,UIKA通过模型表示、网络设计和数据准备重新思考任务,引入了UV引导的头身建模策略,设计了可学习的UV标记,并通过聚合所有输入视角的UV信息解码为标准高斯属性。

Comments CVPR 2026 Highlight. Code: https://github.com/ant-research/UIKA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22041 2026-05-22 cs.CR cs.LG

RADAR: Defending RAG Dynamically against Retrieval Corruption

RADAR: 通过动态防御对抗RAG的检索腐败

Ziyuan Chen, Yueming Lyu, Yi Liu, Weixiang Han, Jing Dong, Caifeng Shan, Tieniu Tan

机构 * School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院,中国,苏州) City University of Hong Kong, Hong Kong, China(香港城市大学,中国,香港) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国)

AI总结 RADAR通过将可靠的上下文选择建模为图基能最小化问题,利用最大流最小割算法进行精确求解,采用贝叶斯记忆节点递归更新信念状态,以平衡稳定性和对抗性攻击,同时适应真实知识变化,在动态数据集上实现了比基线方法更优越的鲁棒性和响应质量,且存储开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22012 2026-05-22 cs.CL cs.CV

LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning

LatentOmni: 通过统一的音频-视觉潜在推理重新思考多模态理解

Yifan Dai, Zhenhua Wu, Bohan Zeng, Daili Hua, Jialing Liu, Bozhou Li, Yuran Wang, Chengzhuo Tong, Hao Liang, Xiaochen Ma, Junbo Niu, Tianyu Guo, Yang Shi, Yue Ding, Yiyan Ji, Bingyin Mei, Yushuo Guan, Yuanxing Zhang, Pengfei Wan, Fangcheng Fu, Wentao Zhang

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) HKUST(香港科技大学) CASIA(中国科学院自动化研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

AI总结 本文提出LatentOmni框架,通过统一的音频-视觉潜在空间进行多模态推理,利用特征级监督和Omni-Sync Position Embedding保持时间一致性,从而在多个音频-视觉推理基准测试中取得最佳性能。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01851 2026-05-22 cs.CV

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12138 2026-05-22 cs.SE cs.AI

Exploring Code Analysis: Zero-Shot Insights on Syntax and Semantics with LLMs

探索代码分析:利用大语言模型进行语法和语义的零样本洞察

Wei Ma, Zhihao Lin, Shangqing Liu, Qiang Hu, Ye Liu, Wenhan Wang, Cen Zhang, Liming Nie, Li Li, Yang Liu, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Blekinge Institute of Technology(布莱金厄学院) Beihang University(北航) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文研究了大语言模型在代码分析中的应用,通过评估21种最先进的LLM在四种语言中的九项任务,揭示了LLM在语法解析、静态语义推断和动态推理方面的性能,发现其在跨语言泛化方面有优势,但动态推理仍有限,提出了一个经过验证的评估框架。

Comments Accepted at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17472 2026-05-21 cs.CV

Weighted Reverse Convolution for Feature Upsampling

加权反卷积用于特征上采样

Wentong Li, Zhiyuan Qi, Zichen Zhao, Kai Zhang, Lei Zhang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学)

AI总结 本文提出加权反卷积(WRC),从逆问题的角度重新审视视觉基础模型中的特征上采样,通过空间自适应的逆操作提升高层视觉描述符的密度,从而在需要细粒度定位、密集预测和点对应的任务中提升性能。

Comments 18 pages, 7 figures, code:https://github.com/PolyU-VCLab/WRC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12334 2026-05-21 cs.AI

Reinforcing VLAs in Task-Agnostic World Models

在任务无关的世界模型中强化视觉-语言-动作

Yucen Wang, Rui Yu, Fengming Zhang, Junjie Lu, Xinyao Qin, Tianxiang Zhang, Kaixin Wang, Li Zhao

机构 * Microsoft Research Asia(微软亚洲研究院) Nanjing University(南京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学) University of Technology Sydney(悉尼科技大学) Tsinghua University(清华大学)

AI总结 本文提出RAW-Dream方法,通过分离世界模型学习与下游任务依赖,利用预训练的世界模型和现成的视觉-语言模型,实现零样本推理,从而在无需任务特定数据的情况下提高VLA适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01712 2026-05-21 cs.AI cs.LG

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23538 2026-05-21 cs.AI cs.CL cs.CV cs.SE

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

JanusCoder: 向代码智能的视觉-程序化界面迈进

Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。

Comments ICLR 2026 Camera Ready Version, with code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏