arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2601.06559 2026-04-17 cs.CV

ArrowGEV: Grounding Events in Video via Learning the Arrow of Time

ArrowGEV:通过学习时间之箭来视频中接地事件

Fangxu Yu, Ziyao Lu, Liqiang Niu, Fandong Meng, Jie Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院,中国)

AI总结 本文提出ArrowGEV框架,通过学习时间方向性提升视频中事件接地与时间理解能力,通过区分时间敏感和时间不敏感事件增强模型鲁棒性与泛化能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15066 2026-04-17 cs.LG cs.AI cs.MM

Time-RA: Towards Time Series Reasoning for Anomaly Diagnosis with LLM Feedback

Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈

Yiyuan Yang, Zichuan Liu, Lei Song, Kai Ying, Zhiguang Wang, Tom Bamford, Svitlana Vyetrenko, Jiang Bian, Qingsong Wen

机构 * University of Oxford(牛津大学) Nanjing University(南京大学) MSRA(微软研究院) SJTU(上海交通大学) Abel AI Outsampler University of Strasbourg(斯特拉斯堡大学) Squirrel Ai Learning(Squirrel AI学习)

AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。

Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14563 2026-04-17 cs.CV

Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors

重新审视令牌压缩以加速基于ViT的稀疏多视角3D目标检测器

Mingqian Ji, Shanshan Zhang, Jian Yang

机构 * PCA Lab, School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学PCA实验室) PCA Lab, School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学PCA实验室)

AI总结 本文提出SEPatch3D框架,通过动态调整拼接块大小和改进特征增强方法,提升基于ViT的稀疏多视角3D目标检测器的推理速度和效率,实验显示其比基线模型快57%且比当前最优方法更高效。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14541 2026-04-17 cs.CV

Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars

赋予面孔情感:面向单图像3D头像的显式情绪控制

Yicheng Gong, Jiawei Zhang, Liqiang Liu, Yanwen Wang, Lei Chu, Jiahao Li, Hao Pan, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文提出一种显式情绪控制框架,通过双路径调节机制在不修改核心设计的情况下,将情绪作为独立控制信号注入单图像3D头像重建中,实现情绪与身份的解耦和可控情绪转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03686 2026-04-17 cs.AI

AI4S-SDS: A Neuro-Symbolic Solvent Design System via Sparse MCTS and Differentiable Physics Alignment

AI4S-SDS: 一种基于稀疏MCTS和可微物理对齐的神经符号溶剂设计系统

Jiangyu Chen

机构 * State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University(南京大学计算机科学学院) Suzhou Laboratory(苏州实验室)

AI总结 本文提出AI4S-SDS系统,通过稀疏MCTS和可微物理对齐,解决化学配方设计中的高维组合空间问题,提升探索多样性并实现物理约束下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13994 2026-04-16 cs.CV

Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework

遥感图像超分辨率中的不平衡纹理处理:一种纹理感知扩散框架

Enzhuo Zhang, Sijie Zhao, Dilxat Muhtar, Zhenshi Li, Xueliang Zhang, Pengfeng Xiao

机构 * Nanjing University(南京大学)

AI总结 本文提出TexADiff框架,通过估计相对纹理密度图来解决遥感图像中纹理不平衡问题,改进模型的空间感知能力,提升超分辨率的定量和定性性能。

Comments 10 pages, 5 figures, 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11641 2026-04-16 cs.SE cs.AI

CodeTracer: Towards Traceable Agent States

CodeTracer:迈向可追溯的代理状态

Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, CAS(中国科学院自动化研究所) University College London(伦敦大学学院) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

AI总结 CodeTracer通过解析异构运行 artifacts,重建状态转换历史,并定位故障起始点,提升代理调试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06433 2026-04-16 cs.CL cs.AI cs.LG cs.MA

Memp: Exploring Agent Procedural Memory

Memp:探索代理程序记忆

Runnan Fang, Yuan Liang, Xiaobin Wang, Jialong Wu, Shuofei Qiao, Pengjun Xie, Fei Huang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) State Key Lab. for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

AI总结 本文提出Memp,一种可学习、可更新且终身的程序记忆系统,通过提炼历史轨迹生成细粒度指令和高层脚本抽象,提升代理在TravelPlanner和ALFWorld任务中的成功率和效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13654 2026-04-16 cs.RO

Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap

面向无人机的视觉与语言导航:进展、挑战与研究路线图

Hanxuan Chen, Jie Zheng, Siqi Yang, Tianle Zeng, Siwei Feng, Songsheng Cheng, Ruilong Ren, Hanzhong Guo, Shuai Yuan, Xiangyue Wang, Kangli Wang, Ji Pei

机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)

AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13565 2026-04-16 cs.CV cs.AI

UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing

UHR-BAT:面向超高清遥感的预算感知视觉-语言模型

Yunkai Dang, Minxin Dai, Yuekun Yang, Zhangnan Li, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(南京大学人工智能科学与技术学院) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) School of Physics, Nanjing University(南京大学物理学院)

AI总结 本文提出UHR-BAT模型,通过文本引导的多尺度重要性估计和区域保留合并策略,实现高效视觉token压缩,在严格预算下提升超高清遥感图像信息提取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11064 2026-04-16 cs.LG cs.CV

A Faster Path to Continual Learning

连续学习的更快路径

Wei Li, Hangjie Yuan, Zixiang Zhao, Borui Kang, Ziwei Liu, Tao Feng

机构 * College of Computer Science, Sichuan University, China(四川大学计算机学院) College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) Photogrammetry and Remote Sensing Lab, ETH Zürich, Switzerland(苏黎世联邦理工学院摄影测量与遥感实验室) School of Computer Science, Nanjing University, China(南京大学计算机科学系) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系)

AI总结 本文提出C-Flat Turbo,通过优化梯度计算减少连续学习的训练成本,提升效率并保持性能。

Comments Update Author Affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-04-15 cs.CV

DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments 27 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14004 2026-04-15 cs.CL

Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models

定位、引导与改进:大型语言模型中可操作机制可解释性的一项实用调查

Hengyuan Zhang, Zhihao Zhang, Mingyang Wang, Zunhai Su, Yiwei Wang, Qianli Wang, Shuzhou Yuan, Ercong Nie, Xufeng Duan, Feijiang Han, Qibo Xue, Zeping Yu, Chenming Shang, Xiao Liang, Jing Xiong, Hui Shen, Chaofan Tao, Zhengwu Liu, Senjie Jin, Zhiheng Xi, Dongdong Zhang, Sophia Ananiadou, Tao Gui, Ruobing Xie, Hayden Kwok-Hay So, Hinrich Schütze, Xuanjing Huang, Qi Zhang, Ngai Wong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) Technische Universität Darmstadt(达姆施塔特技术大学) Technische Universität Berlin(柏林技术大学) Technische Universität Dresden(德累斯顿技术大学) The Chinese University of Hong Kong(香港中文大学) University of Pennsylvania(宾夕法尼亚大学) Nanjing University(南京大学) University of Manchester(曼彻斯特大学) Dartmouth College(达特茅斯学院) University of California Los Angeles(加州大学洛杉矶分校) University of Michigan(密歇根大学) Microsoft(微软) Tencent(腾讯)

AI总结 本文提出一个实用调查,围绕'定位、引导与改进'流程,系统分类定位和引导方法,展示如何通过该框架提升模型对齐、能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10471 2026-04-15 cond-mat.mtrl-sci cs.AI

Siamese Foundation Models for Crystal Structure Prediction

孪生基础模型用于晶体结构预测

Liming Wu, Wenbing Huang, Rui Jiao, Jianxing Huang, Liwei Liu, Yipeng Zhou, Hao Sun, Yang Liu, Fuchun Sun, Yuxiang Ren, Jirong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) Advanced Computing and Storage Lab, Huawei Technologies(华为技术有限公司先进计算与存储实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心)

AI总结 本文提出Diffusion-based Crystal Omni框架,结合孪生生成模型和能量预测模型,提升晶体结构预测性能,并在实际超导材料中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11786 2026-04-14 cs.AI cs.MA

GenTac: Generative Modeling and Forecasting of Soccer Tactics

GenTac:生成式足球战术建模与预测

Jiayuan Rao, Tianlin Gui, Haoning Wu, Yanfeng Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学)

AI总结 GenTac通过生成式框架建模足球战术的随机过程,实现长周期轨迹预测,支持多因素条件模拟,展现高精度战术生成与未来战术预测能力。

Comments 40 pages, 5 figures; technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11749 2026-04-14 cs.CL

HistLens: Mapping Idea Change across Concepts and Corpora

HistLens:跨概念和语料库的思想变化映射

Yi Jing, Weiyun Qiu, Yihang Peng, Zhifang Sui

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of History, Nanjing University, China(南京大学历史学院) Department of Chinese Language and Literature, Tsinghua University, China(清华大学中国语言文学系) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, China(北京大学计算机学院多媒体信息处理国家重点实验室)

AI总结 HistLens提出一种基于SAE的统一框架,用于多概念、多语料库的概念史分析,通过分解概念表示并追踪其激活动态,实现跨概念和语料库的思想演变模式计算。

Comments Accepted by ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10739 2026-04-14 cs.AI

When More Thinking Hurts: Overthinking in LLM Test-Time Compute Scaling

更多思考反而有害:在LLM测试时间计算扩展中的过度思考

Shu Zhou, Rui Ling, Junan Chen, Xin Wang, Tao Fan, Hao Wang

机构 * Nanjing University(南京大学) Baidu(百度) Nanjing University of Finance & Economics(南京财经大学)

AI总结 研究探讨了在LLM测试时间计算扩展中,增加推理token的边际效用随计算预算增加而下降的现象,发现模型存在过度思考问题,且最优思考长度因问题难度而异。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10619 2026-04-14 cs.CV

How to Design a Compact High-Throughput Video Camera?

如何设计一款紧凑型高吞吐量视频相机?

Chenxi Qiu, Tao Yue, Xuemei Hu

机构 * Nanjing University(南京大学)

AI总结 本文提出基于梯度相机的低比特方案,解决高吞吐量视频成像的读出与传输瓶颈,并通过多尺度重建CNN实现高分辨率图像重建。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01692 2026-04-14 cs.LG cs.AI

Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search

推理作为梯度:超越树搜索的MLE代理扩展

Yifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Mingrui Xu, Weiqing Liu, Jiang Bian

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。

Comments 36 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14072 2026-04-14 cs.CL cs.PL

The Master-Slave Encoder Model for Improving Patent Text Summarization: A New Approach to Combining Specifications and Claims

主从编码器模型用于改进专利文本摘要:一种结合规范和权利要求的新方法

Shu Zhou, Xin Wang, Zhengda Zhou, Haohan Yi, Xuhui Zheng, Hao Wan

机构 * School of Information Management, Nanjing University(南京大学信息管理学院) Key Laboratory of Data Engineering and Knowledge Services in Jiangsu Provincial Universities, Nanjing University(江苏省高校数据工程与知识服务重点实验室(南京大学)) Baidu, Inc.(百度公司)

AI总结 本文提出主从编码器模型(MSEA)以提升专利文本摘要质量,通过结合专利文本指令与权利要求,增强新术语处理及信息冗余控制,实验显示其在ROUGE指标上优于现有模型。

Comments 25pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09712 2026-04-14 cs.CV cs.AI

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09276 2026-04-13 cs.LG

Distributed Online Convex Optimization with Compressed Communication: Optimal Regret and Applications

分布式在线凸优化与压缩通信:最优懊悔与应用

Sifan Yang, Dan-Yue Li, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文研究了在压缩通信下分布式在线凸优化问题,提出最优算法,解决了压缩误差与投影误差之间的耦合问题,并在非光滑优化中提供了首次保证。

详情

展开后加载摘要…

URL PDF HTML 收藏