arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2601.04895 2026-01-09 cs.AI

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05988 2026-01-09 cs.LG cs.SE

Pruning the Unsurprising: Efficient LLM Reasoning via First-Token Surprisal

剪除无意义的:通过首词意外度实现高效的LLM推理

Wenhao Zeng, Yaoning Wang, Chao Hu, Yuling Shi, Chengcheng Wan, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) East China Normal University(华东师范大学) Chongqing University(重庆大学)

AI总结 本文提出ASAP方法,通过锚点引导和首词意外度度量实现高效的CoT压缩,提升推理效率并降低训练成本。

Comments Code and model available at https://github.com/Zengwh02/ASAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04404 2026-01-09 cs.CV cs.AI

3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation

3D-Agent:三模态多智能体协作用于可扩展的3D物体标注

Jusheng Zhang, Yijia Fan, Zimo Wen, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Snap Inc.(Snap公司)

AI总结 Tri MARF通过三模态多智能体协作提升大规模3D物体标注效率与精度

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04282 2026-01-09 cs.LG

LEGATO: Good Identity Unlearning Is Continuous

LEGATO: 优良的身份遗忘是连续的

Qiang Chen, Chun-Wun Cheng, Xiu Su, Hongyan Xu, Xi Lin, Shan You, Angelica I. Aviles-Rivero, Yi Chen

机构 * HKUST(香港科技大学) University of Cambridge(剑桥大学) Central South University(中南大学) Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

AI总结 LEGATO通过连续轨迹建模实现生成模型的身份遗忘,采用轻量级神经ODE适配器实现可控且稳定的遗忘过程,避免灾难性崩溃并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03508 2026-01-09 cs.CL

One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework

一战接一战:通过一个演进框架探测LLMs在多轮指令遵循中的极限

Qi Jia, Ye Shen, Xiujie Song, Kaiwei Zhang, Shibo Wang, Dun Pei, Xiangyang Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Jilin University(吉林大学)

AI总结 本文提出EvolIF演进框架,通过多轮对话测试LLMs的指令遵循能力,揭示失败恢复和细粒度指令遵循的不足,GPT-5在鲁棒性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21830 2026-01-09 cs.LG cs.AI

GAPO: Robust Advantage Estimation for Real-World Code LLMs

GAPO:面向现实世界代码LLM的鲁棒优势估计

Jianqing Zhang, Zhezheng Hao, Wei Xia, Hande Dong, Hong Wang, Chenxing Wei, Yuyan Zhou, Yubin Qi, Qiang Lin, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Zhejiang University(浙江大学) Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 GAPO通过自适应Q机制提升代码编辑LLM的鲁棒性,实现领域内和领域外精确匹配的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03296 2026-01-09 cs.CL cs.LG

Towards Trustworthy Multimodal Moderation via Policy-Aligned Reasoning and Hierarchical Labeling

通过政策对齐推理和分层标注实现可信的多模态审核

Anqi Li, Wenwei Jin, Jintao Tong, Pengda Qin, Weijia Li, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Huazhong University of Science and Technology(华中科技大学)

AI总结 Hi-Guard通过政策对齐推理和分层标注提升多模态审核的准确性、泛化性和可解释性。

Comments Accepted by KDD 2026. Code is available at https://github.com/lianqi1008/Hi-Guard

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12225 2026-01-09 cs.LG cs.AI cs.CL stat.ML

Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling

从LLM隐藏状态中挖掘内在奖励以实现高效的Best-of-N采样

Jizhou Guo, Zhaomin Wu, Hanchen Yang, Philip S. Yu

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) National University of Singapore(新加坡国立大学) Tongji University(同济大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 SWIFT通过从LLM隐藏状态中挖掘内在奖励,实现高效Best-of-N采样,提升模型性能并减少计算成本。

Comments Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-01-08 cs.CV cs.CL

PM4Bench: Benchmarking Large Vision-Language Models with Parallel Multilingual Multi-Modal Multi-task Corpus

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Songyang Zhang, Weijia Li, Bin Wang, Dahua Lin, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Equal contribution: Junyuan Gao, Jiahe Song, Jiang Wu; Corresponding author: Conghui He

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03513 2026-01-08 cs.SE cs.AI

Deploy-Master: Automating the Deployment of 50,000+ Agent-Ready Scientific Tools in One Day

Deploy-Master:在一天内自动化部署50,000多个准备就绪的科学工具

Yi Wang, Zhenting Huang, Zhaohan Ding, Ruoxue Liao, Yuan Huang, Xinzijian Liu, Jiajun Xie, Siheng Chen, Linfeng Zhang

机构 * DP Technology Beijing China(DP技术北京中国) AI for Science Institute Beijing China(AI for Science研究院北京中国) Shanghai Jiao Tong University Shanghai China(上海交通大学上海中国)

AI总结 Deploy-Master通过自动化部署50,000多个科学工具,提升AI4S和代理工作流的可重复性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18795 2026-01-08 cs.CV

ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder

通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP

Xiaoxing Hu, Kaicheng Yang, Ziyang Gong, Qi Ming, Zonghao Guo, Yu Tian, Xiang An, Ziyong Feng, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) DeepGlint(深图科技) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。

Comments 17 pages, 5 fiugres

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14803 2026-01-08 cs.CY cs.AI

OnlineMate: An LLM-Based Multi-Agent Companion System for Cognitive Support in Online Learning

OnlineMate: 基于大语言模型的多智能体伴侣系统用于在线学习中的认知支持

Xian Gao, Zongyun Zhang, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 OnlineMate通过基于LLM的多智能体系统,结合理论思维,为在线学习提供个性化认知支持,提升学习深度与情感参与。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05281 2026-01-08 cs.SE cs.CL

CoreCodeBench: Decoupling Code Intelligence via Fine-Grained Repository-Level Tasks

CoreCodeBench:通过细粒度仓库级任务解耦代码智能

Lingyue Fu, Hao Guan, Bolun Zhang, Haowei Yuan, Yaoming Zhu, Jun Xu, Zongyu Wang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

AI总结 CoreCodeBench通过细粒度仓库级任务解耦编码能力,揭示LLM在编程任务中的非单一性,提供更精确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07770 2026-01-08 eess.SP cs.LG

Channel Estimation for RIS-Assisted mmWave Systems via Diffusion Models

通过扩散模型实现RIS辅助毫米波系统的信道估计

Yang Wang, Yin Xu, Cixiao Zhang, Zhiyong Chen, Mingzeng Dai, Haiming Wang, Bingchao Liu, Dazhi He, Meixia Tao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中研网创新中心) Lenovo Group, Lenovo Research(联想集团,联想研究)

AI总结 本文提出基于扩散模型的RIS辅助毫米波系统信道估计方法,通过改进的DDIMs采样算法和轻量级BRCNet网络,实现更高效的信道估计性能。

Comments 5 pages, 3 figures

Journal ref IEEE Communications Letters, vol.30, pp.597-601, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03747 2026-01-08 cs.LG cs.CL stat.AP

Context-Alignment: Activating and Enhancing LLM Capabilities in Time Series

上下文对齐:在时间序列中激活和增强大语言模型的能力

Yuxiao Hu, Qian Li, Dongxiao Zhang, Jinyue Yan, Yuntian Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出上下文对齐方法,通过多模态输入和图神经网络增强LLMs在时间序列任务中的能力,提升逻辑和结构理解,提高预测性能。

Comments This paper has been accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03011 2026-01-07 cs.CV cs.MA

ReCCur: A Recursive Corner-Case Curation Framework for Robust Vision-Language Understanding in Open and Edge Scenarios

ReCCur:一种递归角落案例校准框架,用于开放和边缘场景中的鲁棒视觉-语言理解

Yihan Wei, Shenghai Yuan, Tianchen Deng, Boyang Lou, Enwen Hu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 ReCCur通过递归框架实现低计算量的角落案例校准,提升开放和边缘场景下的视觉-语言理解鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22461 2026-01-07 cs.SD cs.AI cs.CL eess.AS

CMDAR: A Chinese Multi-scene Dynamic Audio Reasoning Benchmark with Diverse Challenges

CMDAR:一个包含多样挑战的中文多场景动态音频推理基准

Hui Li, Changhao Jiang, Hongyu Wang, Ming Zhang, Jiajun Sun, Zhixiong Yang, Yifei Cao, Shihan Dou, Xiaoran Fan, Baoyu Fan, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) IEIT Systems Co Ltd(IEIT系统有限公司)

AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02777 2026-01-07 cs.RO

M-SEVIQ: A Multi-band Stereo Event Visual-Inertial Quadruped-based Dataset for Perception under Rapid Motion and Challenging Illumination

M-SEVIQ:一种多波段立体事件视觉-惯性四足机器人数据集,用于快速运动和恶劣光照下的感知

Jingcheng Cao, Chaoran Xiong, Jianmin Song, Shang Yan, Jiachen Liu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation & Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学) Beijing Aerospace Microsystem and Information Technology Research Institute(北京航天微系统与信息技术研究所)

AI总结 M-SEVIQ是一种多波段立体事件视觉-惯性四足机器人数据集,用于快速运动和恶劣光照下的感知研究。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02384 2026-01-07 cs.CV

RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning

RxnCaption:将反应图解析重新表述为视觉提示引导的描述生成

Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Peking University(北京大学) South China Normal University(华南师范大学) Northwestern Polytechnical University(西北工业大学)

AI总结 RxnCaption通过将反应图解析转化为视觉提示引导的描述生成任务,提升化学反应数据的机器可读性,并构建大规模数据集推动AI在化学领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09111 2026-01-07 cs.CV

DenseSplat: Densifying Gaussian Splatting SLAM with Neural Radiance Prior

DenseSplat: 基于神经辐射先验的高密度高斯喷射SLAM

Mingrui Li, Shuhong Liu, Tianchen Deng, Hongyu Wang

机构 * Department of Computer Science, Dalian University of Technology(大连理工大学计算机科学系) Department of Mechano-informatics, Information Science and Technology, The University of Tokyo(东京大学机械信息学系、信息科学与技术系) Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University(上海交通大学医学机器人研究所、自动化系) Key Laboratory of System Control and Information Processing, Ministry of Education(教育部系统控制与信息处理重点实验室)

AI总结 DenseSplat结合NeRF和3DGS优势,通过稀疏关键帧和神经辐射先验实现高密度SLAM,提升地图完整性和跟踪精度。

Comments IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02281 2026-01-06 cs.CV

InfiniteVGGT: Visual Geometry Grounded Transformer for Endless Streams

InfiniteVGGT:面向无限流的视觉几何Transformer

Shuai Yuan, Yantai Yang, Xiaotian Yang, Xupeng Zhang, Zhonghao Zhao, Lingming Zhang, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学)

AI总结 InfiniteVGGT通过滚动内存机制实现无限流式处理,提升长期稳定性并引入Long3D基准验证连续3D几何估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02102 2026-01-06 cs.CV

360-GeoGS: Geometrically Consistent Feed-Forward 3D Gaussian Splatting Reconstruction for 360 Images

360-GeoGS:用于360图像的几何一致前馈3D高斯点溅重建

Jiaqi Yao, Zhongmiao Yan, Jingyi Xu, Songpengcheng Xia, Yan Xiang, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services(上海导航与基于位置的服务关键实验室) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Submarine Geoscience(海底地球科学国家重点实验室) School of Automation and Intelligent Sensing(自动化与智能感知学院)

AI总结 本文提出了一种用于360图像的前馈3DGS框架,通过深度-法线几何正则化提升几何一致性,实现高质量的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21027 2026-01-06 cs.GT cs.AI cs.LG cs.MA

Fusion-PSRO: Nash Policy Fusion for Policy Space Response Oracles

融合-PSRO:用于策略空间响应预言机的纳什策略融合

Jiesong Lian, Yucong Huang, Chengdong Ma, Mingzhi Wang, Ying Wen, Long Hu, Yixue Hao

机构 * Huazhong University of Science \& Technology, Wuhan, China School of Software Microelectronics, Peking University, Beijing, China Institute for Artificial Intelligence, Peking University, Beijing, China Shanghai Jiao Tong University, Shanghai, China Guangdong HUST Industrial Technology Research Institute

AI总结 Fusion-PSRO通过纳什策略融合改进策略初始化,提升零和博弈中策略空间响应预言机的性能。

Comments Accepted by ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 (2025) 2562-2569

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01475 2026-01-06 cs.LG

Multi-Subspace Multi-Modal Modeling for Diffusion Models: Estimation, Convergence and Mixture of Experts

多子空间多模态建模用于扩散模型:估计、收敛与专家混合

Ruofeng Yang, Yongcan Li, Bo Jiang, Cheng Chen, Shuai Li

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学)

AI总结 本文提出基于多子空间多模态建模的扩散模型,通过引入低秩混合高斯混合结构,有效捕捉多模态信息并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01416 2026-01-06 cs.CV

AirSpatialBot: A Spatially-Aware Aerial Agent for Fine-Grained Vehicle Attribute Recognization and Retrieval

AirSpatialBot: 一种空间感知的空中智能体用于细粒度车辆属性识别与检索

Yue Zhou, Ran Ding, Xue Yang, Xue Jiang, Xingzhao Liu

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(电子工程系,上海交通大学) Department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学)

AI总结 AirSpatialBot通过空间感知的VLM和两阶段训练策略,实现细粒度车辆属性识别与检索,解决遥感图像中的空间理解难题。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01015 2026-01-06 cs.CL cs.DB

HyperJoin: LLM-augmented Hypergraph Link Prediction for Joinable Table Discovery

HyperJoin: 基于大语言模型的超图链接预测用于可连接表发现

Shiyuan Liu, Jianwei Wang, Xuemin Lin, Lu Qin, Wenjie Zhang, Ying Zhang

机构 * University of Technology Sydney(悉尼科技大学) University of New South Wales(新南威尔士大学) ACEM, Shanghai Jiao Tong University(ACEM,上海交通大学)

AI总结 HyperJoin通过构建超图并利用大语言模型增强的超图链接预测,提升可连接表发现的精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00998 2026-01-06 cs.CV

DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models

DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准

Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li

机构 * Hinton STAI Institute(Hinton STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Information Engineering University(信息工程大学)

AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23650 2026-01-06 cs.RO

Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control

你有即兴能力吗?通过音频控制实现 expressive 人形 locomotion

Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang

机构 * BAAI(北京人工智能研究院) University of Sydney(悉尼大学) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 RoboPerform 是首个通过音频直接生成音乐舞蹈和语音手势的人形运动框架,实现了低延迟、高保真的即兴运动表现。

详情

展开后加载摘要…

URL PDF HTML 收藏