arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3172
2602.22716 2026-02-27 cs.CV cs.AI

SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs

SoPE: 基于球坐标的位置嵌入:增强3D大视觉-语言模型的空间感知

Guanting Ye, Qiyan Zhao, Wenhao Yu, Liangyu Yuan, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen

机构 * University of Macau(澳门大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

AI总结 SoPE通过基于球坐标的位置嵌入提升3D LVLMs的空间感知能力,结合多尺度频率混合策略,增强几何表示的一致性和表达性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01749 2026-02-27 cs.AI cs.LG

Controlling Exploration-Exploitation in GFlowNets via Markov Chain Perspectives

通过马尔可夫链视角控制GFlowNets中的探索-利用

Lin Chen, Samuel Drapeau, Fanghao Shao, Xuekai Zhu, Bo Xue, Yunchong Song, Mathieu Laurière, Zhouhan Lin

机构 * LUMIA Lab, School of Artificial Intelligence, SJTU(LUMIA实验室,人工智能学院,上海交通大学) School of Mathematical Sciences, SJTU(数学科学学院,上海交通大学) Shanghai Advanced Institute of Finance, SJTU(上海先进金融研究院,上海交通大学) School of Computer Science, SJTU(计算机科学学院,上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Center for Data Science, NYU Shanghai(上海数据科学中心,纽约大学上海学院) NYU-ECNU Institute of Mathematical Sciences, NYU Shanghai(纽约大学-华东师范大学数学科学研究院,纽约大学上海学院)

AI总结 通过引入可调参数$α$,$α$-GFNs改进了GFlowNets的探索-利用平衡,提升了模式发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00564 2026-02-27 cs.AI cs.CL

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

揭示推理过程:一种评估大语言模型结构性数学推理的过程感知基准

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang, Yuetian Du, Guojie Lin, Yaxuan Wang, Xiaoxiao Xu, Yanhu Mo, Xuan Ren, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出ReasoningMath-Plus基准,通过过程感知评估方法揭示大语言模型在结构性数学推理中的不足,引入HCRS评分函数和过程奖励模型,发现仅答案指标可能高估推理能力。

Comments 8 pages, and 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04228 2026-02-27 cs.CV cs.AI cs.LG cs.MM

LayerT2V: A Unified Multi-Layer Video Generation Framework

LayerT2V: 一个统一的多层视频生成框架

Guangzhao Li, Kangrui Cen, Baixuan Zhao, Yi Xin, Siqi Luo, Guangtao Zhai, Lei Zhang, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。

Comments Project Page is https://layert2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22538 2026-02-27 cs.LG cs.CL

RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format

RAIN-Merging: 一种无梯度方法,用于在保持推理格式的前提下提升大推理模型的指令遵循能力

Zhehao Huang, Yuhang Liu, Baijiong Lin, Yixin Lou, Zhengbao He, Hanling Tian, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recoginition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理国家重点实验室(上海))

AI总结 RAIN-Merging通过无梯度方法提升大推理模型的指令遵循能力,同时保持推理格式和性能。

Comments 41 pages, ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15340 2026-02-27 cs.CV

Towards Seamless Interaction: Causal Turn-Level Modeling of Interactive 3D Conversational Head Dynamics

迈向无缝交互:交互式3D对话头部动力学的因果回合级建模

Junjie Chen, Fei Wang, Zhihao Huang, Qing Zhou, Kun Li, Dan Guo, Linfeng Zhang, Xun Yang

机构 * HFUT(合肥工业大学) IAI, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) USTC(中国科学技术大学) SJTU(上海交通大学) TeleAI, China Telecom(TeleAI,中国电信) NWPU(西北工业大学) UAEU(阿联酋大学) AHPU(安徽大学)

AI总结 TIMAR通过因果回合级建模,实现了交互式3D对话头部动态的高效生成,提升了对话的表达性和时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21967 2026-02-26 cs.RO cs.CV

Dream-SLAM: Dreaming the Unseen for Active SLAM in Dynamic Environments

Dream-SLAM: 为动态环境中的主动SLAM梦见未见

Xiangqi Meng, Pengxu Hou, Zhenjun Zhao, Javier Civera, Daniel Cremers, Hesheng Wang, Haoang Li

机构 * Thrust of Robotics and Autonomous Systems, Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究所,香港科学与技术大学(广州)) University of Zaragoza(阿拉瓦大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Automation and IntelligentSensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

AI总结 Dream-SLAM通过跨时空图像与语义结构的融合,提升动态环境中主动SLAM的定位精度和探索效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21951 2026-02-26 cs.CL

RADAR: Reasoning as Discrimination with Aligned Representations for LLM-based Knowledge Graph Reasoning

RADAR: 以对齐表示进行基于大语言模型的知识图谱推理的推理

Bo Xue, Yuan Jin, Luoyi Fu, Jiaxin Ding, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 RADAR通过判别性关系推理提升知识图谱推理的鲁棒性和泛化能力,实现比LLM基线更高的链接预测和三元组分类精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21926 2026-02-26 cs.SI cs.DL cs.LG physics.soc-ph

Bridging Through Absence: How Comeback Researchers Bridge Knowledge Gaps Through Structural Re-emergence

弥补缺失:回流研究者如何通过结构性重新出现填补知识缺口

Somyajit Chakraborty, Angshuman Jana, Avijit Gayen

机构 * University College Cork(都柏林大学学院) Shanghai Jiao Tong University(上海交通大学) Indian Institute of Information Technology(印度信息科技大学) Techno India University(Techno India大学)

AI总结 本研究通过分析回流研究者的结构性和语义行为,揭示其在跨学科知识转移中的作用,并开发出基于桥梁得分和熵度量的预测模型,实现对回流研究者的早期识别和机构支持。

Comments Preprint; 25 pages, 14 figures, 7 tables, Submitted to Scientometrics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01552 2026-02-26 cs.CV

Variation-aware Vision Token Dropping for Faster Large Vision-Language Models

面向变化的视觉令牌丢弃以加速更大的视觉-语言模型

Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen

机构 * Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Zhejiang University(浙江大学)

AI总结 本文提出V²Drop方法,通过动态令牌变化机制在LVLM推理中减少令牌数量,提升计算效率,同时保持任务性能。

Comments Accepted by CVPR 2026. Code is available at \url{https://github.com/xuyang-liu16/V2Drop}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19610 2026-02-26 cs.CV

JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models

JailBound: 视觉语言模型内部安全边界的劫持

Jiaxin Song, Yixu Wang, Jie Li, Rui Yu, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Xuan Tong(宣通) NSFOCUS

AI总结 JailBound通过在视觉语言模型的潜在空间中探索安全边界,提出了一种新的劫持框架,有效提升了白盒和黑盒攻击成功率,揭示了模型的安全风险。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21662 2026-02-26 cs.CV

HybridINR-PCGC: Hybrid Lossless Point Cloud Geometry Compression Bridging Pretrained Model and Implicit Neural Representation

HybridINR-PCGC: 一种融合预训练模型与隐式神经表示的无损点云几何压缩框架

Wenjie Huang, Qi Yang, Shuting Xia, He Huang, Zhu Li, Yiling Xu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Missouri-Kansas City(密苏里大学-堪萨斯城分校)

AI总结 HybridINR-PCGC通过融合预训练模型与隐式神经表示,实现高效无损点云压缩,提升压缩率和编码效率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00981 2026-02-26 cs.SD

FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates

FlexiCodec: 一种用于低帧率的动态神经音频编解码器

Jiaqi Li, Yao Qian, Yuxuan Hu, Leying Zhang, Xiaofei Wang, Heng Lu, Manthan Thakker, Jinyu Li, Sheng Zhao, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Shenzhen Loop Area Institute(深圳河套学院) City University of Macau(澳门城市大学) Amphion Technology Co., Ltd.(Amphion科技有限公司)

AI总结 FlexiCodec通过动态帧率方法和双流编码架构,提升低帧率下的语义保留和音频重建质量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20926 2026-02-25 cs.AI

HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG

HELP: 图形节点扩展与逻辑路径引导的证据定位用于准确且高效的图RAG

Yuqi Huang, Ning Liao, Kai Yang, Anning Hu, Shengchao Hu, Xiaoxing Wang, Junchi Yan

机构 * Shanghai Jiao Tong University, China(上海交通大学)

AI总结 HELP通过HyperNode扩展和逻辑路径引导的证据定位策略,提升图RAG在准确性和效率之间的平衡,实现高效且准确的知识检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-02-25 cs.CV cs.AI cs.LG cs.MM cs.RO

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: https://video-reason.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23587 2026-02-25 cs.DB cs.AI

A Survey of Data Agents: Emerging Paradigm or Overstated Hype?

数据代理的综述:新兴范式还是过度炒作?

Yizhang Zhu, Liangwei Wang, Chenyu Yang, Xiaotian Lin, Boyan Li, Wei Zhou, Xinyu Liu, Zhangyang Peng, Tianqi Luo, Yu Li, Chengliang Chai, Chong Chen, Shimin Di, Ju Fan, Ji Sun, Nan Tang, Fugee Tsung, Jiannan Wang, Chenglin Wu, Yanwei Xu, Shaolei Zhang, Yong Zhang, Xuanhe Zhou, Guoliang Li, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Tsinghua University(清华大学) Huawei(华为) DeepWisdom

AI总结 本文系统梳理了数据代理的分类与演变,提出分层框架并分析其技术发展与未来方向。

Comments Please refer to our paper list and companion materials at: https://github.com/HKUSTDial/awesome-data-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13411 2026-02-25 cs.LG cs.AI cs.CV

Towards Attributions of Input Variables in a Coalition

朝向联合体中输入变量的归因

Xinhao Zheng, Huiqi Deng, Quanshi Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种新的归因度量,用于评估联合体变量的归因一致性,通过分析AND-OR交互影响,解决归因冲突问题,并在多个领域验证了方法的有效性。

Comments Accepted to the 2025 International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08054 2026-02-25 cs.RO

A Novel Semi-Coupled Hierarchical Motion Planning Framework for Cooperative Transportation of Multiple Mobile Manipulators

一种用于多移动机械臂协作运输的新型半耦合分层运动规划框架

Heng Zhang, Haoyi Song, Wenhang Liu, Xinjun Sheng, Zhenhua Xiong, Xiangyang Zhu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai, China(机械工程学院,上海交通大学,上海,中国)

AI总结 本文提出了一种新型半耦合分层框架,用于解决多移动机械臂协作运输中的运动规划问题,通过集中层和分层层的协同优化,提升了任务执行的成功率和效率。

Comments 21 pages, 9 figures

Journal ref Robotica 43 (2025) 4302-4324

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20557 2026-02-25 cs.LG cs.SC

GENSR: Symbolic Regression Based in Equation Generative Space

GENSR:基于方程生成空间的符号回归

Qian Li, Yuxiao Hu, Juncheng Liu, Yuntian Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) The Hong Kong Polytechnic University(香港理工大学) Imperial College London(伦敦帝国理工学院)

AI总结 GenSR通过生成潜在空间和改进的CMA-ES算法,实现了符号回归中预测准确性、表达简洁性和计算效率的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13301 2026-02-25 cs.CV

DriveMamba: Task-Centric Scalable State Space Model for Efficient End-to-End Autonomous Driving

DriveMamba: 以任务为中心的可扩展状态空间模型用于高效端到端自动驾驶

Haisheng Su, Wei Wu, Feixiang Song, Junjie Zhang, Zhenjie Yang, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(计算机学院与人工智能学院,上海交通大学) SenseAuto

AI总结 DriveMamba通过动态任务关系建模、隐式视角对应学习和长期时间融合,提升端到端自动驾驶的效率与可扩展性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13647 2026-02-25 cs.RO cs.AI cs.CV

An Efficient LiDAR-Camera Fusion Network for Multi-Class 3D Dynamic Object Detection and Trajectory Prediction

一种高效的激光雷达-摄像头融合网络用于多类3D动态物体检测和轨迹预测

Yushen He, Lei Zhao, Tianchen Deng, Zipeng Fang, Weidong Chen

机构 * Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University, Key Laboratory of System Control and Information Processing, Ministry of Education(医学机器人研究所和自动化系,上海交通大学,系统控制与信息处理重点实验室,教育部)

AI总结 本文提出了一种高效的激光雷达-摄像头融合网络,用于多类3D动态物体检测与轨迹预测,通过UniMT和RTMCT模型实现高精度检测与多样化轨迹预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12600 2026-02-25 cs.CV

Revisiting the Generalization Problem of Low-level Vision Models Through the Lens of Image Deraining

通过图像去雨的视角重新审视低级视觉模型的泛化问题

Jinfan Hu, Zhiyuan You, Jinjin Gu, Kaiwen Zhu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学)

AI总结 本文通过图像去雨研究,揭示低级视觉模型泛化问题源于捷径学习,提出平衡数据复杂性和利用生成模型先验以提升模型鲁棒性。

Comments arXiv admin note: substantial text overlap with arXiv:2305.15134

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19753 2026-02-24 cs.CV cs.GR

RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing

RAP: 快速前馈渲染-free 属性引导的原始形体重要性分数预测用于高效3D高斯点绘处理

Kaifa Yang, Qi Yang, Yiling Xu, Zhu Li

机构 * Shanghai Jiao Tong University(上海交通大学) University of Missouri–Kansas City(密苏里大学-堪萨斯城分校)

AI总结 RAP通过属性引导和高效算法,实现3DGS中原始形体重要性分数的快速预测,提升重建、压缩和传输效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19735 2026-02-24 cs.CV

VGGT-MPR: VGGT-Enhanced Multimodal Place Recognition in Autonomous Driving Environments

VGGT-MPR:基于VGGT的多模态地点识别在自动驾驶环境中的应用

Jingyi Xu, Zhangshuo Qi, Zhongmiao Yan, Xuyu Gao, Qianyun Jiao, Songpengcheng Xia, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) National University of Defense Technology(国防科技大学)

AI总结 VGGT-MPR通过视觉几何基础的Transformer实现多模态地点识别,在自动驾驶中表现出强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19536 2026-02-24 cs.CV cs.AI

Fore-Mamba3D: Mamba-based Foreground-Enhanced Encoding for 3D Object Detection

Fore-Mamba3D:基于Mamba的前景增强编码用于3D目标检测

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Runze Yang, Huiying Xu, Xinzhong Zhu, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) School of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院) Beijing Geekplus Technology Co., Ltd(北京 Geekplus 技术有限公司)

AI总结 Fore-Mamba3D通过改进Mamba编码器实现前景增强,解决3D目标检测中响应衰减和上下文表示不足的问题,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19523 2026-02-24 cs.CV

OSInsert: Towards High-authenticity and High-fidelity Image Composition

OSInsert: 向高真实性与高保真图像合成迈进

Jingyuan Wang, Li Niu

机构 * MoE Key Lab of Artificial Intelligence(人工智能关键实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 OSInsert提出一种两阶段策略,通过先生成合理前景形状再保留细节,实现高真实性与高保真的图像合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19225 2026-02-24 cs.AI

Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training

基于接近性的多轮优化:LLM代理训练中的实用信用分配

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chang Liu, Peilin Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) Lanzhou University(兰州大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 ProxMO通过动态调整梯度强度和连续语义加权,提升LLM代理在多轮训练中的信用分配效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14512 2026-02-24 cs.CV

MedVAR: Towards Scalable and Efficient Medical Image Generation via Next-scale Autoregressive Prediction

MedVAR:通过下一步尺度自回归预测实现可扩展和高效的医学图像生成

Zhicheng He, Yunpeng Zhao, Junde Wu, Ziwei Niu, Zijun Li, Bohan Li, Lanfen Lin, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 MedVAR通过下一步尺度自回归预测方法,实现了高效且可扩展的医学图像生成,为医学生成基础模型提供了新的方向。

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏