arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-06-16 至 2026-06-16 共收录 10
2606.05014 2026-06-16 cs.CL 版本更新

Depth-Attention: Cross-Layer Value Mixing for Language Models

深度注意力:语言模型的跨层值混合

Boyi Zeng, Yiqin Hao, Zitong Wang, Shixiang Song, He Li, Feichen Song, Yifan Liu, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出深度注意力机制,在注意力模块内部实现跨层值混合,无需额外参数和推理状态,提升语言模型性能。

Comments 21 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-06-16 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16211 2026-06-16 cs.SD 版本更新

NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

NVV-SuperBench:超越语言,超越质量——语音生成中非语言发声的基准测试

Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, Hung-yi Lee, Yike Guo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学)

AI总结 提出NVV-SuperBench基准,包含45类非语言发声的统一分类和多轴评估协议,用于测试语音生成系统在非语言发声控制、放置和感知显著性方面的能力,发现当前系统在低信噪比口部线索和长时情感发声方面存在瓶颈。

Comments Accepted as a long paper at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18866 2026-06-16 cs.CV 版本更新

HMR-Net: Hierarchical Modular Routing for Cross-Domain Object Detection in Aerial Images

HMR-Net: 用于航拍图像跨域目标检测的层次化模块化路由

Pourya Shamsolmoali, Masoumeh Zareapoor, Michael Felsberg, Nick Pears, Huiyu Zhou, Yue Lu

机构 * Department of Computer Science, University of York(约克大学计算机科学系) SEIEE, Shanghai Jiao Tong University(上海交通大学SEIEE) Computer Vision Laboratory, Linkoping University(林哈姆大学计算机视觉实验室) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) SCEE, East China Normal University(华东师范大学SCEE)

AI总结 提出层次化模块化路由框架,通过领域路由和场景路由实现跨数据集和复杂场景下的结构化专业化,并利用条件专家模块支持零样本新类别检测。

Comments Submitted to IJCV September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07920 2026-06-16 cs.CV 版本更新

RLPR: Radar-to-LiDAR Place Recognition via Two-Stage Asymmetric Cross-Modal Alignment for Autonomous Driving

RLPR:面向自动驾驶的两阶段非对称跨模态对齐雷达-激光雷达地点识别

Zhangshuo Qi, Jingyi Xu, Luqi Cheng, Shichen Wen, Guangming Xiong

机构 * Beijing Institute of Technology(北京理工大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出RLPR框架,通过双流网络提取结构特征,并利用两阶段非对称跨模态对齐策略,实现雷达与激光雷达之间的鲁棒地点识别,在四个数据集上达到最优性能。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14154 2026-06-16 cs.LG math.OC 版本更新

A Penalty Approach for Differentiation Through Black-Box Quadratic Programming Solvers

一种通过黑箱二次规划求解器进行微分的惩罚方法

Yuxuan Linghu, Zhiyuan Liu, Qi Deng

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学经济学院) The University of Chicago(芝加哥大学)

AI总结 提出dXPP,一种基于惩罚的微分框架,通过解耦QP求解与微分,利用黑箱求解器进行前向传播,并在反向传播中隐式微分一个光滑近似惩罚问题,显著提升大规模问题的计算效率和鲁棒性。

Comments 16 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06998 2026-06-16 cs.RO 版本更新

Raspi$^2$USBL: An open-source Raspberry Pi-Based Passive Inverted Ultra-Short Baseline Positioning System for Underwater Robotics

Raspi$^2$USBL:一种基于树莓派的开源被动倒置超短基线水下机器人定位系统

Jin Huang, Yingqiang Wang, Ying Chen

机构 * State Key Laboratory of Ocean Sensing, Ocean College of Zhejiang University(浙江省海洋传感重点实验室,浙江大学海洋学院) School of Oceanography, Shanghai Jiao Tong University(上海交通大学海洋学院)

AI总结 提出一种基于树莓派的低成本被动倒置超短基线定位系统,通过被动声学接收器和主动信标实现水下定位,在消声池、淡水湖和开放海域测试中达到0.1%斜距精度和0.1°方位角精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08706 2026-06-16 cs.RO 版本更新

OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing

OmniVTLA:具有语义对齐触觉感知的视觉-触觉-语言-动作模型

Zhengxue Cheng, Yiqian Zhang, Anni Tang, Keyu Wang, Wenkang Zhang, Haoyu Li, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕辛尼科技)

AI总结 提出OmniVTLA架构,通过双路径触觉编码器框架和语义对齐触觉ViT,结合新数据集ObjTac,显著提升机器人操作中接触密集任务的成功率和轨迹平滑度。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). ObjTac dataset: https://readerek.github.io/Objtac.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14418 2026-06-16 cs.CL 版本更新

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏