arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-08-06 至 2026-08-06 共收录 10
2608.05126 2026-08-06 cs.CL cs.MM 新提交

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05102 2026-08-06 cs.AI 新提交

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

ABSeeker:通过答案回溯信用分配训练长程搜索智能体

Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出答案回溯信用分配框架,训练ABSeeker智能体,在BrowseComp等数据集上性能优于同规模模型,接近30B级大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04600 2026-08-06 cs.RO cs.SE 新提交

Static Timing Orchestration for Tree-Structured Robot Control Firmware

树结构机器人控制固件的静态时序编排

Wang Xi, Feiran Wei, Mo Deng, Weiheng Lin, Pangkit Fong, Jianping He

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 针对树结构机器人控制固件的结构化数据依赖问题,提出FineMote框架,通过静态调度机制优化时序性能,在真实平台上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04472 2026-08-06 cs.CV cs.AI cs.CL 新提交

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) Shanghai Jiao Tong University(上海交通大学) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01953 2026-08-06 cs.CL cs.LG 版本更新

Look Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy Distillation

蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证

Chishui Chen, Yaoyou Fan, Te Sun, Yi Yang, Chenghao Sun, Delin Mao, Hongbo Qiao, Zuowei Zhang, Junxi Wang, Chenxing Sun, Yangen Hu, Lu Pan, Xuyang Liu, Linfeng Zhang

机构 * Meituan LongCat Interaction(美团龙猫交互) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) Jilin University(吉林大学) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14591 2026-08-06 cs.SD cs.AI 版本更新

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集

Hui Geng, Yi Su, Zijian Gao, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Hengzhu Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Shanghai Jiaotong University(上海交通大学)

AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13856 2026-08-06 cs.CV 版本更新

Any3DAvatar: Fast and High-Quality Full-Head 3D Avatar Reconstruction from Single Portrait Image

Any3DAvatar:从单张肖像图像快速高质量重建完整头部3D虚拟人物

Yujie Gao, Yao Xiao, Xiangnan Zhu, Ya Li, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出Any3DAvatar,通过统一数据集和结构化3D高斯骨架实现单图快速高质量头部3D重建,兼顾精度与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏