arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

2026-05-29 至 2026-05-29 共收录 4
2605.29935 2026-05-29 cs.CV cs.AI

CityGen: Structure-Guided City-Style Synthesis for Cross-City Autonomous Driving

CityGen: 结构引导的城市风格合成用于跨城市自动驾驶

Zezhong Qian, Zhao Yang, Lu Tan, Zhihao Yan, Weiyi Hong, Haizhuang Liu, Yawei Jueluo

机构 * Jiangsu Cytoderm Intelligent Technology Co., Ltd., China(江苏细胞膜智能科技有限公司,中国) Xi'an Jiaotong University, Xi'an, China(西安交通大学,中国) Tsinghua University, Beijing, China(清华大学,中国) University of Science and Technology of China, Hefei, China(中国科学技术大学,中国)

AI总结 提出CityGen,一种基于扩散模型的生成框架,通过高清地图条件和城市级视觉提示实现零标签城市适应,提升跨城市自动驾驶在感知、分割和规划任务上的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29762 2026-05-29 cs.CV

GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

GeoMag: 基于状态空间模型的几何感知视频运动放大

Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Xi'an Jiaotong University(西安交通大学)

AI总结 提出GeoMag框架,利用状态空间模型实现全局一致的运动放大,并构建Geo-200K数据集提升训练多样性,在视觉保真度和计算效率上优于现有方法。

Comments ICME 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29430 2026-05-29 cs.AI cs.CL

Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation

迈向具有智能体纠正和语义评估的类人交互式语音识别

Zixuan Jiang, Yanqiao Zhu, Peng Wang, Qinyuan Chen, Xinjian Zhao, Xipeng Qiu, Wupeng Wang, Zhifu Gao, Xiangang Li, Kai Yu, Xie Chen

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Tongyi Fun Team, Alibaba Group(阿里云通义团队)

AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26994 2026-05-29 cs.CV

ChartAct: A Benchmark for Dynamic Chart Understanding

ChartAct: 动态图表理解基准

Muye Huang, Lin Wu, Lingling Zhang, Hang Yan, Zhiyuan Wang, Yumeng Fu, Zesheng Yang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) MOE KLNN Lab, Xi’an Jiaotong University(西安交通大学MOE KLNN实验室)

AI总结 提出ChartAct基准,通过收集673个动态图表和1440个问答样本,评估多模态模型在交互式图表理解中的能力,发现现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏