arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3140
2606.09669 2026-06-16 cs.AI cs.CL 新提交

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

SpatialWorld: 在多模态智能体真实世界任务中基准测试交互式空间推理

Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学) Peking University(北京大学) ZenoMind AI Xi’an Jiaotong University(西安交通大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学)

AI总结 提出SpatialWorld基准,集成8种异构模拟后端,通过760个人工标注任务评估多模态智能体在视觉部分可观测环境中的交互式空间理解,发现最强模型GPT-5任务成功率仅17.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07015 2026-06-16 cs.SD cs.AI 新提交

Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation

面向统一歌曲生成与带伴奏共生成的歌声转换

Ziyu Zhang, Chunyu Qiang, Xiaopeng Wang, Yuxin Guo, Kang Yin, Wenjie Tian, Jingbin Hu, Tianlun Zuo, Zhao Guo, Teng Ma, Yuzhe Liang, Chen Zhang, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学) Kuaishou Technology(快手科技) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出UniSinger框架,基于多模态扩散Transformer统一零样本歌曲生成与伴奏共生成歌声转换,通过共享说话人嵌入和课程学习策略实现跨任务音色控制与多任务优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05014 2026-06-16 cs.CL 版本更新

Depth-Attention: Cross-Layer Value Mixing for Language Models

深度注意力:语言模型的跨层值混合

Boyi Zeng, Yiqin Hao, Zitong Wang, Shixiang Song, He Li, Feichen Song, Yifan Liu, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出深度注意力机制,在注意力模块内部实现跨层值混合,无需额外参数和推理状态,提升语言模型性能。

Comments 21 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06178 2026-06-16 math.OC cs.LG stat.ML

Bayesian Optimization by Kernel Regression and Density-based Exploration

基于核回归和密度探索的贝叶斯优化

Tansheng Zhu, Hongyu Zhou, Ke Jin, Xusheng Xu, Qiufan Yuan, Lijie Ji

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai 200240, P. R. China(上海交通大学紫阳学院) School of Mathematical Sciences, Shanghai Jiao Tong University, Shanghai 200240, P. R. China(上海交通大学数学科学学院) Shanghai Institute of Aerospace Systems Engineering, Shanghai 201109, P. R. China(上海航天系统工程研究院) Department of Mathematics, Shanghai University, Shanghai 200444, P. R. China(上海大学数学系) Newtouch Center for Mathematics of Shanghai University, Shanghai University, Shanghai 200444, P. R. China(上海大学数学中心)

AI总结 该研究提出了一种新的贝叶斯优化算法BOKE,通过核回归和密度探索结合,减少计算成本至二次复杂度,并在理论和实验上证明了其收敛性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08577 2026-06-16 cs.CL cs.AI cs.LG cs.PF 版本更新

Think-at-Hard: Selective Latent Iterations to Improve Reasoning Language Models

Think-at-Hard: 选择性潜在迭代以改进推理语言模型

Tianyu Fu, Yichen You, Zekai Chen, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 针对循环变压器中潜在过思考问题,提出Think-at-Hard方法,通过轻量级决策器选择性地在困难令牌上触发潜在迭代,并采用深度感知LoRA和双因果注意力机制,在数学、问答和编码任务上一致提升性能。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16211 2026-06-16 cs.SD 版本更新

NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

NVV-SuperBench:超越语言,超越质量——语音生成中非语言发声的基准测试

Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, Hung-yi Lee, Yike Guo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学)

AI总结 提出NVV-SuperBench基准,包含45类非语言发声的统一分类和多轴评估协议,用于测试语音生成系统在非语言发声控制、放置和感知显著性方面的能力,发现当前系统在低信噪比口部线索和长时情感发声方面存在瓶颈。

Comments Accepted as a long paper at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18866 2026-06-16 cs.CV 版本更新

HMR-Net: Hierarchical Modular Routing for Cross-Domain Object Detection in Aerial Images

HMR-Net: 用于航拍图像跨域目标检测的层次化模块化路由

Pourya Shamsolmoali, Masoumeh Zareapoor, Michael Felsberg, Nick Pears, Huiyu Zhou, Yue Lu

机构 * Department of Computer Science, University of York(约克大学计算机科学系) SEIEE, Shanghai Jiao Tong University(上海交通大学SEIEE) Computer Vision Laboratory, Linkoping University(林哈姆大学计算机视觉实验室) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) SCEE, East China Normal University(华东师范大学SCEE)

AI总结 提出层次化模块化路由框架,通过领域路由和场景路由实现跨数据集和复杂场景下的结构化专业化,并利用条件专家模块支持零样本新类别检测。

Comments Submitted to IJCV September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04592 2026-06-16 cs.CL cs.CV 交叉投稿

From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models

从静态推理到动态交互:流式大型语言模型综述

Junlong Tong, Zilong Wang, YuJie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

AI总结 本文统一了流式LLM的定义,提出系统分类法,综述其方法、应用与未来方向。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14490 2026-06-16 cs.CV

Making Images Real Again: A Comprehensive Survey on Deep Image Composition

让图像重现真实:深度图像合成的全面综述

Li Niu, Wenyan Cong, Liu Liu, Yan Hong, Bo Zhang, Jing Liang, Liqing Zhang

机构 * MOE Key Lab of Artificial Intelligence, Department of Computer Science and Engineering, Shanghai Jiao Tong University(教育部人工智能联合研究院,计算机科学与工程系,上海交通大学)

AI总结 本文综述了深度图像合成的子任务与综合任务,总结了现有方法、数据集及评估指标,并提供了首个图像合成工具箱libcom。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07920 2026-06-16 cs.CV 版本更新

RLPR: Radar-to-LiDAR Place Recognition via Two-Stage Asymmetric Cross-Modal Alignment for Autonomous Driving

RLPR:面向自动驾驶的两阶段非对称跨模态对齐雷达-激光雷达地点识别

Zhangshuo Qi, Jingyi Xu, Luqi Cheng, Shichen Wen, Guangming Xiong

机构 * Beijing Institute of Technology(北京理工大学) Shanghai Jiaotong University(上海交通大学)

AI总结 提出RLPR框架,通过双流网络提取结构特征,并利用两阶段非对称跨模态对齐策略,实现雷达与激光雷达之间的鲁棒地点识别,在四个数据集上达到最优性能。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14154 2026-06-16 cs.LG math.OC 版本更新

A Penalty Approach for Differentiation Through Black-Box Quadratic Programming Solvers

一种通过黑箱二次规划求解器进行微分的惩罚方法

Yuxuan Linghu, Zhiyuan Liu, Qi Deng

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学经济学院) The University of Chicago(芝加哥大学)

AI总结 提出dXPP,一种基于惩罚的微分框架,通过解耦QP求解与微分,利用黑箱求解器进行前向传播,并在反向传播中隐式微分一个光滑近似惩罚问题,显著提升大规模问题的计算效率和鲁棒性。

Comments 16 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06998 2026-06-16 cs.RO 版本更新

Raspi$^2$USBL: An open-source Raspberry Pi-Based Passive Inverted Ultra-Short Baseline Positioning System for Underwater Robotics

Raspi$^2$USBL:一种基于树莓派的开源被动倒置超短基线水下机器人定位系统

Jin Huang, Yingqiang Wang, Ying Chen

机构 * State Key Laboratory of Ocean Sensing, Ocean College of Zhejiang University(浙江省海洋传感重点实验室,浙江大学海洋学院) School of Oceanography, Shanghai Jiao Tong University(上海交通大学海洋学院)

AI总结 提出一种基于树莓派的低成本被动倒置超短基线定位系统,通过被动声学接收器和主动信标实现水下定位,在消声池、淡水湖和开放海域测试中达到0.1%斜距精度和0.1°方位角精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08706 2026-06-16 cs.RO 版本更新

OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing

OmniVTLA:具有语义对齐触觉感知的视觉-触觉-语言-动作模型

Zhengxue Cheng, Yiqian Zhang, Anni Tang, Keyu Wang, Wenkang Zhang, Haoyu Li, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕辛尼科技)

AI总结 提出OmniVTLA架构,通过双路径触觉编码器框架和语义对齐触觉ViT,结合新数据集ObjTac,显著提升机器人操作中接触密集任务的成功率和轨迹平滑度。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). ObjTac dataset: https://readerek.github.io/Objtac.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14418 2026-06-16 cs.CL 版本更新

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13709 2026-06-15 stat.ML cs.LG 新提交

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

LoMC: 路由基础模型中拒绝抑制的局部多方向校正

Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14665 2026-06-15 cs.RO 新提交

EgoGuide: Egocentric Guidance for Efficient Robot-Free Demonstration Collection and Learning

EgoGuide: 以自我为中心引导的高效无机器人演示收集与学习

Yue Xu, Mingtao Nie, Tianle Li, Hong Li, Yibo Luo, Siyuan Huang, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

AI总结 提出EgoGuide数据收集接口,通过同步腕部和头部/自我中心观察并在线视觉-几何质量引导,结合门控自我中心残差策略,减少所需数据量并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14314 2026-06-15 cs.AI 新提交

Communication Policy Evolution for Proactive LLM Agents

主动式LLM智能体的通信策略演化

Xinbei Ma, Jiyang Qiu, Yao Yao, Zheng Wu, Yijie Lu, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 针对用户与智能体间信息不对称问题,形式化通信策略,提出基于文本和UI的策略,并引入自演化框架CPE,通过提示优化提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14302 2026-06-15 cs.CL 新提交

Retrospective Progress-Aware Self-Refinement for LLM Agent Training

回顾性进度感知的LLM智能体训练自我精炼

Xinbei Ma, Congmin Zheng, Jiyang Qiu, Jiale Hong, Yao Yao, Xiangmou Qu, Jiaxin Yin, Xingyu Lou, Jun Wang, Weiwen Liu, Weinan Zhang, Zhuosheng Zhang, Hai Zhao

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 提出RePro框架,通过前向-反思滚动范式训练智能体自我生成进度信号,无需持续外部监督,在WebShop等任务上提升Qwen系列性能高达12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14168 2026-06-15 cs.CV 新提交

MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction

MUSE: 基于记忆的增量需求满足的智能体3D场景创作

Ruijie Xu, Xinnan Zhu, Jiayu Ying, Daoguo Dong, Yuzhou Ji, Xin Tan

机构 * East China Normal University(华东师范大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出MUSE多智能体框架,通过增量需求满足实现可控3D场景构建与编辑,在AuthorBench上显著提升目标达成率和场景保持率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14139 2026-06-15 cs.LG 新提交

Decoupled Latent Optimization of Diffusion Models for Full Waveform Inversion

全波形反演的扩散模型解耦潜变量优化

Chen Min, Zheng Ma

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学CMA-上海)

AI总结 提出解耦潜变量优化(DLO),通过二次惩罚目标分离物理变量和潜变量,结合数据保真度梯度和扩散先验,在OpenFWI基准上优于经典正则化和现有扩散方法。

Comments 35 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14058 2026-06-15 cs.RO 新提交

ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving

ReactSim-Bench:自动驾驶中反应性行为世界模型模拟的基准测试

Zhiyuan Zhang, Yanlun Peng, Jianing Zhang, Xianda Guo, Zehan Huang, Haoran Liu, Qifeng Li, Shaofeng Zhang, Xiaosong Jia, Junchi Yan

机构 * School of Computer Science & School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院、人工智能学院) Great Wall Motor(长城汽车) Institute of Trustworthy Embodied AI (TEAI), Fudan University(复旦大学可信具身人工智能研究所) School of Computer Science, Wuhan University(武汉大学计算机学院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出ReactSim-Bench,通过解耦自车与周围智能体控制,使用偏离日志的自车行为作为输入,评估行为世界模型模拟的反应性能力,并基于碰撞、地图和运动学指标系统评测多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14024 2026-06-15 cs.CV 新提交

ViT-Up: Faithful Feature Upsampling for Vision Transformers

ViT-Up:面向视觉Transformer的忠实特征上采样

Krispin Wandel, Jingchuan Wang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ViT-Up,一种隐式特征上采样框架,通过从中间ViT隐藏状态构建逐层查询,在任意连续坐标预测特征,避免图像引导带来的特征泄露和模糊,在密集预测和语义对应任务上超越现有方法。

Comments Code is available at: https://github.com/krispinwandel/vit-up

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00593 2026-06-15 cs.CV cs.LG 版本更新

Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes

Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试

Yifan Jiang, Cong Zhang, Bofei Zhang, Qiaofeng Zheng, Yifan Yang, Bingzhang Wang, Yew-Soon Ong

机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Cambridge University(剑桥大学) The University of Hong Kong(香港大学)

AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17892 2026-06-15 cs.LG cs.AI 版本更新

LEPO: Latent Reasoning Policy Optimization for Large Language Models

LEPO:面向大语言模型的潜在推理策略优化

Yuyan Zhou, Jiarui Yu, Hande Dong, Zhezheng Hao, Hong Wang, Jianqing Zhang, Qiang Lin

机构 * Tencent(腾讯) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 LEPO通过引入Gumbel-Softmax在大语言模型中实现可控的随机性,提升其探索能力与强化学习兼容性,通过直接在连续潜在表示上应用强化学习,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21201 2026-06-15 cs.RO cs.AI cs.CV 版本更新

Schrödinger's Navigator: Imagining an Ensemble of Futures for Zero-Shot Object Navigation

薛定谔的导航者:为零样本目标导航设想未来轨迹集合

Yu He, Da Huang, Zhenyang Liu, Zixiao Gu, Qiang Sun, Guangnan Ye, Yanwei Fu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University of International Business and Economics(上海对外经贸大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出一种信念感知框架,在推理时通过轨迹条件化的3D世界模型设想多个未来场景,结合自适应遮挡物感知采样和未来感知价值图,提升零样本目标导航在遮挡严重环境中的隐蔽目标发现和风险感知路径选择。

详情

展开后加载摘要…

URL PDF HTML 收藏