arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2512.00961 2026-04-06 cs.LG

Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning

通过视频扩散模型实现目标驱动的奖励用于强化学习

Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) Zhongguancun Academy(中关村学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。

Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15279 2026-04-06 cs.RO cs.CV

Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception

看、聚焦、理解:用于具身感知的机器人眼球

Jiashu Yang, Yifan Han, Yucheng Xie, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学)

AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07553 2026-04-06 cs.CL

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

VeriOS: 基于查询的人机GUI交互以实现可信操作系统代理

Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)

AI总结 VeriOS通过引入查询驱动的人机GUI交互框架,提升操作系统代理在不可信环境中的任务完成能力,实验显示其在不可信场景中性能显著提升,同时保持正常场景下的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09103 2026-04-06 quant-ph cond-mat.stat-mech cs.LG math.OC

Constrained free energy minimization for the design of thermal states and stabilizer thermodynamic systems

受限自由能最小化用于热态设计和稳定子热力学系统的设计

Michele Minervini, Madison Chin, Jacob Kupperman, Nana Liu, Ivy Luo, Meghan Ly, Soorya Rethinasamy, Kathie Wang, Mark M. Wilde

机构 * School of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程学院) School of Applied and Engineering Physics, Cornell University(康奈尔大学应用与工程物理学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院)

AI总结 本文提出利用混合量子-经典算法设计可控哈密顿量的基态和热态,并引入稳定子热力学系统,通过实验验证算法在不同模型中的有效性及在编码中的应用。

Comments v3: 21 pages of main text, 15 pages of appendices, 12 figures

Journal ref Physical Review A, vol. 113, no. 4, page 042407, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02168 2026-04-03 cs.CV

Reflection Generation for Composite Image Using Diffusion Model

基于扩散模型的复合图像反射生成

Haonan Zhao, Qingyang Liu, Jiaxuan Chen, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出通过扩散模型生成复合图像中反射的方法,引入反射位置和外观先验信息,构建首个大规模物体反射数据集DEROBA,实现物理一致且视觉真实的反射生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00986 2026-04-03 cs.CR cs.AI cs.CL cs.LG

Do Phone-Use Agents Respect Your Privacy?

手机使用代理是否尊重您的隐私?

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu Li, Chenxin Li, Jingyuan Hu, Shunian Chen, Tongxu Luo, Jiaxi Bi, Zeyu Qin, Shaobo Wang, Xin Lai, Pengyuan Lyu, Junyi Li, Can Xu, Chengquan Zhang, Han Hu, Ming Yan, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学) Shanghai Jiao Tong University(上海交通大学) Hunyuan Team, Tencent(腾讯混元团队)

AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01155 2026-04-02 cs.SD

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

FineLAP: 通过异质监督驯化细粒度语言-音频预训练

Xiquan Li, Xuenan Xu, Ziyang Ma, Wenxi Chen, Haolin He, Qiuqiang Kong, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出FineLAP,一种新型预训练范式,通过异质数据提升CLAP在clip和frame级对齐能力,引入双流sigmoid损失和聚类采样策略,结合大规模合成SED数据集,实现多任务SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00445 2026-04-02 cs.AI cs.CL

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11558 2026-04-02 cs.RO cs.AI

RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks

RoboClaw:一个用于可扩展长周期机器人任务的代理框架

Ruiying Li, Yunlang Zhou, YuYao Zhu, Kylin Chen, Jingyuan Wang, Sukai Wang, Kongtao Hu, Minhui Yu, Bowen Jiang, Zhan Su, Jiayao Ma, Xin He, Yongjian Shen, Yang Yang, Guanghui Ren, Maoqing Yao, Wenhao Wang, Yao Mu

机构 * AgiBot National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) MoE Key Lab of Artificial Intelligence, AI Institute, SJTU(上海交通大学人工智能研究院教育部人工智能重点实验室)

AI总结 RoboClaw通过统一数据收集、策略学习和任务执行,提高长周期机器人任务的稳定性和可扩展性,减少人工干预,提升多策略鲁棒性。

Comments Code available at: https://github.com/RoboClaw-Robotics/RoboClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09697 2026-04-02 cs.LG cs.AI cs.CL

Mousse: Rectifying the Geometry of Muon with Curvature-Aware Preconditioning

Mousse:通过曲率感知预条件化校正μon的几何

Yechen Zhang, Shuhao Xing, Junhao Huang, Kai Lv, Yunhua Zhou, Xipeng Qiu, Qipeng Guo, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 本文提出Mousse优化器,通过曲率感知预条件化改进谱方法的结构稳定性,实验证明其在大规模语言模型训练中显著提升效率。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18314 2026-04-02 cs.AI

Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming

Genesis:为LLM网络代理红队测试演变攻击策略

Zheng Zhang, Jiarui He, Yuchen Cai, Deheng Ye, Peilin Zhao, Ruili Feng, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Nvidia(英伟达)

AI总结 本文提出Genesis框架,通过遗传算法与混合策略表示生成对抗注入,动态发现有效策略并持续优化,提升网络代理攻击效果。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11737 2026-04-02 cs.AI

Auto-Formulating Dynamic Programming Problems with Large Language Models

利用大语言模型自动生成动态规划问题

Chenyu Zhou, Jingyuan Yang, Linwei Xin, Yitian Chen, Ziyan He, Dongdong Ge

机构 * Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济与管理学院) Booth School of Business, University of Chicago(芝加哥大学布斯商学院) School of Operations Research and Information Engineering, Cornell University(康奈尔大学运筹学与信息工程学院) Cardinal Operations(杉数科技) Shanghai University of Finance and Economics(上海财经大学)

AI总结 本文提出DP-Bench基准和DPLM模型,通过DualReflect生成合成数据,实现动态规划问题的自动化建模,展现了在低数据环境下后向生成的优势及大规模下前向生成的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22244 2026-04-02 cs.LG math.OC

Analysis of On-policy Policy Gradient Methods under the Distribution Mismatch

对在分布不匹配下策略梯度方法的分析

Weizhen Wang, Jianping He, Xiaoming Duan

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Key Laboratory of System Control and Information Processing, Ministry of Education of China(教育部系统控制与信息处理重点实验室)

AI总结 本文分析了分布不匹配对策略梯度方法的影响,证明了在表格参数化下,不匹配引起的偏导数仍能有效描述全局最优性,并推导了更一般参数化下的显式界限,展示了在折扣因子接近1时的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06561 2026-04-02 cs.LG cond-mat.dis-nn math.OC stat.ML

Phase Diagram of Initial Condensation for Two-layer Neural Networks

两层神经网络初始凝聚的相图

Zhengan Chen, Yuqing Li, Tao Luo, Zhangchen Zhou, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) CMA-Shanghai, Shanghai Jiao Tong University(上海交通大学上海数学中心) Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学自然科学研究院,教育部-上海市联合重点实验室) Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清源研究院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文研究了初始化尺度变化下神经网络行为差异的相图,揭示了初始凝聚现象及其与超参数选择的关系,阐明了小初始化在训练初期导致凝聚的机制。

Journal ref CSIAM Transactions on Applied Mathematics 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29732 2026-04-01 cs.CV

Compressive sensing inspired self-supervised single-pixel imaging

受压缩感知启发的自监督单像素成像

Jijun Lu, Yifan Chen, Libang Chen, Yiqiang Zhou, Ye Zheng, Mingliang Chen, Zhe Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(中国电信人工智能研究院(TeleAI)) School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) College of Future Information Technology, Fudan University, Shanghai, China(复旦大学未来信息科技学院) Aerospace Laser Technology and System Department, Shanghai Institute of Optics and Fine Mechanics, Chinese Academy of Sciences, Shanghai, China(中国科学院上海光学精密机械研究所航天激光技术与系统部) Fujian Ocean Innovation Center, Xiamen, China(福建海洋创新中心(厦门))

AI总结 本文提出SISTA-Net,通过融合局部和全局特征建模,提升单像素成像的鲁棒性和抗干扰能力,在多个仿真场景中实现2.6dB的PSNR提升,远场水下测试平均PSNR提高3.4dB。

Comments 10 pages, 9 figures, 2 algorithms, 2 tables, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16790 2026-04-01 cs.SE cs.AI

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B:面向工业场景的代码基础模型

Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv

机构 * Beihang University(北京航空航天大学) IQuest Research Shanghai Jiao Tong University(上海交通大学) ELLIS University of Manchester(曼彻斯特大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Langboat(朗博特)

AI总结 本文提出InCoder-32B,首个统一芯片设计、GPU内核优化等工业领域的32B参数代码基础模型,通过高效架构和多阶段训练方法,在通用和工业任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13802 2026-04-01 cs.CL cs.SD eess.AS

Habibi: Laying the Open-Source Foundation of Unified-Dialectal Arabic Speech Synthesis

Habibi:统一方言阿拉伯语语音合成的开源基础

Yushen Chen, Junzhe Liu, Yujie Tu, Zhikang Niu, Yuzhe Liang, Chunyu Qiang, Chen Zhang, Kai Yu, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 Habibi提出一个统一多方言阿拉伯语语音合成框架,通过多步骤数据管道和语言指导课程学习策略,实现了跨方言零样本合成,并发布了首个标准化多方言评估基准,验证了模型在多个指标上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29533 2026-04-01 cs.RO

GraSP-STL: A Graph-Based Framework for Zero-Shot Signal Temporal Logic Planning via Offline Goal-Conditioned Reinforcement Learning

GraSP-STL: 一种基于图的零样本信号时间逻辑规划框架:通过离线目标条件强化学习

Ancheng Hou, Ruijia Liu, Xiang Yin

机构 * School of Automation & Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 本文提出GraSP-STL框架,利用离线数据学习目标条件价值函数,构建状态空间可达性度量,通过图搜索实现零样本信号时间逻辑规划,支持长周期任务规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29494 2026-04-01 cs.CV

VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

VecAttention: 向量级稀疏注意力用于加速长上下文推理

Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie

机构 * SCS, Peking University(北京大学计算机科学技术学院) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29423 2026-04-01 cs.CV

A2BFR: Attribute-Aware Blind Face Restoration

A2BFR:属性感知的盲脸修复

Chenxin Zhu, Yushun Fang, Lu Liu, Shibo Yin, Xiaohong Liu, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

AI总结 本文提出A2BFR框架,结合高保真重建与提示可控生成,通过属性感知学习和语义双训练提升修复精度与可控性,实验显示在恢复保真度和指令遵循上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29176 2026-04-01 q-bio.NC cs.AI cs.CE cs.CV

Predicting Neuromodulation Outcome for Parkinson's Disease with Generative Virtual Brain Model

利用生成虚拟脑模型预测帕金森病的神经调制疗效

Siyuan Du, Siyi Li, Shuwei Bai, Ang Li, Haolin Li, Mingqing Xiao, Yang Pan, Dongsheng Li, Weidi Xie, Yanfeng Wang, Ya Zhang, Chencheng Zhang, Jiangchao Yao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Microsoft Research Asia(微软亚洲研究院) Zhongnan Hospital of Wuhan University(武汉大学中南医院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体创新中心)

AI总结 本文提出一种基于生成虚拟脑模型的预训练-微调框架,通过静息态fMRI预测帕金森病患者接受颞叶干扰和深部脑刺激的疗效,利用生成模型提高个体化虚拟脑的准确性,并通过反事实估计预测临床反应,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10848 2026-04-01 cs.CL cs.AI cs.LG

Accelerating Diffusion Large Language Models with SlowFast Sampling: The Three Golden Principles

通过SlowFast采样加速扩散大语言模型:三大黄金原则

Qingyan Wei, Yaojie Zhang, Zhiyuan Liu, Puyu Zeng, Yuxuan Wang, Biqing Qi, Dongrui Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学 EPIC 实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出SlowFast采样策略,通过三大原则动态切换探索与加速解码阶段,提升扩散语言模型的生成速度与效率。

Comments 11 pages; 5 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28475 2026-03-31 cs.RO

Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-Shot Real-World Deployment

Tac2Real: 可靠且用于在线强化学习和零样本现实部署的GPU视觉触觉模拟

Ningyu Yan, Shuai Wang, Xing Shen, Hui Wang, Hanqing Wang, Yang Xiang, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Algorithms of Machine Learning and Autonomous Driving Research Lab, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(机器学习与自动驾驶算法研究实验室,香港科技大学深圳-香港协同创新研究院) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Tac2Real框架,结合PNCG-IPC方法和多GPU并行架构,实现高效的在线强化学习训练,并通过TacAlign方法减少领域间隙,验证了在现实场景中高成功率的零样本迁移。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28088 2026-03-31 cs.CV

GEMS: Agent-Native Multimodal Generation with Memory and Skills

GEMS:基于记忆与技能的代理原生多模态生成

Zefeng He, Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Yu Cheng, Yang Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学)

AI总结 GEMS通过引入代理循环、记忆和技能组件,提升多模态生成在复杂指令和专业任务中的性能,使轻量级模型在GenEval2中超越现有最佳模型。

Comments Project Page: https://gems-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27850 2026-03-31 cs.SE cs.CL

EffiSkill: Agent Skill Based Automated Code Efficiency Optimization

EffiSkill:基于代理技能的自动代码效率优化

Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) King's College London(伦敦国王学院) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 EffiSkill通过构建可移植的优化工具箱,利用代码效率优化机制,实现无运行反馈的代码优化,提升了优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏