Automatic Reward Shaping from Multi-Objective Human Heuristics
多目标人类启发式自动奖励塑造
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MORSE通过双层优化框架自动整合多目标人类启发式奖励,提升机器人任务性能。
高校专区
多目标人类启发式自动奖励塑造
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 MORSE通过双层优化框架自动整合多目标人类启发式奖励,提升机器人任务性能。
DenoiseRotator: 通过重要性集中增强大语言模型的剪枝鲁棒性
机构 * Shanghai Jiao Tong University(上海交通大学) ; HKUST(香港科技大学) ; Meituan(美团)
AI总结 DenoiseRotator通过重要性集中提升大语言模型剪枝鲁棒性,采用可学习正交变换优化参数重要性分布,有效减少稀疏性约束下的性能下降。
Comments Accepted at NeurIPS 2025
快速且准确的因果并行解码使用雅可比强迫
机构 * UC San Diego(UC圣迭戈大学) ; Shanghai Jiao Tong University(上海交通大学) ; Snowflake(Snowflake公司)
AI总结 本文提出雅可比强迫方法,通过渐进蒸馏将AR模型转化为高效的并行解码器,实现3.8倍的速度提升并保持性能,同时引入多块解码与拒绝回收进一步提升效率。
原生智能源自大规模临床实践:一种具有部署效率的视网膜基础模型
机构 * School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(生物医学工程学院,清华大学医学部,清华大学) ; School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) ; Beijing Key Laboratory of Intelligent Diagnosis Technology and Equipment for Optic Nerve-Related Eye Diseases(北京智能诊断技术与设备重点实验室) ; School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) ; Beijing Tongren Hospital, Capital Medical University(北京同仁医院,首都医科大学) ; School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) ; Beijing Visual Science and Translational Eye Research Institute (BERI), Beijing Tsinghua Changgung Hospital Eye Center, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University Institute of Ophthalmology(北京视觉科学与转化眼研所(BERI),北京清华长庚医院眼科中心,临床医学学院,清华大学医学部,清华大学眼科学院)
AI总结 ReVision通过直接从真实临床数据中学习,实现了在低资源环境下高效部署的视网膜基础模型,无需额外标注即可在多种医学任务中取得优异性能。
A4-Agent: 一种用于零样本 affordance 推理的代理框架
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; SJTU(上海交通大学) ; Knowin
AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。
分层权重选择用于高效能神经网络加速
机构 * Shanghai Jiao Tong University(上海交通大学) ; Technical University of Darmstadt(达姆斯塔特技术大学) ; Stevens Institute of Technology(斯蒂文斯理工学院)
AI总结 本文提出了一种分层权重选择框架,通过优化能耗准确度和分层调度,实现CNN加速器的高效能压缩,实验显示能耗降低达58.6%且准确率仅下降2-3%。
DART: 为高效大语言模型的难度自适应推理截断
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; CSE Department, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Research and Development Department, SIMMIR Tech(Simmir科技研发部) ; School of Information Science and Technology, Xiamen University Tan Kah Kee College(厦门大学信息科学与技术学院) ; The University of Hong Kong(香港大学)
AI总结 DART通过自适应调整推理长度提升大语言模型效率,实现81.2%的推理截断和5.33倍的计算加速。
SDAR-VL: 稳定且高效的块状扩散用于视觉语言理解
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; ByteDance(字节跳动)
AI总结 SDAR-VL通过高效的块状扩散方法,在视觉语言理解中实现了更高的训练效率、收敛稳定性及任务性能,优于传统块扩散并匹敌强AR基线。
POLAR:一个面向光照感知面部建模的 Portrait OLAT 数据集和生成框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; PICO
AI总结 POLAR 提出了一种基于大规模 OLAT 数据集和 POLARNet 生成模型的光照感知面部建模框架,实现可扩展和可控的面部重映射。
Comments 19 pages, 19 figures
EDGC: 基于熵驱动的动态梯度压缩用于高效大语言模型训练
机构 * University of Shanghai for Science and Technology(上海科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 EDGC通过动态梯度压缩减少LLM训练的通信延迟和训练时间,提升效率的同时保持模型准确性。
有机合成过程生成的科学推理模型
机构 * Microsoft Research AI for Science(微软研究院人工智能科学部) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 QFANG通过化学引导推理框架生成高质量合成程序,提升计算机辅助合成规划与自动化实验室合成的衔接。
MedCEG: 通过关键证据图强化可验证的医学推理
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII
AI总结 MedCEG通过关键证据图强化医学推理,提升临床决策的可靠性与有效性。
PoseAnything: 通用姿态引导视频生成与部分感知时间一致性
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。
集成预测与多期投资组合优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; The University of Chicago(芝加哥大学)
AI总结 本文提出IPMO模型,通过集成预测与多期投资组合优化,提升风险调整后的绩效并实现更一致的资产分配路径。
Comments 23 pages, 6 figures, and 4 tables
Repulsor:利用对比记忆库加速生成建模
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; HKU(香港大学) ; CUHK(香港大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
AI总结 Repulsor通过对比记忆库机制,无需外部编码器,实现高效的生成建模,显著提升收敛速度和生成质量。
Comments 19 pages, 19 figures
Light-X:具有摄像机和照明控制的生成式4D视频渲染
机构 * S-Lab, NTU(NTU的S-Lab) ; BAAI ; HUST(华中科技大学) ; AIR,THU(清华大学人工智能研究院) ; FNii, CUHKSZ(CUHKSZ的FNii) ; SJTU(上海交通大学) ; EIT (Ningbo)(宁波工程学院)
AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。
Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X
一种用于真实文本到LiDAR场景生成的自条件表示引导扩散模型
机构 * NJUST(南京理工大学) ; FBK(弗拉·恩里科·拉达基金会) ; SDU(山东大学) ; SJTU(上海交通大学)
AI总结 本文提出T2LDM模型,通过自条件表示引导技术提升文本到LiDAR场景生成的质量和可控性,构建了T2nuScenes基准并改进了生成效果。
SAC:具有语义-声学双流量化神经语音编解码器
机构 * X-LANCE Lab, Shanghai Jiao Tong University, China(上海交通大学X-LANCE实验室) ; Shanghai Innovation Institute, China(上海创新研究院) ; Soul AI Lab, China(Soul AI实验室)
AI总结 SAC通过语义-声学双流量化提升语音编解码器的重建与语义表示能力,实现更自然的语音生成和更高效的文本到语音转换。
ViCO: 一种面向语义感知动态高分辨率的训练策略
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Donghua University(东华大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 ViCO通过动态调整视觉标记数量以适应图像语义复杂度,有效降低推理成本的同时保持模型性能。
HTMformer: 混合时间与多变量变换器用于时间序列预测
机构 * Northwestern Polytechnical University(北华理工大学) ; MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能教育部重点实验室,上海交通大学AI研究院) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究所,东部技术研究所) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)
AI总结 HTMformer通过混合时间与多变量嵌入提升时间序列预测的准确性和效率
扩散模型中hallucination的计数
机构 * University of Adelaide(阿德莱德大学) ; Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出了一种针对扩散模型中计数hallucination的评估方法,通过构建CountHalluSet数据集,系统分析不同采样条件对hallucination的影响,并揭示FID等指标无法捕捉计数hallucination的问题。
具身图像压缩
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出具身图像压缩问题,建立EmbodiedComp基准测试,证明现有模型在超低比特率下无法完成简单任务,推动具身AI在现实中的应用。
Comments 15 pages, 12 figures, 3 tables
利用GUI代理进行电子设计自动化
机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; Center of AI Evaluation, Shanghai AI Laboratory(人工智能评估中心,上海人工智能实验室) ; School of Integrated Circuit Design, Shanghai Jiao Tong University(集成电路设计学院,上海交通大学) ; John Hopcroft Center, Shanghai Jiao Tong University(约翰·霍普克罗夫特中心,上海交通大学)
AI总结 本文首次将GUI代理应用于电子设计自动化领域,提出GUI-EDA数据集和EDAagent指标,解决EDA任务中的挑战。
Comments 17 pages, 15 figures, 8 tables
MultiEgo: 一种多视角第一人称视频数据集用于4D场景重建
机构 * Shanghai Jiao Tong University(上海交通大学) ; VisionStar Information Technology (Shanghai) Co., Ltd.(VisionStar信息科技(上海)有限公司)
AI总结 MultiEgo是首个多视角第一人称视频数据集,用于4D动态场景重建,包含五个社交互动场景,提供高精度姿态标注和亚毫秒级时间同步,适用于自由视角视频应用。
Comments ACM MM 2025 Dataset Track
CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学) ; SenseTime Research(商汤科技研究院)
AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。
Octopus: 六种能力协同的代理多模态推理
机构 * Sun Yat-sen University(中山大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。
FlowDirector: 无需训练的流引导文本到视频编辑
机构 * AGI Lab, Westlake University(西湖大学AGI实验室) ; Central South University(中南大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。
Comments Project Page is https://flowdirector-edit.github.io
FuncGenFoil:函数空间中的机翼生成与编辑模型
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Shanghai Aircraft Design and Research Institute(上海飞机设计与研究院) ; Innovation Academy for Microsatellites of CAS(中国科学院微卫星创新院) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 FuncGenFoil通过函数空间建模实现机翼生成与编辑,提升生成精度与多样性,为高保真空气动力学设计提供新框架。
最近离散语音标记的进展:综述
机构 * MoE Key Lab of Artificial Intelligence, Jiangsu Key Lab of Language Computing(MoE人工智能关键实验室、江苏语言计算重点实验室;X-LANCE实验室、计算机科学与工程系、上海交通大学) ; X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University
AI总结 本文综述了离散语音标记的最新进展,分析了声音标记和语义标记的分类、方法及挑战,为未来研究提供方向。
Comments 26 pages, 8 figures, 3 tables. Accepted to IEEE TPAMI
MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。