arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2511.14259 2026-01-21 cs.CV

ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation

ManipShield: 一种用于图像篡改检测、定位和解释的统一框架

Zitong Xu, Huiyu Duan, Xiaoyu Wang, Zhaolin Cai, Kaiwei Zhang, Qiang Hu, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) University of Electronic and Science Technology of China(电子科技大学) Tianjin University(天津大学)

AI总结 ManipShield基于多模态大语言模型,通过对比学习LoRA微调和任务特定解码器,实现图像篡改的统一检测、定位和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02751 2026-01-21 cs.LG cs.AI

SmallKV: Small Model Assisted Compensation of KV Cache Compression for Efficient LLM Inference

SmallKV: 小模型辅助补偿KV缓存压缩以实现高效大语言模型推理

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Hai Zhao, Xiaoming Fu

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen(计算机科学研究所,哥廷根大学)

AI总结 SmallKV通过小模型辅助补偿KV缓存压缩,提升大语言模型在资源受限环境下的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13308 2026-01-21 cs.LG cs.AI cs.CL

Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space

在黑暗中寻求:通过测试时实例级策略梯度进行潜在空间推理

Hengli Li, Chenxi Li, Tong Wu, Xuekai Zhu, Yuxuan Wang, Zhaoxin Yu, Eric Hanchen Jiang, Song-Chun Zhu, Zixia Jia, Ying Nian Wu, Zilong Zheng

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) NLCo Lab, Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院NLCo实验室) Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 LatentSeek通过测试时实例级策略梯度在潜在空间中提升LLM推理能力,展现高效且可扩展的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21197 2026-01-21 cs.MM cs.CV

WVSC: Wireless Video Semantic Communication with Multi-frame Compensation

WVSC:基于多帧补偿的无线视频语义通信

Bingyan Xie, Yongpeng Wu, Yuxuan Shi, Biqian Feng, Wenjun Zhang, Jihong Park, Tony Q. S. Quek

机构 * Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系) School of Cyber and Engineering, Shanghai Jiao Tong University(上海交通大学网络与工程学院) ISTD Pillar, Singapore University of Technology of Design(新加坡科技设计大学ISTD支柱)

AI总结 WVSC通过语义编码和多帧补偿技术提升无线视频传输的带宽效率和PSNR性能

Comments This paper has been accepted by WCNC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11500 2026-01-21 cs.CL cs.AI

Intention Knowledge Graph Construction for User Intention Relation Modeling

用户意图知识图谱构建用于用户意图关系建模

Jiaxin Bai, Zhaobo Wang, Junfei Cheng, Dan Yu, Zerui Huang, Weiqi Wang, Xin Liu, Chen Luo, Yanming Zhu, Bo Li, Yangqiu Song

机构 * CSE, Hong Kong University of Science and Technology(香港理工大学计算机科学与工程系) CSE, Shanghai Jiaotong University(上海交通大学计算机科学与工程系)

AI总结 本文提出了一种自动构建意图知识图谱的方法,通过Amazon m2数据集生成351亿条边的意图图,有效提升用户意图预测和推荐效果。

Comments Accepted by EACL'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12008 2026-01-21 cs.LG

Extreme Value Policy Optimization for Safe Reinforcement Learning

极值政策优化用于安全强化学习

Shiqing Gao, Yihang Zhou, Shuai Shao, Haoyu Luo, Yiheng Bing, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学)

AI总结 本文提出极值政策优化算法,通过极值理论建模和极值优先机制,有效减少约束违反并提升安全强化学习性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11953 2026-01-21 cs.LG

Controlling Underestimation Bias in Constrained Reinforcement Learning for Safe Exploration

在安全探索中约束强化学习中的低估偏差控制

Shiqing Gao, Jiaxin Ding, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

AI总结 本文提出MICE方法,通过引入内在成本和偏差校正策略,有效控制约束强化学习中的低估偏差,减少约束违反并保持策略性能。

Comments Published in the 42nd International Conference on Machine Learning (ICML 2025, Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07413 2026-01-21 cs.CV

REF-VLM: Triplet-Based Referring Paradigm for Unified Visual Decoding

基于三元组的引用范式用于统一视觉解码

Yan Tai, Luhao Zhu, Yunan Ding, Yiying Dong, Guangtao Zhai, Xiaohong Liu, Guodong Guo

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学计算机科学学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo, China(宁波数字孪生研究院) School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, 200240, China(上海交通大学信息科学与电子工程学院)

AI总结 REF-VLM通过引入基于三元组的引用范式,提升多任务视觉解码的性能和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11421 2026-01-19 cs.RO cs.AI

The Great March 100: 100 Detail-oriented Tasks for Evaluating Embodied AI Agents

伟大的百日行进100:100个注重细节的任务用于评估具身体验人工智能代理

Ziyu Wang, Chenyuan Liu, Yushun Xiang, Runhao Zhang, Qingbo Hao, Hongliang Lu, Houyu Chen, Zhizhong Feng, Kaiyue Zheng, Dehao Ye, Xianchao Zeng, Xinyu Zhou, Boran Wen, Jiaxin Li, Mingyu Zhang, Kecheng Zheng, Qian Zhu, Ran Cheng, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海人工智能研究院) Robbyant

AI总结 GM-100通过100个精心设计的任务全面评估具身体验人工智能代理的能力,推动机器人数据集任务设计的多样性和复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11255 2026-01-19 cs.CL cs.LG

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08689 2026-01-19 cs.CL

QuantEval: A Benchmark for Financial Quantitative Tasks in Large Language Models

QuantEval:大型语言模型中金融量化任务的基准测试

Zhaolu Kang, Junhao Gong, Wenqing Hu, Shuo Yin, Kehan Jiang, Zhicheng Fang, Yingjie He, Chunlei Meng, Rong Fu, Dongyang Chen, Leqi Zheng, Eric Hanchen Jiang, Yunfei Feng, Yitong Leng, Junfan Zhu, Xiaoyou Chen, Xi Yang, Richeng Xuan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Fudan University(复旦大学) University of Macau(澳门大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Imperial College London(伦敦帝国理工学院) University of Chicago(芝加哥大学) Shanghai Weina Software Technology(上海韦纳软件技术) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 QuantEval是一个用于评估大型语言模型在金融量化任务中能力的基准测试,涵盖知识问答、数学推理和策略编程,通过回测框架评估模型性能,并展示了改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10407 2026-01-16 cs.LG

CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning

CS-GBA:一种基于关键样本的梯度引导后门攻击用于离线强化学习

Yuanjie Zhao, Junnan Qiu, Yue Ding, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学) SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英技术学院)

AI总结 CS-GBA提出了一种基于关键样本的梯度引导后门攻击方法,通过优化攻击预算和隐蔽性,有效对抗安全约束算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10332 2026-01-16 cs.CV

Think-Then-Generate: Reasoning-Aware Text-to-Image Diffusion with LLM Encoders

思考-然后-生成:基于LLM编码器的推理感知文本到图像扩散模型

Siqi Kou, Jiachun Jin, Zetong Zhou, Ye Ma, Yugang Wang, Quan Chen, Peng Jiang, Xiao Yang, Jun Zhu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

AI总结 本文提出基于LLM编码器的推理感知文本到图像扩散模型,通过推理重写提示提升生成质量,达到接近GPT-4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10272 2026-01-16 cs.CL cs.AI cs.LG cs.SD

MoST: Mixing Speech and Text with Modality-Aware Mixture of Experts

MoST:通过模态感知混合专家混合语音和文本

Yuxuan Lou, Kai Yang, Yang You

机构 * School of Computer Science, National University of Singapore(新加坡国立大学计算机科学学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 MoST通过模态感知混合专家架构,实现语音和文本的高效融合,首次公开了基于混合专家的语音-文本大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10242 2026-01-16 cs.CL cs.AI

Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?

循环作为桥梁:循环变换器能否真正连接表示空间和自然语言输出?

Guanxu Chen, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了循环变换器是否能通过迭代机制弥合内部知识与自然语言输出之间的差距,发现循环次数增加虽缩小差距,但内部知识退化是主因,且表征感知能力仅在最终循环中存在。

Comments 9 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10192 2026-01-16 cs.CV

From Physical Degradation Models to Task-Aware All-in-One Image Restoration

从物理退化模型到任务感知的一体化图像修复

Hu Gao, Xiaoning Lei, Xichen Xu, Xingjian Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Beijing Normal University, Beijing, China(北京师范大学)

AI总结 本文提出OPIR框架,通过物理退化建模和任务感知逆操作符预测,实现高效的一体化图像修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09385 2026-01-15 cs.SD cs.CL cs.MM

SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing

SLAM-LLM: 一种模块化、开源的多模态大语言模型框架及语音、语言、音频和音乐处理的最佳实践

Ziyang Ma, Guanrou Yang, Wenxi Chen, Zhifu Gao, Yexing Du, Xiquan Li, Zhisheng Zheng, Haina Zhu, Jianheng Zhuo, Zheshu Song, Ruiyang Xu, Tiranrui Wang, Yifan Yang, Yanqiao Zhu, Zhikang Niu, Liumeng Xue, Yinghao Ma, Ruibin Yuan, Shiliang Zhang, Kai Yu, Eng Siong Chng, Xie Chen

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) University of Texas at Austin(德克萨斯大学奥斯汀分校) Tianjin University(天津大学) Hong Kong University of Science and Technology(香港科学大学) Queen Mary University of London(伦敦玛丽女王大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 SLAM-LLM是一种开源多模态大语言模型框架,专注于语音、语言、音频和音乐处理,提供模块化配置和高性能检查点以加速研究开发。

Comments Published in IEEE Journal of Selected Topics in Signal Processing (JSTSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00056 2026-01-15 cs.LG cs.AI

MISA: Memory-Efficient LLMs Optimization with Module-wise Importance Sampling

MISA: 通过模块级重要性采样实现内存高效的LLM优化

Yuxi Liu, Renjia Deng, Yutong He, Xue Wang, Tao Yao, Kun Yuan

机构 * Peking University(北京大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Jiao Tong University(上海交通大学)

AI总结 MISA通过模块级重要性采样优化LLM,减少内存需求并提高收敛效率。

Comments This paper is accepted to Neural Information Processing Systems (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19385 2026-01-15 cs.LG

Beyond Uniform SVD:Dual-Level Optimization across Columns and Modules for LLM Compression

超越统一SVD:跨列和模块的双层优化用于LLM压缩

Lin Xv, Xian Gao, Ting Li, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 Duo-SVD通过双层优化提升LLM压缩效率,有效解决分解误差差异和权重矩阵重要性评估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05065 2026-01-15 cs.CV

Decoupling Continual Semantic Segmentation

解耦持续语义分割

Yifu Guo, Yuquan Lu, Wentao Zhang, Zishan Xu, Dexia Chen, Siyu Zhang, Yizhe Zhang, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Southwest University(西南大学) University of Notre Dame(诺丁汉大学)

AI总结 DecoupleCSS通过解耦类感知检测与类无关分割,实现更有效的持续学习,提升保留与适应性平衡,达到最佳性能。

Comments https://github.com/euyis1019/Decoupling-Continual-Semantic-Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04733 2026-01-15 cs.CV

Video Prediction Transformers without Recurrence or Convolution

没有递归或卷积的视频预测变压器

Yujin Tang, Lu Qi, Xiangtai Li, Chao Ma, Ming-Hsuan Yang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Merced(加州大学默塞德分校) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出PredFormer,一种基于门控变压器的视频预测框架,通过全面分析3D注意力并进行广泛实验,展示了其在四个标准基准上的最佳性能。

Comments Accepted by Transactions on Machine Learning Research 2026; Project Page: https://yyyujintang.github.io/predformer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08311 2026-01-14 cs.CV cs.AI

Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation

通过检索增强生成提升大型多模态模型的图像质量评估能力

Kang Fu, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Jun Zhao, Xiongkuo Min, Jia Wang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 IQA-RAG通过检索增强生成提升LMMs图像质量评估能力,提供高效替代微调方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23742 2026-01-14 cs.SE cs.AI

AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization

AgenticTCAD: 基于LLM的多智能体框架用于自动TCAD代码生成与器件优化

Guangxi Fan, Tianliang Ma, Xuguang Sun, Xun Wang, Kain Lu Low, Leilai Shao

机构 * State Key Laboratory of Micro-nano Engineering Science(微纳工程科学国家重点实验室) Micro-nano Engineering Sciences Research Center(微纳工程科学研究中心) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

AI总结 AgenticTCAD通过基于LLM的多智能体框架实现自动TCAD代码生成与器件优化,显著提升设计效率。

Comments Accepted by DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08399 2026-01-14 cs.LG cs.AI cs.CV

Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment

通过不一致来对齐:面向多模态对齐的边界感知课程学习

Hua Ye, Hang Ding, Siyuan Chen, Yiyang Jiang, Changyuan Zhang, Xuan Zhang

机构 * Nanjing University(南京大学) Airon Technology CO., LTD(艾润科技有限公司) Shanghai Jiao Tong University(上海交通大学) University of Bristol(布里斯托大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出BACL方法,通过边界感知负样本采样和局部注意力损失,提升多模态对齐性能,在多个基准上取得优于CLIP的成果。

Comments 24 pages, 6 figures, 5 tables. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04295 2026-01-14 cs.SE cs.AI

EvoC2Rust: A Skeleton-guided Framework for Project-Level C-to-Rust Translation

EvoC2Rust:一个指导骨架的项目级C到Rust翻译框架

Chaofan Wang, Tingrui Yu, Beijun Shen, Jie Wang, Dong Chen, Wenrui Zhang, Yuling Shi, Chen Xie, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 EvoC2Rust通过结合规则和LLM方法,提升项目级C到Rust翻译的准确性和安全性

Comments Accepted by ICSE 2026 SEIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10035 2026-01-14 cs.GR cs.AI

FastFLUX: Pruning FLUX with Block-wise Replacement and Sandwich Training

FastFLUX: 通过块级替换和 sandwich 训练进行 FLUX 剪枝

Fuhan Cai, Yong Guo, Jie Li, Wenbo Li, Jian Chen, Xiangzhong Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) South China University of Technology(华南理工大学) Chinese University of Hong Kong(香港中文大学)

AI总结 FastFLUX 通过块级替换和 sandwich 训练方法,提高 FLUX 模型的推理效率和图像质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07553 2026-01-14 cs.AI q-bio.QM

GTR-CoT: Graph Traversal as Visual Chain of Thought for Molecular Structure Recognition

GTR-CoT:图遍历作为视觉推理链用于分子结构识别

Jingchao Wang, Yifan He, Haote Yang, Jiang Wu, Lingli Ge, Xingjian Wei, Yinfan Wang, Linye Li, Huijie Ao, Chengjin Liu, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

AI总结 GTR-CoT通过图遍历机制和强化学习提升手绘分子结构识别性能,构建首个细粒度评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏