Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
偏好分数蒸馏:利用2D奖励对齐文本到3D生成
机构 * Fudan University(复旦大学)
AI总结 本文提出偏好分数蒸馏方法,利用2D奖励模型实现文本到3D生成的人类偏好对齐,无需3D训练数据,提升生成质量与扩展性。
高校专区
偏好分数蒸馏:利用2D奖励对齐文本到3D生成
机构 * Fudan University(复旦大学)
AI总结 本文提出偏好分数蒸馏方法,利用2D奖励模型实现文本到3D生成的人类偏好对齐,无需3D训练数据,提升生成质量与扩展性。
IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测
机构 * Xiaohongshu Inc.(小红书公司) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。
权力回声:探究在线权力不对称冲突中的调停偏见
机构 * Fudan University(复旦大学)
AI总结 本文通过实验研究在线权力不对称冲突中人类调停员的偏见类型及AI建议的影响,提出未来调停系统的研究方向。
Comments Accepted at the ACM CHI conference on Human Factors in Computing Systems (ACM CHI 2026)
MIST-RL:基于突变的增量测试套件生成 via 强化学习
机构 * Fudan University, Shanghai, China(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; South China University of Technology, Guangzhou, China(华南理工大学)
AI总结 MIST-RL通过强化学习优化测试生成,提升突变得分并减少测试用例数量,改进代码验证效果。
Comments Preprint. 17 pages
个体图灵测试:基于长期个人数据的LLM模拟案例研究
机构 * Rutgers University(罗格斯大学) ; Fudan University(复旦大学) ; Microsoft(微软公司)
AI总结 本文提出个体图灵测试,通过长期个人数据评估LLM模拟个体的能力,发现不同方法在日常聊天与个人意见上的表现存在显著差异。
Comments 5 pages, 2 figures
跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Fudan University(复旦大学) ; Microsoft Research Asia(微软亚洲研究院) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/
Journal ref International Conference on Learning Representations (ICLR), 2026
EgoNight: 向夜间视角理解迈进的挑战性基准
机构 * East China Normal University(东华大学) ; HKUST(GZ)(香港科技大学(广州)) ; Nankai University(南开大学) ; Fudan University(复旦大学)
AI总结 EgoNight提出首个夜间视角视觉基准,通过日夜间对齐视频和人工验证构建VQA任务,揭示低光照条件下模型性能下降问题,并引入辅助任务推动模型泛化能力提升。
Comments Accepted by ICLR 2026
Uni-cot: 向跨文本和视觉的统一链式推理迈进
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。
Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/
Openfly:面向空中视觉-语言导航的综合性平台
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; Beihang University(北航) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学) ; University of Science and Technology of China(中国科学技术大学) ; East China University of Science and Technology(东华大学) ; Fudan University(复旦大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; TeleAI
AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。
Comments accepted by ICLR 2026
OmniTracker: 通过跟踪与检测统一目标跟踪
机构 * Shanghai Key Lab of Intelligent Information Processing and School of Computer Science, Fudan University(上海智能信息处理关键实验室和复旦大学计算机学院) ; Microsoft Research, Redmond(微软研究院(红mond)) ; Microsoft Research, Asia(微软亚洲研究院)
AI总结 OmniTracker通过结合跟踪与检测的优势,统一解决不同目标跟踪任务,实现高效且一致的模型架构和参数共享。
Comments accepted by TPAMI
视觉-语言特征对齐用于道路异常分割
机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学与技术研究院)
AI总结 VL-Anomaly通过结合视觉-语言模型的语义先验,提出了一种新的道路异常分割框架,有效提升异常检测的准确性和鲁棒性。
一种基于三对称布拉克平行机构的新型可重构灵巧手
机构 * Institute of AI and Robotics, Academy for Engineering & Technology, Fudan University(人工智能与机器人研究所,工程与技术学院,复旦大学) ; Department of Mechanical Engineering, The Hong Kong Polytechnic University(机械工程系,香港理工大学)
AI总结 本文提出了一种基于三对称布拉克平行机构的新型可重构灵巧手,通过拓扑和尺寸综合优化自由度和连杆配置,提升抓取多样性和操作精度。
Comments 8 pages, 14 figures, 2026 IEEE International Conference on Robotics & Automation
PointAlign:用于3D视觉-语言模型的特征级对齐正则化
机构 * University of Science and Technology of China(中国科学技术大学) ; Fuzhou University(福州大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
AI总结 PointAlign通过特征级对齐正则化提升3D视觉-语言模型的几何信息保留与任务性能
Comments CVPR 2026 Accepted
MagicAgent:迈向通用代理规划
机构 * Honor Device Co., Ltd(Honor设备有限公司) ; Fudan University(复旦大学)
AI总结 MagicAgent通过合成数据框架和两阶段训练范式,实现通用代理规划,优于现有模型。
通过参数空间噪声学习探索:深入研究可验证奖励的强化学习
机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) ; Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。
Comments 17 pages, 10 Figures
GeoTeacher: 基于几何的半监督3D物体检测
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Tongji University(同济大学) ; Hong Kong University(香港大学) ; Huazhong University of Science and technology(华中科技大学)
AI总结 GeoTeacher通过几何关系监督模块和体素级数据增强策略,提升半监督3D物体检测的几何感知能力。
Comments Accepted for publication in 2026 IEEE International Conference on Robotics and Automation (ICRA)
MoE中的路由问题:通过显式路由指导扩展扩散Transformer
机构 * Fudan University(复旦大学) ; Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; MMLab ; Institute of Science and Technology for Brain-inspired Intelligence, MOE Frontiers Center for Brain Science, Key Laboratory of Computational Neuroscience and Brain-Inspired Intelligence, and State Key Laboratory of Brain Function and Disorders, Fudan University(脑启发智能科学技术研究院、MOE前沿脑科学中心、计算神经科学与脑启发智能重点实验室、脑功能与疾病国家重点实验室,复旦大学)
AI总结 ProMoE通过显式路由指导提升视觉MoE性能,结合两步路由策略和原型路由机制,在ImageNet基准上优于现有方法。
Comments Accepted to ICLR 2026
基于前瞻树的rollouts用于增强强化学习中轨迹层面的探索
机构 * Nanjing University(南京大学) ; University of Southern California(南加州大学) ; Fudan University(复旦大学)
AI总结 基于前瞻树的rollouts通过促进轨迹多样性提升强化学习中策略学习效率
HardcoreLogic: 用长尾逻辑谜题游戏挑战大型推理模型
机构 * Fudan University(复旦大学) ; University of Southern California(南加州大学) ; Huawei Technologies Ltd(华为技术有限公司) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 HardcoreLogic通过长尾逻辑谜题挑战大型推理模型,揭示其在复杂规则和非标准变体上的局限性。
弥合草案策略不一致:为推测解码的组树优化
机构 * Fudan University(复旦大学) ; National University of Singapore(新加坡国立大学) ; Singapore Management University(新加坡管理学院)
AI总结 GTO通过组树优化解决推测解码中草案策略不一致问题,提升LLM推理效率。
面向高效大语言模型任务适应的分布对齐解码
机构 * Hong Kong JC STEM Lab of Smart City(香港JC智能城市STEM实验室) ; City University of Hong Kong(香港城市大学) ; University of Sussex(苏塞克斯大学) ; Huazhong University of Science and Technology(华中科技大学) ; Fudan University(复旦大学) ; Lingnan University(岭大大学)
AI总结 SVDecode通过引导输出分布对齐提升大语言模型任务适应性能,理论证明其与全微调等价,实验显示在多个任务上准确率提升显著。
Comments Accepted by NeurIPS'25
CineTrans: 通过掩码扩散模型学习生成具有电影过渡的视频
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 CineTrans通过掩码扩散模型生成具有电影风格的多镜头视频,利用镜头边界与注意力图的对应关系,实现稳定且高质量的视频过渡。
Comments ICLR2026 Accept; Project Page:https://uknowsth.github.io/CineTrans/
ImagiDrive: 一种用于自动驾驶的统一想象与规划框架
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Eastern Institute of Technology(技术东院) ; Imperial College London(伦敦帝国理工学院) ; University of Surrey(萨里大学)
AI总结 ImagiDrive通过整合视觉-语言模型和驾驶世界模型,实现自动驾驶中的统一想象与规划循环,提升场景生成和决策预测的准确性与效率。
Comments Accepted for publication in 2026 IEEE International Conference on Robotics and Automation (ICRA)
SecP-Tuning: 通过MPC实现大语言模型高效隐私保护提示微调
机构 * Pengcheng Laboratory(鹏城实验室) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Institute of Statistical Interdisciplinary Research, Southwestern University of Finance and Economics(统计交叉学科研究所,西南财经大学) ; National University of Singapore(新加坡国立大学)
AI总结 SecP-Tuning通过MPC实现大语言模型高效隐私保护提示微调,显著提升微调效率并减少通信开销。
Comments ICLR 2026
Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。
Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD
SimpleTool: 并行解码用于实时大语言模型功能调用
机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院) ; Fudan University, Shanghai, China(复旦大学)
AI总结 SimpleTool通过并行解码技术实现大语言模型功能调用的实时加速,提升效率并降低延迟,适用于实时应用场景。
仅从自监督学习中学习准确的分割
机构 * Fudan University(复旦大学)
AI总结 Selfment通过自监督学习实现准确分割,无需人工标注,取得多个基准的新SOTA结果,并在伪装检测任务中表现优异。
单环随机双层优化的收敛性研究:近似隐式微分
机构 * Xi’an Jiaotong University(西安交通大学) ; Fudan University(复旦大学) ; SGIT AI Lab(SGIT人工智能实验室)
AI总结 本文提出单环随机近似隐式微分算法,证明其在O(κ⁷ ε⁻²)复杂度下达到ε-静态点,兼顾多环方法的最优收敛速度与单环的高效计算。
Diff-Aid: 修复文本到图像生成中的推理时间自适应交互去噪
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
AI总结 Diff-Aid通过自适应调整文本与图像交互提升文本到图像生成质量,提供可解释的调节模式并支持下游应用改进。
Comments 18 pages
自监督AI生成图像检测:从相机元数据视角
机构 * Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) ; Department of Computer Science, Fudan University(复旦大学计算机科学系) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) ; Department of Computer Science and the Shenzhen Research Institute, City University of Hong Kong(城市大学计算机科学系和深圳研究院)
AI总结 通过相机元数据学习特征,提出自监督方法检测AI生成图像,提升检测性能和鲁棒性。