arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1920
2606.17463 2026-06-17 cs.CV cs.RO 新提交

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

WeaveLA: 面向重复机器人操作的基于事件驱动的跨子任务潜在记忆编织

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

机构 * Fudan University(复旦大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对短窗口VLA策略缺乏跨子任务信息传递的问题,提出WeaveLA,通过事件触发将完成子任务压缩为潜在令牌并注入下一子任务的动作生成路径,在保持基础策略短窗口接口的同时实现轻量级跨子任务通道,在困难重复任务上成功率从0%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14295 2026-06-17 cs.CR cs.AI cs.LG 新提交

AgentCyberRange: Benchmarking Frontier AI Systems in Realistic Cyber Ranges

AgentCyberRange:在真实网络靶场中基准测试前沿AI系统

Fengyu Liu, Jiarun Dai, Yihe Fan, Wuyuao Mai, Ziao Li, Bofei Chen, Jie Zhang, Zheng Lou, Bocheng Xiang, Qiyi Zhang, Xudong Pan, Geng Hong, Yuan Zhang, Min Yang

机构 * Fudan University(复旦大学)

AI总结 提出首个开源多靶场基础设施AgentCyberRange,集成110个漏洞和156个内部主机,评估前沿AI系统在真实网络攻击中的能力,发现GPT-5.5+Codex在web利用和后利用任务中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26195 2026-06-17 cs.CR cs.AI 版本更新

CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly

CyberEvolver:面向网络安全代理的即时结构化自我进化

Yihe Fan, Changyi Li, Lichen Xu, Xudong Pan, Jiarun Dai, Hong Geng, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究院)

AI总结 提出CyberEvolver框架,通过四层可进化架构、痕迹诊断机制和种群波束搜索,实现网络安全代理基于失败经验的支架自我进化,平均成功率提升13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21455 2026-06-17 stat.ML cs.LG 版本更新

Questioning the Coverage-Length Metric in Conformal Prediction: When Shorter Intervals Are Not Better

质疑共形预测中的覆盖-长度度量:当更短的区间并不更好时

Yizhou Min, Yizhou Lu, Lanqi Li, Zhen Zhang, Jiaye Teng

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学统计与数据科学学院) Department of Statistics and Data Science, Fudan University, Shanghai, China(复旦大学统计与数据科学系) Institute of Data Science and Statistics, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学数据科学与统计研究所)

AI总结 本文批判性检验共形预测中标准度量(覆盖率和区间长度)的充分性,揭示一种称为“偏见技巧”(PT)的反直觉方法可欺骗性地缩短区间长度而保持覆盖有效,并提出新度量“区间稳定性”以检测此类行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05797 2026-06-17 cs.LG cs.CE cs.RO 版本更新

EqCollide: Equivariant and Collision-Aware Deformable Objects Neural Simulator

EqCollide: 等变且碰撞感知的可变形物体神经模拟器

Qianyi Chen, Tianrun Gao, Chenbo Jiang, Tailin Wu

机构 * Westlake University(西交大大学) Fudan University(复旦大学) Tongji University(同济大学) McGill University(麦吉尔大学)

AI总结 提出首个端到端等变神经场模拟器EqCollide,通过等变编码器和碰撞感知消息传递的图神经网络常微分方程,实现可变形物体碰撞的准确、稳定和可扩展模拟。

Comments SIGKDD 2026 Oral AI4S Track. 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17029 2026-06-16 cs.CL 新提交

DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

DEEPRUBRIC: 基于证据树规则监督的高效深度研究智能体强化学习

Minghang Zhu, Chuyang Wei, Junhao Xu, Yilin Cheng, Zhumin Chen, Jiyan He

机构 * Shandong University(山东大学) Zhongguancun Academy(中关村学院) Fudan University(复旦大学)

AI总结 提出DeepRubric框架,通过构建证据树生成查询-规则对,确保奖励信号准确评估查询所需信息,以13倍少的RL GPU时间达到与先前最优模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16733 2026-06-16 cs.AI 新提交

A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions

LLM策略优化的第一性原理推导:从期望奖励到GRPO及其结构扩展

Jianghan Shen, Siqi Luo, Yue Li, Jiyao Liu, Wanying Qu, Yi Zhang, Ziyan Huang, Tianbin Li, Ming Hu, Xiaohong Liu, Yirong Chen, Junjun He

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Fudan University(复旦大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文从第一性原理出发,基于轨迹概率和奖励两个轴,统一分析了从REINFORCE、PPO到GRPO及其变体的LLM策略优化方法,揭示了设计选择背后的原理和复合失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16612 2026-06-16 cs.SD cs.LG cs.MM 新提交

Beyond Artifacts: Towards Generalizable Synthetic Song Detection via Music-Intrinsic Features

超越伪影:基于音乐内在特征的可泛化合成歌曲检测

Yan Han, Zhibin Wen, Yuan Wang, Shuangrun Shao, Xiaobing Li, Yang Xu, Wei Li

机构 * Central Conservatory of Music(中央音乐学院) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

AI总结 提出Sofia框架,通过特征特定专家和自适应混合专家模型利用音乐内在特征(人声、音频效果、全局结构)进行合成歌曲检测,在MUSIC8K基准上F1提升18.5点,具有强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16595 2026-06-16 cs.SD cs.AI 新提交

ArtNet: A JEPA-Like Articulatory Predictive Framework for Robust Zero-Shot Phoneme Recognition

ArtNet:一种类似JEPA的发音预测框架,用于鲁棒的零样本音素识别

Zeqian Hu, Fuliang Weng, Shu Shang, Yaqian Zhou

机构 * Fudan University(复旦大学) Pedawise

AI总结 提出ArtNet框架,通过基于发音特征的结构化预测任务和变分信息瓶颈抑制语言特定变化,在零样本跨语言音素识别中实现20.56%的音素错误率降低。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16075 2026-06-16 cs.LG cs.CV 新提交

AME: A Multi-Type Contributor Attribution Framework in Generative AI Markets

AME:生成式AI市场中的多类型贡献者归属框架

Yang Shi, Songwen Pei, Yang Gao, Bingxue Zhang

机构 * University of Shanghai for Science and Technology(上海理工大学) Fudan University(复旦大学)

AI总结 针对生成式AI中多阶段协作的价值分配问题,提出AME框架,整合异构数据贡献评估、数据权利映射和可信执行,实现与人类判断一致的低成本价值分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15733 2026-06-16 cs.CL cs.AI 新提交

Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning

Vernier: 探测因果推理中词汇间隙背后的表征错位

Zhenyu Yu

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 通过配对视图权重更新和激活修补,发现语言模型在因果推理中因变量名替换导致的答案差异源于表征错位而非信息丢失,并在Qwen和Llama模型上验证了反事实增强的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15730 2026-06-16 cs.LG cs.AI 新提交

InstantForget: Update-Free Backdoor Unlearning with Inference-Time Feature Reset

InstantForget: 无需更新的后门遗忘与推理时特征重置

Zhenyu Yu

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

AI总结 提出InstantForget方法,通过推理时特征重置实现无需参数更新的后门遗忘,利用马氏距离检测异常特征并重置为中性表示,在CIFAR-10上平均ASR降至0.071。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15681 2026-06-16 cs.CV 新提交

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation

自监督单目视频深度估计的3D一致性优化

Yuanye Liu, Ke Zhang, Junzhe Jiang, Li Zhang, Vishal Patel, Xiahai Zhuang

机构 * Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出一种将视频深度估计转化为多视图3D重建的框架,通过光度渲染、世界坐标对齐和多尺度时间梯度一致性约束,实现全局3D结构一致性,在自监督和零样本临床场景中达到最先进的空间精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15348 2026-06-16 q-bio.NC cs.AI 新提交

Intrinsic Computational Functionalism and Simulated Consciousness

内在计算功能主义与模拟意识

Ryota Kanai, Shuqin Ma

机构 * Araya Inc.(Araya公司) School of Philosophy, Fudan University(复旦大学哲学学院) Sussex Centre for Consciousness Science, University of Sussex(Sussex大学意识科学中心)

AI总结 本文从内在计算功能主义出发,提出机制丰富的规范结构,论证若意识是计算构成的,则任何满足内在因果-计算实现关系的系统(生物、人工或模拟)都实现相同的意识相关属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15327 2026-06-16 cs.LG 新提交

Semantic DLM+: Improving Diffusion Language Models through Bias-variance Trade-off in Transition Kernel Design

语义DLM+:通过转移核设计中的偏差-方差权衡改进扩散语言模型

Keyue Jiang, Yuxiang Wang, Yanan Zhao, Xiang Yu, Qifang Zhao, Bohan Tang, Baojian Zhou, Yanghua Xiao, Lin Qu, Xiaoxiao Xu

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学)

AI总结 本文通过分析泛化误差的三个关键因素,提出SemDLM+模型,通过全局转移和语义频率惩罚解决语义盆地问题,在LM1B和OpenWebText上提升了训练动态和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15258 2026-06-16 cs.AI 新提交

Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs

Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线

Jierui Zhang, Siyuan Tan, Xinhang Li, Longzhuangzhi Lin, Dailin Li, Chengfeng Gu, Xinping Li, Yaxian Hao, Shengjia Liang, Yuxiang Ren, Wenhao Liu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15188 2026-06-16 cs.CV 新提交

Adaptive Inference-Time Scaling via Early-Step Latent Verification for Image Editing

自适应推理时间缩放:基于早期步骤潜在验证的图像编辑

Yue Yu, Yang Jiao, Jiayu Wang, Qi Dai, Jingjing Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Microsoft Research Asia(微软亚洲研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所)

AI总结 提出VeriLatent框架,通过早期步骤潜在空间编辑激活图验证初始噪声,实现自适应推理时间缩放,提升图像编辑质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15186 2026-06-16 cs.SD cs.AI eess.AS 新提交

FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing

FreeSonic: 无需训练的时序感知解耦注意力用于精确音频编辑

Yuxuan Jiang, Mingyang Han, Yusheng Dai, Andong Wang, Tianhong Zhou, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Boyu Li, Jun Song, Cheng Yu, Bo Zheng, Weibei Dou, Zehua Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Monash University(蒙纳士大学) Renmin University of China(中国人民大学) Fudan University(复旦大学)

AI总结 提出FreeSonic,一种无需训练的框架,利用基于Rectified Flow的TangoFlux模型,通过优化反转-逆过程、联合文本-音频注意力图以及调度注意力解耦,实现精确且一致的音频编辑,同时保持背景保真度。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14791 2026-06-16 eess.AS cs.LG cs.SD 新提交

From Physics to Representation: Audio Learning with Synthetic Pre-training via Procedural Generation

从物理到表示:通过程序化生成进行合成预训练的音频学习

Fengrui Liu, Ruiyang Huang, Qijian Zheng, Yuanfang Wang, Feng Liu

机构 * East China Normal University(华东师范大学) Southeast University(东南大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出AudioPG框架,利用程序化合成生成波形进行掩码自编码器预训练,无需真实音频数据,在多个基准上取得高精度,且单GPU训练不到20分钟。

Comments Accepted to ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13674 2026-06-16 cs.CV 新提交

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM:基于表示视觉-动作分词器的世界动作建模

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Robbyant, Ant Group(蚂蚁集团 Robbyant) Hongkong University of Science and Technology(香港科技大学)

AI总结 提出RepWAM,一种基于表示视觉-动作分词器的世界动作模型,通过联合建模未来视觉状态和潜在动作,在真实和仿真机器人操作任务中取得优异性能。

Comments Project page: https://wdrink.github.io/RepWAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13053 2026-06-16 cs.RO cs.AI 新提交

EV-WM: Event-Verified World Models for Long-Horizon Robotic Manipulation

EA-WM: 基于任务规范基础的事件感知世界模型用于长时域操作

Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

机构 * AI Lab, Country Garden Services Group(碧桂园服务集团AI实验室) Fudan University(复旦大学) Omni AI

AI总结 提出EA-WM框架,通过事件预测和验证增强预训练特征世界模型,实现长时域操作中任务进展信号的可靠评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10862 2026-06-16 cs.CV cs.AI 新提交

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

LIBERO-Occ:通过视角想象评估和改进场景诱导遮挡下的视觉-语言-动作模型

Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

AI总结 针对VLA模型在场景遮挡下性能下降的问题,提出LIBERO-Occ基准和视角想象方法,通过生成互补视图提升鲁棒性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09365 2026-06-16 cs.AI cs.CL 版本更新

Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory

经验造就熟练:通过自进化技能记忆实现可泛化的医疗智能体推理

Haoran Sun, Wenjie Li, Yujie Zhang, Zekai Lin, Fanrui Zhang, Kaitao Chen, Xingqi He, Yichen Li, Mianxin Liu, Lei Liu, Yankai Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出SkeMex框架,通过技能记忆实现医疗智能体后部署自进化,无需更新模型权重,在临床任务中优于现有记忆型智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09977 2026-06-16 cs.CV 版本更新

A Survey on 3D Gaussian Splatting Applications: Segmentation, Editing, and Generation

3D高斯泼溅应用综述:分割、编辑与生成

Shuting He, Peilin Ji, Yitong Yang, Changshuo Wang, Jiayi Ji, Yinglin Wang, Henghui Ding

机构 * Shanghai University of Finance and Economics(上海财经大学) University College London(伦敦大学学院) Xiamen University(厦门大学) Fudan University(复旦大学)

AI总结 综述3D高斯泼溅在分割、编辑和生成三大任务中的应用,总结代表性方法、监督策略和学习范式,并分析公共基准上的比较结果。

Comments IEEE TPAMI, GitHub Repo: https://github.com/heshuting555/Awesome-3DGS-Applications

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04239 2026-06-16 cs.CV 版本更新

DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers

DiverseDiT:扩散Transformer中的多样化表示学习

Mengping Yang, Zhiyu Tan, Binglei Li, Xiaomeng Yang, Hesen Chen, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院)

AI总结 通过分析扩散Transformer的表示动力学,发现块间表示多样性是关键,提出DiverseDiT框架,利用长残差连接和多样性损失促进多样特征学习,在ImageNet上提升性能并加速收敛。

Comments Accepted in CVPR 2026, GitHub Code: https://github.com/kobeshegu/DiverseDiT, Project Page: https://forevermamba.work/projects/DiverseDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏