arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-07-21 至 2026-07-21 共收录 6
2607.15619 2026-07-21 cs.CV 版本更新

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

StructGen:通过结构化上下文建模消除多参考图像生成中的歧义

Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) Institute of Big Data, Fudan University(复旦大学大数据研究院) Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际联合实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) MT Lab, Meitu Inc(美图公司MT实验室)

AI总结 研究多参考图像生成问题,现有方法因自然语言指令缺陷致效果不佳。提出StructGen,用结构化格式编码参考图像,构建数据集、训练框架和基准,实验证明其在语义对齐和生成一致性上优于现有方法。

Comments Project page: https://jianingpeng0382.github.io/StructGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20799 2026-07-21 cs.CV cs.AI 版本更新

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成

Yixuan Lai, Tianjia Shao, Weijia Dou, Siyu Zhu, Jingdong Wang

机构 * Fudan University(复旦大学) Baidu(百度)

AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06820 2026-07-21 cs.AI 版本更新

When Direct Prediction Fails: Evidence from LLM-Based Misinformation Risk Evaluation

超越表面判断:LLM生成虚假信息的人类基础风险评估

Zonghuan Xu, Xiang Zheng, Yutao Wu, Xingjun Ma

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) Deakin University(迪肯大学)

AI总结 本文研究LLM生成虚假信息的风险评估,发现LLM法官在整体评分、项目排序和信号依赖上与人类存在显著差异,且法官间一致性高于人类读者,表明内部一致性不能作为读者反应代理的有效证据。

Comments 9 pages, 1 figure. Substantially revised and reorganized version of arXiv:2604.06820 based on the same study and data; adds stricter participant filtering, held-out prediction analyses, and additional robustness checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02402 2026-07-21 cs.RO cs.AI cs.CV physics.app-ph 版本更新

SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation

SoMA:一种用于机器人软体操作的实-仿真神经模拟器

Mu Huang, Hui Wang, Kerui Ren, Linning Xu, Yunsong Zhou, Mulin Yu, Bo Dai, Jiangmiao Pang

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Shanghai Jiao Tong University, China(上海交通大学) The Chinese University of Hong Kong, China(香港中文大学) The University of Hong Kong, China(香港大学)

AI总结 SoMA是一种用于机器人软体操作的实-仿真神经模拟器,通过统一的潜在神经空间实现可控、稳定的长周期操作和泛化能力。

Comments Project page: https://city-super.github.io/SoMA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏