arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3178
2511.21579 2025-12-01 cs.CV

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24693 2025-12-01 cs.SD cs.CL eess.AS

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

STAR-Bench:探测深度时空推理作为音频4D智能

Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。

Comments Homepage: https://internlm.github.io/StarBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23611 2025-12-01 physics.optics cs.LG

Spatially Parallel All-optical Neural Networks

空间并行全光神经网络

Jianwei Qin, Yanbing Liu, Yan Liu, Xun Liu, Wei Li, Fangwei Ye

机构 * School of Physics and Astronomy(物理与天文学院) Shanghai Jiao Tong University(上海交通大学) School of Electronic Engineering(电子工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Institute of Space Mechanics and Electricity(北京空间机械与电子研究所) China Academy of Space Technology(中国空间技术研究院) School of Physics(物理学院) Chengdu University of Technology(成都理工大学)

AI总结 本文提出了一种空间并行全光神经网络架构,通过并行处理提升计算精度与鲁棒性,为光学神经计算提供新的解决方案。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03143 2025-12-01 cs.CV

SARD: Segmentation-Aware Anomaly Synthesis via Region-Constrained Diffusion with Discriminative Mask Guidance

SARD: 通过区域约束扩散与判别掩码引导进行的分段感知异常合成

Yanshu Wang, Xichen Xu, Xiaoning Lei, Guoyang Xie

机构 * Global Institute of Future Technology(未来技术全球研究所) Shanghai Jiao Tong University(上海交通大学) Department of Intelligent Manufacturing(智能制造系) Contemporary Amperex Technology Co.,Ltd(当代电子技术有限公司)

AI总结 SARD通过区域约束扩散与判别掩码引导方法,提升工业异常检测系统的鲁棒性,实现更精确的像素级异常合成。

Comments Accepted by The 2025 International Conference on Machine Intelligence and Nature-InspireD Computing (MIND)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10562 2025-12-01 cs.RO cs.CV

Kalib: Easy Hand-Eye Calibration with Reference Point Tracking

Kalib: 通过参考点跟踪实现易于的机眼标定

Tutian Tang, Minghao Liu, Wenqiang Xu, Cewu Lu

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(电子信息与电气工程学院,上海交通大学) Meta Robotics Institute, Shanghai Jiao Tong University(元机器人研究所,上海交通大学) Qing Yuan Research Institute(青元研究院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合重点实验室,人工智能学院,上海交通大学)

AI总结 Kalib通过利用视觉基础模型的通用性,提出了一种无需复杂设置的机眼标定方法,实现了高精度与低手动工作量的平衡。

Comments The code, data, and supplementary materials are available at https://sites.google.com/view/hand-eye-kalib

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22687 2025-12-01 cs.SD eess.AS

PURE Codec: Progressive Unfolding of Residual Entropy for Speech Codec Learning

PURE 编码器:残差熵的渐进展开用于语音编码器学习

Jiatong Shi, Haoran Wang, William Chen, Chenda Li, Wangyou Zhang, Jinchuan Tian, Shinji Watanabe

机构 * CMU(卡内基梅隆大学) SJTU(上海交通大学)

AI总结 PURE编码器通过预训练语音增强模型指导多阶段量化,提升低比特率语音编码的训练稳定性与重建质量,尤其在嘈杂环境下表现优异。

Comments Accepted by ASRU2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22659 2025-12-01 cs.AI cs.CV

Geometrically-Constrained Agent for Spatial Reasoning

几何约束代理用于空间推理

Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室)

AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22167 2025-12-01 cs.CV cs.AI

IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer

IMTalker: 基于隐式运动传输的高效音频驱动说话人脸生成

Bo Chen, Tao Liu, Qi Chen, Xie Chen, Zilong Zheng

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

AI总结 IMTalker通过隐式运动传输实现高效音频驱动说话人脸生成,提升运动准确性与身份保持性,达到最先进的生成质量与效率。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21688 2025-12-01 cs.CV cs.AI cs.CL

G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

G$^2$VLM:基于几何的视觉语言模型,实现统一的3D重建与空间推理

Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) FDU(福建师范大学) ZJU(浙江大学) USTC(中国科学技术大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 G$^2$VLM通过统一3D重建与空间推理,提升视觉语言模型在空间智能任务中的性能。

Comments code are released at https://github.com/InternRobotics/G2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17138 2025-12-01 cs.CV

One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution

一步扩散变换器用于可控的现实世界图像超分辨率

Yushun Fang, Yuxiang Chen, Shibo Yin, Qiang Hu, Jiangchao Yao, Ya Zhang, Xiaoyun Zhang, Yanfeng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc(小红书公司)

AI总结 ODTSR通过噪声混合视觉流和保真度感知对抗训练,实现一步扩散变换器在现实世界图像超分辨率中的保真度与可控性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05244 2025-12-01 cs.AI cs.CL

WritingBench: A Comprehensive Benchmark for Generative Writing

WritingBench: 一个全面的生成写作评估基准

Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li, Shaopeng Lai, Yuran Ren, Zijia Wang, Ji Zhang, Mengyue Wu, Qin Jin, Fei Huang

机构 * Alibaba Group(阿里巴巴集团) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 WritingBench是一个用于评估生成写作能力的综合基准,通过查询依赖框架和微调批评模型,提升多领域写作任务的评估效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18842 2025-12-01 cs.CV

Enhancing Descriptive Image Quality Assessment with A Large-scale Multi-modal Dataset

通过大规模多模态数据集增强描述性图像质量评估

Zhiyuan You, Jinjin Gu, Xin Cai, Zheyuan Li, Kaiwen Zhu, Chao Dong, Tianfan Xue

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Sofia University(索菲亚大学) University of Macau(澳门大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本研究提出DepictQA-Wild模型,通过构建大规模多模态数据集提升图像质量评估的准确性和实用性。

Comments Accepted by TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00259 2025-12-01 cs.CL

AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

AutoHall: 自动化生成大语言模型的事实性幻觉数据集

Zouying Cao, Yifei Yang, XiaoJing Li, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)

AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。

Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21557 2025-11-27 cs.RO cs.AI

VacuumVLA: Boosting VLA Capabilities via a Unified Suction and Gripping Tool for Complex Robotic Manipulation

VacuumVLA: 通过统一的吸力和抓取工具提升VLA能力以实现复杂机器人操作

Hui Zhou, Siyuan Huang, Minxing Li, Hao Zhang, Lue Fan, Shaoshuai Shi

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) DiDi Global(滴滴出行)

AI总结 VacuumVLA通过整合吸力与抓取功能的末端执行器,提升VLA在复杂机器人操作中的能力,实现更多任务的可行性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00525 2025-11-27 cs.CV

Systematic Evaluation and Guidelines for Segment Anything Model in Surgical Video Analysis

手术视频分析中Segment Anything模型的系统评估与指南

Cheng Yuan, Jian Jiang, Kunyi Yang, Lv Wu, Rui Wang, Zi Meng, Haonan Ping, Ziyu Xu, Yifan Zhou, Wanli Song, Hesheng Wang, Yueming Jin, Qi Dou, Yutong Ban

机构 * Global College(全球学院) Shanghai Jiao Tong University(上海交通大学) Department of Automation(自动化系) National University of Singapore(新加坡国立大学) Department of Computer Science and Engineering(计算机科学与工程系)

AI总结 本文评估了SAM2模型在手术视频分割中的零样本能力,揭示其在结构化场景中的表现与动态手术条件下的局限性,为手术数据科学提供未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20604 2025-11-26 cs.CL cs.AI cs.LG

On Evaluating LLM Alignment by Evaluating LLMs as Judges

通过评估LLM作为裁判来评估LLM对齐

Yixin Liu, Pengfei Liu, Arman Cohan

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出AlignEval基准,通过评估LLM作为裁判的能力来衡量其对齐人类偏好的效果,结果优于现有自动评估基准。

Comments NeurIPS 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20549 2025-11-26 cs.CV cs.AI

Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning

Flash-DMD: 向高保真少步图像生成迈进:高效蒸馏与联合强化学习

Guanjie Chen, Shirui Huang, Kai Liu, Jianchen Zhu, Xiaoye Qu, Peng Chen, Yu Cheng, Yifu Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 Flash-DMD通过高效蒸馏和联合强化学习实现快速收敛,提升少步图像生成的保真度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20048 2025-11-26 cs.AI cs.LG cs.PF

Reducing Latency of LLM Search Agent via Speculation-based Algorithm-System Co-Design

通过基于猜测的算法-系统联合设计降低LLM搜索代理的延迟

Zixiao Huang, Wen Zeng, Tianyu Fu, Tengxuan Liu, Yizhou Sun, Ke Hong, Xinhao Yang, Chengchun Liu, Yan Li, Quanlu Zhang, Guohao Dai, Zhenhua Zhu, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence Lenovo(联想) Shanghai Jiao Tong University(上海交通大学)

AI总结 SPAgent通过基于猜测的算法-系统联合设计框架,减少LLM搜索代理的延迟,实现端到端加速并保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19910 2025-11-26 eess.IV cs.CV

DLADiff: A Dual-Layer Defense Framework against Fine-Tuning and Zero-Shot Customization of Diffusion Models

DLADiff: 一种双层防御框架,用于对抗扩散模型的微调和零样本定制

Jun Jia, Hongyi Miao, Yingjie Zhou, Linhan Cao, Yanwei Jiang, Wangqiu Zhou, Dandan Zhu, Hua Yang, Wei Sun, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Hefei University of Technology(合肥工业大学) East China Normal University(华东师范大学)

AI总结 DLADiff提出一种双层防御框架,通过双代理模型和交替动态微调有效防御扩散模型的微调和零样本生成攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25628 2025-11-26 cs.CL

EHR-R1: A Reasoning-Enhanced Foundational Language Model for Electronic Health Record Analysis

EHR-R1: 一种增强推理能力的基础语言模型用于电子健康记录分析

Yusheng Liao, Chaoyi Wu, Junwei Liu, Shuyang Jiang, Pengcheng Qiu, Haowen Wang, Yun Yue, Shuai Zhen, Jian Wang, Qianrui Fan, Jinjie Gu, Ya Zhang, Yanfeng Wang, Yu Wang, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Intelligence Healthcare Department, AntGroup(智能医疗部,蚂蚁集团) Intelligence Computing and Sensing Laboratory, Peking University(智能计算与感知实验室,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 EHR-R1是一种针对电子健康记录分析设计的增强推理能力的基础语言模型,通过大规模推理数据集和多阶段训练方法提升了EHR分析的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16274 2025-11-26 cs.LG cs.AI cs.DC cs.PF

STAlloc: Enhancing Memory Efficiency in Large-Scale Model Training with Spatio-Temporal Planning

STAlloc:通过时空规划提升大规模模型训练的内存效率

Zixiao Huang, Junhao Hu, Hao Lin, Chunyang Zhu, Yueran Tang, Quanlu Zhang, Zhen Guo, Zhenhua Li, Shengen Yan, Zhenhua Zhu, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学)

AI总结 STAlloc通过结合离线规划与在线分配,有效减少大规模模型训练中的内存碎片化,提升训练效率和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18525 2025-11-26 cs.CV

TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation

TK-Mamba:将KAN与Mamba结合用于文本驱动的3D医学图像分割

Haoyu Yang, Yutong Guan, Meixing Shi, Yuxiang Cai, Jintao Chen, Sun Bing, Wenhui Lei, Mianxin Liu, Xiaoming Shi, Yankai Jiang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Research Center, National Certification Technology (Hangzhou) Co., Ltd(国家认证技术(杭州)有限公司研究部) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学)

AI总结 TK-Mamba通过融合KAN与Mamba,提出文本驱动的3D医学图像分割方法,实现高效准确的多器官和肿瘤分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14909 2025-11-26 cs.LG cs.AI cs.CL

Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths

注意力跨度混合:通过异质滑动窗口长度优化LLM推理效率

Tianyu Fu, Haofeng Huang, Xuefei Ning, Genghan Zhang, Boju Chen, Tianqi Wu, Hongyi Wang, Zixiao Huang, Shiyao Li, Shengen Yan, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 MoA通过异质滑动窗口长度优化LLM推理效率,提升上下文长度和检索准确率,减少内存消耗并提高吞吐量。

Comments Published at CoLM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19024 2025-11-25 cs.CV cs.AI

Life-IQA: Boosting Blind Image Quality Assessment through GCN-enhanced Layer Interaction and MoE-based Feature Decoupling

Life-IQA: 通过GCN增强的层交互和MoE基于的特征解耦提升盲图像质量评估

Long Tang, Guoquan Zhen, Jie Hao, Jianbo Zhang, Huiyu Duan, Liang Yuan, Guangtao Zhai

机构 * College of Integrated Circuits, Shanghai Jiao Tong University(集成电路学院,上海交通大学) College of Integrated Circuits, Beijing University of Chemical Technology(集成电路学院,北京化工大学) ICCI and the Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(ICCI和图像通信与信息处理研究所,上海交通大学)

AI总结 Life-IQA通过GCN增强的层交互和MoE基于的特征解耦提升盲图像质量评估的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19011 2025-11-25 cs.RO

End-to-end Autonomous Vehicle Following System using Monocular Fisheye Camera

基于单目鱼眼摄像头的端到端自动驾驶跟车系统

Jiale Zhang, Yeqiang Qian, Tong Qin, Mingyang Jiang, Siyuan Chen, Ming Yang

机构 * department of Automation, Shanghai Jiao Tong University(自动化系,上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education(系统控制与信息处理重点实验室,教育部) Global Institute of Future Technology, Shanghai Jiao Tong University(未来技术全球研究院,上海交通大学)

AI总结 本文提出一种基于单目鱼眼摄像头的端到端自动驾驶跟车系统,通过语义掩码和动态采样机制提升驾驶性能,实现低成本的车辆编队应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18831 2025-11-25 cs.CV

VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction

VideoCompressa: 通过联合时间压缩和空间重建实现数据高效的视频理解

Shaobo Wang, Tianle Niu, Runkang Yang, Deshan Liu, Xu He, Zichen Wen, Conghui He, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) KTH(瑞典皇家理工学院) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

AI总结 VideoCompressa通过联合时间压缩和空间重建,实现视频数据高效合成,显著提升数据效率和模型性能。

Comments 15 pages, 6 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26213 2025-11-25 cs.CV

OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning

OmniDocLayout: 通过粗到细的LLM学习实现多样化的文档布局生成

Hengrui Kang, Zhuangcheng Gu, Zhiyuan Zhao, Zichen Wen, Bin Wang, Weijia Li, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学)

AI总结 OmniDocLayout通过粗到细的LLM学习方法,生成多样化文档布局,解决现有布局生成中多样性和复杂性不足的问题。

Comments TL;DR: With the proposed OmniDocLayout-1M dataset and the LLM-based coarse-to-fine learning strategy, we enable diverse and complex document layout generation that achieves both strong condition consistency and adherence to fundamental aesthetic principles

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏