arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3167
2605.12523 2026-05-14 cs.CL cs.AI cs.HC

Exploring how EFL students talk to and through AI to develop texts

探索EFL学生如何与AI交流以发展文本

David James Woo, Yangyang Yu, Yilin Huang, Deliang Wang, Kai Guo, Chi Ho Yeung

机构 * Everwrite Limited(Everwrite有限公司) Shanghai Jiao Tong University(上海交通大学) The Education University of Hong Kong(香港教育大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文研究EFL学生通过提示工程和协商作者身份与AI互动,探讨其对写作表现的影响,发现不同的人机对话责任模式对写作表现无显著影响。

Comments 37 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12496 2026-05-13 cs.CV

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

CausalCine:多镜头视频叙事的实时自回归生成

Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) SJTU(上海交通大学)

AI总结 CausalCine通过自回归框架实现多镜头视频生成,通过动态提示和记忆路由保持跨镜头连贯性,优于现有自回归模型,实现实时交互生成。

Comments Project page: https://yihao-meng.github.io/CausalCine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12245 2026-05-13 cs.LG

SOAR: Scale Optimization for Accurate Reconstruction in NVFP4 Quantization

SOAR:在NVFP4量化中的尺度优化以实现准确重建

Chengzhu Bao, Xianglong Yan, Zhiteng Li, Guangshuo Qin, Guanghua Yu, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文心)

AI总结 本文提出SOAR框架,通过闭式联合尺度优化和解耦尺度搜索提升NVFP4量化精度,实验证明其在相同内存占用下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12240 2026-05-13 cs.AI

No Action Without a NOD: A Heterogeneous Multi-Agent Architecture for Reliable Service Agents

没有NOD就没有行动:一种异质多智能体架构用于可靠的服务代理

Zixu Yang, Hang Zheng, Nan Jiang, Zhiyang Tang, Situo Zhang, Xiaobao Wu, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国) Shanghai Innovation Institution, Shanghai, China(上海创新机构,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国)

AI总结 本文提出NOD架构,通过外部化全局状态和选择性外部监督,提升服务代理在长周期任务中的可靠性,实验表明其在任务成功率和关键动作精度上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12198 2026-05-13 cs.CV

Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation

通过可控生成增强在3D人体姿态估计中的领域泛化

Xinhao Hu, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

AI总结 本文提出可控人体姿态生成框架,通过系统变化姿态、背景和摄像机视角合成多样化视频数据,增强训练集多样性,提升模型泛化能力,验证了在处理领域差异方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12162 2026-05-13 cs.RO

X-Imitator: Spatial-Aware Imitation Learning via Bidirectional Action-Pose Interaction

X-Imitator:通过双向动作-姿态交互实现空间感知的模仿学习

Kai Xiong, Hongjie Fang, Lixin Yang, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出X-Imitator框架,通过双向动作-姿态交互解决机器人操作中空间感知与动作生成的耦合问题,实验表明其在24个模拟和3个现实任务中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12001 2026-05-13 cs.IT cs.AI math.IT

CR^2: Cost-Aware Risk-Controlled Routing for Wireless Device-Edge LLM Inference

CR²:面向无线设备-边缘LLM推断的成本感知风险控制路由

Nan Xue, Shengkang Chen, Zhiyong Chen, Jiangchao Yao, Yaping Sun, Zixia Hu, Meixia Tao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(合作中位网创新中心,上海交通大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信部,鹏城实验室) Future Network of Intelligent Institute (FNii), the Chinese University of Hong Kong (Shenzhen)(智能网络研究所(FNii),香港中文大学(深圳)) Meta

AI总结 本文提出CR²框架,通过分离轻量级设备模型与边缘模型的决策机制,优化无线边缘环境下的推断效率与成本,提升部署准确性与能耗平衡。

Comments submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11756 2026-05-13 cs.CV cs.AI

Focusable Monocular Depth Estimation

可聚焦的单目深度估计

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

AI总结 本文提出FDE,一种区域感知的单目深度估计方法,通过FocusDepth框架和MSSA模块,提升目标区域的深度精度和全局几何一致性,基于FDE-Bench验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11591 2026-05-13 cs.CV

Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration

Logit-Attention Divergence:通过注意力引导的校准缓解多图像检索中的位置偏差

Mingtao Xian, Yifeng Yang, Qinying Gu, Xinbing Wang, Nanyang Ye

机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学紫阳学院) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

AI总结 本文提出一种无需训练的注意力引导去偏框架,通过利用内在注意力信号在推理时进行实例级校正,显著提升排列不变性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11577 2026-05-13 cs.CL

BitLM: Unlocking Multi-Token Language Generation with Bitwise Continuous Diffusion

BitLM:通过位连续扩散解锁多令牌语言生成

Shaobin Zhuang, Yuang Ai, Jiaming Han, Xiaohui Li, Huaibo Huang, Xiangyu Yue, Xuefeng Hu, Kun Xu, Yali Wang, Hao Chen

机构 * Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(中大香港机器学习实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 BitLM通过位连续扩散模型实现多令牌并行生成,结合因果注意力与联合词决策,提升预训练效率和推理速度,证明单令牌生成并非必要。

Comments 12 pages, 4figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11550 2026-05-13 cs.CV

The DAWN of World-Action Interactive Models

世界-动作交互模型的黎明

Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

机构 * COWARobot Co. Ltd(COWARobot有限公司) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学)

AI总结 本文提出WAIMs,通过DAWN模型在语义潜在空间中实现世界预测与动作生成的交互,提升自动驾驶中的规划性能与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11541 2026-05-13 cs.CV

GeoR-Bench: Evaluating Geoscience Visual Reasoning

GeoR-Bench:评估地质学视觉推理

Yushuo Zheng, Zicheng Zhang, Huiyu Duan, Chunyi Li, Zijian Chen, Ziheng Jia, Yue Shi, Ke Gu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Technology(北京理工大学)

AI总结 GeoR-Bench通过推理引导的视觉编辑任务评估地质学视觉推理,包含440个样本涵盖6类地质学领域和24种任务类型,揭示地质学推理仍是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10980 2026-05-13 cs.LG cs.AI

LEAP: Unlocking dLLM Parallelism via Lookahead Early-Convergence Token Detection

LEAP: 通过前瞻性早期收敛令牌检测解锁dLLM并行性

Haohui Zhang, Zhiye Wang, Xiaoying Gan, Xinbing Wang, Bo Jiang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 LEAP通过前瞻性早期收敛令牌检测方法,有效降低dLLM解码延迟和步骤,减少约30%的去噪步骤,提升并行解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09003 2026-05-13 cs.CV

FlashClear: Ultra-Fast Image Content Removal via Efficient Step Distillation and Feature Caching

FlashClear: 通过高效的步骤蒸馏和特征缓存实现超快图像内容移除

Yixin Tang, Jiawei Guo, Junxian Li, Zhiteng Li, Jixin Zhao, Bingya Zhang, Chenbo Wang, Yulun Zhang, Shangchen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Honor Device Co., Ltd(荣耀设备有限公司)

AI总结 本文提出FlashClear,通过区域感知对抗蒸馏和前景优先的注意力与缓存策略,实现高效内容移除,实验表明其在保持性能的同时显著提升速度,达到8.26倍和122倍的加速。

Comments Code: https://github.com/GuoCalix/FlashClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10887 2026-05-12 cs.CV

Count Anything at Any Granularity

按任意粒度计数

Chang Liu, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(人工智能学院,上海交通大学,中国) CMIC, Shanghai Jiao Tong University, China(计算机医学研究所,上海交通大学,中国)

AI总结 本文提出多粒度计数框架,通过显式定义计数粒度解决开放世界计数问题,构建了最大的标注数据集KubriCount,并训练了HieraCount模型提升计数精度与泛化能力。

Comments Project page: https://verg-avesta.github.io/KubriCount/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10859 2026-05-12 cs.CV cs.LG

Masked Generative Transformer Is What You Need for Image Editing

你需要Masked Generative Transformer来进行图像编辑

Wei Chow, Linfeng Li, Xian Sun, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu

机构 * ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出EditMGT框架,利用Masked Generative Transformers实现局部化编辑,通过多层注意力整合和区域保持采样提升编辑精度,使用CrispEdit-2M数据集在多个基准上取得最佳性能。

Comments CVPR 2026 HiGen Workshop; Project Page at https://weichow23.github.io/EditMGT/ GitHub at https://github.com/weichow23/EditMGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10845 2026-05-12 cs.CV cs.CL

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

BabelDOC: 通过中间表示实现更好的布局保持PDF翻译

Qi Yang, Xiangyao Ma, Xiao Wang, Hao Wang, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University, Shanghai, China(1 上海大学计算机工程与科学学院,上海,中国) Funstory.ai Limited, Hong Kong SAR, China(2 Funstory.ai有限公司,香港特别行政区,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(3 上海交通大学计算机科学与工程系,上海,中国)

AI总结 BabelDOC通过中间表示框架实现布局保持的PDF翻译,解决语言处理与布局保持的矛盾,提升翻译精度和文档一致性。

Comments ACL 2026 System Demonstration paper. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10756 2026-05-12 cs.CV

TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection

TINS: 测试时ID-原型分离的负语义学习用于OD检测

Yifeng Yang, Jubo Feng, Jing Xu, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科学与技术大学)

AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10676 2026-05-12 cs.CV cs.LG

Not Blind but Silenced: Rebalancing Vision and Language via Adversarial Counter-Commonsense Equilibrium

非盲目而是被沉默:通过对抗性反常识平衡视觉与语言

Qingxin Xiao, Peilin Zhao, Yangyang Zhao, Lingwei Dang, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Institute for Super Robotics (Huangpu)(机器人研究所(黄埔)) Shanghai Jiao Tong University(上海交通大学) Changsha University of Science and Technology(长沙理工大学)

AI总结 本文提出ACE框架,通过对抗性反常识补丁扰动视觉上下文,动态平衡语言先验与视觉信息,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10634 2026-05-12 cs.AI

Teacher-Aware Evolution of Heuristic Programs from Learned Optimization Policies

具有教师意识的从学习优化策略中演化启发式程序

Minyu Chen, Song Qin, Ling-I Wu, Jianxin Xue, Guoqiang Li

机构 * Shenzhen Technology University(深圳科技大学) Shanghai Polytechnic University(上海理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种教师意识的进化框架,利用独立训练的优化策略作为行为教师,通过查询教师对候选启发式程序状态的动作偏好来指导进化,提升调度、路由和图优化任务的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10429 2026-05-12 physics.chem-ph cs.AI

Physical probes expose and alleviate chemical-environment collapse in molecular representations

物理探针揭示并缓解分子表示中的化学-环境崩溃

Jiebin Fang, Zidi Yan, Churu Mao, Yongjun Jiang, Xinyi Tang, Lei Miao, Dan Lu, Yun Huang, Wanjing Ding, Zhongjun Ma

机构 * Hainan Institute, Zhejiang University(浙江大学海南研究院) Institute of Marine Biology and Pharmacology, Ocean College, Zhejiang University(浙江大学海洋学院海洋生物学与药理研究所) School of Food and Pharmacy, Zhejiang Ocean University(浙江海洋大学食品学院) Hangzhou Bio-Sincerity Pharmaceutical Technology Company Limited(杭州生物 sincerity 药业技术有限公司) School of Pharmaceutical Sciences, Shanghai Jiao Tong University(上海交通大学药学院)

AI总结 本文提出CLAIM框架,通过对比学习恢复化学分辨率,提升分子光谱检索,并在多种分子属性任务中实现有效应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10341 2026-05-12 cs.AI cs.SE

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

PaperFit:科学文档中的视觉闭环排版优化

Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 PaperFit通过视觉闭环优化将可编译的LaTeX文档转化为高质量PDF,解决排版问题并提升文档自动化流程的完整性。

Comments 47 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏