arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2801
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20615 2025-12-24 cs.CV

Active Intelligence in Video Avatars via Closed-loop World Modeling

通过闭环世界建模实现视频虚拟角色的主动智能

Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ORCA框架,通过闭环世界建模和双系统架构,实现视频虚拟角色的主动智能与目标导向行为。

Comments Project Page: https://xuanhuahe.github.io/ORCA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20469 2025-12-24 cs.AI

Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale

Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统

Linfeng Zhang, Siheng Chen, Yuzhu Cai, Jingyi Chai, Junhan Chang, Kun Chen, Zhi X. Chen, Zhaohan Ding, Yuwen Du, Yuanpeng Gao, Yuan Gao, Jing Gao, Zhifeng Gao, Qiangqiang Gu, Yanhui Hong, Yuan Huang, Xi Fang, Xiaohong Ji, Guolin Ke, Zixing Lei, Xinyu Li, Yongge Li, Ruoxue Liao, Hang Lin, Xiaolu Lin, Yuxiang Liu, Xinzijian Liu, Zexi Liu, Jintan Lu, Tingjia Miao, Haohui Que, Weijie Sun, Yanfeng Wang, Bingyang Wu, Tianju Xue, Rui Ye, Jinzhe Zeng, Duo Zhang, Jiahui Zhang, Linfeng Zhang, Tianhan Zhang, Wenchang Zhang, Yuzhi Zhang, Zezhong Zhang, Hang Zheng, Hui Zhou, Tong Zhu, Xinyu Zhu, Qingguo Zhou, Weinan E

机构 * DP Technology Beijing China(北京DP技术有限公司) AI for Science Institute Beijing China(北京AI for Science研究院) Shanghai Jiao Tong University Shanghai China(上海交通大学) Beihang University Beijing China(北京航空航天大学) Peking University Beijing China(北京大学) Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) Shanghai Innovation Institute Shanghai China(上海创新研究院) East China Normal University Shanghai China(华东师范大学) Zhongguancun Academy Beijing China(中关村学院) University of Science and Technology of China Hefei China(中国科学技术大学) Tongji University Shanghai China(同济大学) The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)

AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20056 2025-12-24 cs.AI cs.CV

Towards Generative Location Awareness for Disaster Response: A Probabilistic Cross-view Geolocalization Approach

迈向灾害响应的生成性位置感知:一种概率跨视角地理定位方法

Hao Li, Fabian Deuser, Wenping Yin, Steffen Knoblauch, Wufan Zhao, Filip Biljecki, Yong Xue, Wei Huang

机构 * Department of Geography, National University of Singapore(新加坡国立大学地理系) Institute of Distributed Intelligent Systems, University of the Bundeswehr Munich(联邦国防军 Munich 分布式智能系统研究所) Professorship of Big Geospatial Data Management, School of Engineering and Design, Technical University of Munich(慕尼黑技术大学工程与设计学院大数据管理教授职位) School of Environment and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与空间信息学院) Interdisciplinary Center for Scientific Computing, Heidelberg University(海德堡大学跨学科科学计算中心) Heidelberg Institute for Geoinformation Technology, Heidelberg University(海德堡大学地理信息科技研究所) Urban Governance and Design Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)城市治理与设计研究组) Department of Architecture, National University of Singapore(新加坡国立大学建筑系) Department of Real Estate, National University of Singapore(新加坡国立大学房地产系) College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院)

AI总结 本文提出ProbGLC方法,通过概率与确定性地理定位模型结合,提升灾害响应中的位置感知和定位准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09586 2025-12-24 cs.LG cs.AI

Environment Scaling for Interactive Agentic Experience Collection: A Survey

交互式代理经验收集的环境缩放:综述

Yuchen Huang, Sijia Li, Minghao Liu, Wei Liu, Shijue Huang, Zhiyuan Fan, Hou Pong Chan, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) King’s College London(伦敦国王学院) DAMO Academy, Alibaba Group(阿里云达摩院)

AI总结 本文综述了交互式代理经验收集中环境缩放的方法,从环境中心视角系统回顾了任务生成、执行和反馈阶段的代表性方法,并探讨了实现框架、挑战及未来研究方向。

Comments 22 pages, 5 figures, SEA Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12029 2025-12-24 q-bio.BM cs.AI cs.CE cs.LG

BConformeR: A Conformer Based on Mutual Sampling for Unified Prediction of Continuous and Discontinuous Antibody Binding Sites

BConformeR:一种基于互采样的构象模型,用于统一预测连续和不连续抗体结合位点

Zhangyu You, Jiahao Ma, Hongzong Li, Ye-Fan Hu, Jian-Dong Huang

机构 * Material Innovation Institute for Life Sciences and Energy The University of Hong Kong Hetao SZ-HK Cooperation Zone(生命科学与能源创新材料研究所 香港大学 河套 SZ-HK 合作区) Hong Kong Generative AI Research and Development Center The Hong Kong University of Science and Technology(香港生成式人工智能研究与发展中心 香港科学大学) Computational Immunology Centre BayVax Biotech Limited(计算免疫学中心 BayVax 生物技术有限公司) School of Biomedical Sciences The University of Hong Kong(生物医学科学学院 香港大学)

AI总结 BConformeR通过结合CNN和Transformer,提升对连续和不连续抗体结合位点的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17266 2025-12-24 cs.CL cs.AI

Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning

Select2Reason: 为长链推理实现高效的指令微调数据选择

Cehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research, International Digital Economy Academy(IDEA研究所,国际数字经济学院) Hithink RoyalFlush Information Network Co., Ltd(Hithink RoyalFlush信息网络有限公司)

AI总结 Select2Reason通过高效数据选择提升长链推理性能,实验证明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19686 2025-12-23 cs.CV

Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models

视觉感知的CoT:在统一模型中实现高保真的视觉一致性

Zixuan Ye, Quande Liu, Cong Wei, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文提出视觉感知的CoT方法,通过自适应视觉规划和迭代视觉修正提升统一模型的多模态生成能力,实现更高的视觉一致性。

Comments Project Page: https://zixuan-ye.github.io/VACoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19486 2025-12-23 cs.CV

Dynamic Stream Network for Combinatorial Explosion Problem in Deformable Medical Image Registration

动态流网络用于变形医学图像配准中组合爆炸问题

Shaochen Bi, Yuting He, Weiming Wang, Hao Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Case Western Reserve University(凯斯西储大学) Hong Kong Metropolitan University(香港理工大学)

AI总结 本文提出动态流网络DySNet,通过自适应流盆地和动态流注意力机制解决变形医学图像配准中的组合爆炸问题,实现更高效的特征建模与匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19240 2025-12-23 cs.CL cs.AI

ChemATP: A Training-Free Chemical Reasoning Framework for Large Language Models

ChemATP: 一种无需训练的化学推理框架用于大语言模型

Mingxu Zhang, Dazhong Shen, Qi Zhang, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 ChemATP通过构建原子级文本知识库,使冻结的大语言模型能够动态检索和推理化学知识,从而在无需训练的情况下实现高效的化学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18853 2025-12-23 cs.CV cs.HC

VizDefender: Unmasking Visualization Tampering through Proactive Localization and Intent Inference

VizDefender:通过主动定位和意图推断揭示可视化篡改

Sicheng Song, Yanjie Zhang, Zixin Chen, Huamin Qu, Changbo Wang, Chenhui Li

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) School of Computer Science and Technology(计算机科学与技术学院)

AI总结 VizDefender通过半脆弱水印和意图分析模块,主动定位和推断可视化篡改,有效检测和分析数据篡改与视觉编码篡改。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE PacificVis'26 TVCG Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23950 2025-12-23 cs.AI

InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback

InterMT:基于人类反馈的多轮交错偏好对齐

Boyuan Chen, Donghai Hong, Jiaming Ji, Jiacheng Zheng, Bowen Dong, Jiayi Zhou, Kaile Wang, Juntao Dai, Xuyao Wang, Wenqi Chen, Qirui Zheng, Wenxin Li, Sirui Han, Yike Guo, Yaodong Yang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 InterMT通过多轮多模态交互的偏好数据集探索,旨在提升多模态大模型的交互能力,结合人类反馈和专家注释,揭示多轮扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18822 2025-12-23 cs.AI cs.CL

AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting

AdaCtrl: 通过难度感知预算分配实现适应性与可控性推理

Shijue Huang, Hongru Wang, Wanjun Zhong, Zhaochen Su, Jiazhan Feng, Bowen Cao, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 AdaCtrl通过难度感知预算分配实现自适应推理控制,提升模型在不同任务中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14579 2025-12-23 cs.CV cs.AI

GSRender: Deduplicated Occupancy Prediction via Weakly Supervised 3D Gaussian Splatting

GSRender: 通过弱监督的3D高斯点划法实现去重的占用预测

Qianpu Sun, Changyong Shu, Sifan Zhou, Runxi Cheng, Yongxian Wei, Zichen Yu, Dawei Yang, Sirui Han, Yuan Chun

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Houmo AI Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 GSRender通过弱监督3D高斯点划法和射线补偿模块,有效减少占用预测中的重复问题,提升户外自动驾驶的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18411 2025-12-23 cs.CV cs.AI

AmPLe: Supporting Vision-Language Models via Adaptive-Debiased Ensemble Multi-Prompt Learning

AmPLe: 通过自适应去偏集成多提示学习支持视觉-语言模型

Fei Song, Yi Li, Jiangmeng Li, Rui Wang, Changwen Zheng, Fanjiang Xu, Hui Xiong

机构 * National Key Laboratory of Space Integrated Information System, Institute of Software, Chinese Academy of Sciences(中国科学院空间信息集成系统国家重点实验室,软件研究所) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 AmPLe通过自适应去偏集成多提示学习方法,解决模型-提示匹配偏差和样本-提示匹配偏差,提升视觉-语言模型在下游任务中的性能。

Comments Accepted by IJCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02800 2025-12-23 cs.CL

Survey and Experiments on Mental Disorder Detection via Social Media: From Large Language Models and RAG to Agents

面向社交媒体的抑郁症检测综述与实验:从大型语言模型和RAG到代理

Zhuohan Ge, Darian Li, Yubo Wang, Nicole Hu, Xinyi Zhu, Haoyang Li, Xin Zhang, Mingtao Zhang, Shihao Qi, Yuming Xu, Han Shi, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文综述并实验了基于社交媒体的抑郁症检测方法,探讨了LLM、RAG和代理系统在提升检测可靠性与推理能力中的应用。

Comments 20 pages, 10 figures. This is an extension of ICDEW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17726 2025-12-22 cs.CV

MambaMIL+: Modeling Long-Term Contextual Patterns for Gigapixel Whole Slide Image

MambaMIL+: 模型长期上下文模式以处理吉像素全切片图像

Qian Zeng, Yihui Wang, Shu Yang, Yingxue Xu, Fengtao Zhou, Jiabo Ma, Dejia Cai, Zhengyu Zhang, Lijuan Qu, Yu Wang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南方医科大学) th Hospital of Joint Logistic Support Force, PLA(联合后勤保障部队900医院) Department of Pathology, Zhujiang Hospital, Southern Medical University(病理学系,南方医科大学) Department of Computer Science and Engineering, the Department of Chemical and Biological Engineering, the Division of Life Science, the State Key Laboratory of Nervous System Disorders, Hong Kong University of Science and Technology(计算机科学与工程系、化学与生物工程系、生命科学 division、神经系统紊乱国家重点实验室,香港科学与技术大学) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)

AI总结 MambaMIL+通过整合空间上下文和长距离依赖建模,提升全切片图像分析的效率和鲁棒性。

Comments 18 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14280 2025-12-22 cs.CV

EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the Wild

EasyHOI: 释放大模型潜力以重建真实场景中的手-物体交互

Yumeng Liu, Xiaoxiao Long, Zemin Yang, Yuan Liu, Marc Habermann, Christian Theobalt, Yuexin Ma, Wenping Wang

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) Hong Kong University of Science and Technology(香港科学大学) Nanyang Technological University(南洋理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Texas A&M University(德克萨斯大学奥斯汀分校)

AI总结 EasyHOI利用大模型实现单视角下手-物体交互的重建,通过先验引导优化提升重建精度。

Comments Project page: https://lym29.github.io/EasyHOI-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16924 2025-12-19 cs.CV

The World is Your Canvas: Painting Promptable Events with Reference Images, Trajectories, and Text

世界是你的画布:通过参考图像、轨迹和文本绘画可提示事件

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Yue Yu, Yihao Meng, Wen Wang, Ka Leong Cheng, Shuailei Ma, Qingyan Bai, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) NEU(南京大学) CUHK(香港中文大学) NTU(南洋理工大学)

AI总结 WorldCanvas通过结合文本、轨迹和参考图像,实现可提示的多代理交互事件生成,提升世界模型的交互性和可控性。

Comments Project page and code: https://worldcanvas.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16915 2025-12-19 cs.CV

StereoPilot: Learning Unified and Efficient Stereo Conversion via Generative Priors

StereoPilot: 通过生成先验学习统一且高效的立体转换

Guibao Shen, Yihua Du, Wenhang Ge, Jing He, Chirui Chang, Donghao Zhou, Zhen Yang, Luozhou Wang, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学)

AI总结 StereoPilot通过生成先验学习实现高效立体转换,提升视觉保真度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13107 2025-12-19 cs.CV cs.AI

Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather

基于扩散的多模态3D物体检测在恶劣天气中的修复

Zhijian He, Feifei Liu, Yuwei Li, Zhanpeng Luo, Jintao Cheng, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Xingzhi College, South China Normal University(星智学院,华南师范大学) College of Big Data and Internet, Shenzhen Technology University(大数据与互联网学院,深圳科技大学) School of Data Science and Engineering, Xingzhi College, South China Normal University(数据科学与工程学院,星智学院,华南师范大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

AI总结 DiffFusion通过基于扩散的修复和自适应跨模态融合,提升多模态3D物体检测在恶劣天气中的鲁棒性与清洁数据性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00878 2025-12-19 cs.CL cs.AI

Less is More: Resource-Efficient Low-Rank Adaptation

少即是多:资源高效的低秩适应

Chunlin Tian, Xuyang Wei, Huanrong Liu, Zhijiang Guo, Li Li

机构 * University of Macau(澳门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 EffiLoRA通过统一A矩阵和动态B矩阵更新,在多种模型中实现更高效且鲁棒的低秩适应。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08697 2025-12-19 cs.SE cs.AI cs.CL

BigCodeArena: Unveiling More Reliable Human Preferences in Code Generation via Execution

BigCodeArena: 通过执行揭示更多可靠的代码生成人类偏好

Terry Yue Zhuo, Xiaolong Jin, Hange Liu, Juyong Jiang, Tianyang Liu, Chen Gong, Bhupesh Bishnoi, Vaisakhi Mishra, Marek Suppa, Noah Ziems, Saiteja Utpala, Ming Xu, Guangyu Song, Kaixin Li, Yuhan Cao, Bo Liu, Zheng Liu, Sabina Abdurakhmanova, Wenhao Yu, Mengzhao Jia, Jihan Yao, Kenneth Hamilton, Kumar Shridhar, Minh Chien Vu, Dingmin Wang, Jiawei Liu, Zijian Wang, Qian Liu, Binyuan Hui, Meg Risdal, Ahsen Khaliq, Atin Sood, Zhenchang Xing, Wasi Uddin Ahmad, John Grundy, David Lo, Banghua Zhu, Xiaoning Du, Torsten Scholak, Leandro von Werra

机构 * Monash University(墨尔本大学) CSIRO’s Data61(CSIRO的数据61) Purdue University(普渡大学) Independent(独立) HKUST (Guangzhou)(香港科技大学(广州)) UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) CNRS, France(法国国家科学研究中心) IBM Cisco(思科) Comenius University in Bratislava(布拉提斯拉瓦康门纽斯大学) University of Notre Dame(Notre Dame大学) Uber Tano Labs(Tano实验室) NUS(国立大学新加坡) Institute of Automation, CAS(中国科学院自动化研究所) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学) Nevsky Collective(Nevsky集体) ETH Zurich(苏黎世联邦理工学院) Detomo Inc(Detomo公司) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校) Google(谷歌) NVIDIA Singapore Management University(新加坡管理学院) ServiceNow Research(ServiceNow研究) Hugging Face

AI总结 BigCodeArena通过执行揭示更多可靠的代码生成人类偏好,提出自动评分基准评估LLM编码质量。

Comments Built with love by the BigCode community :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16295 2025-12-19 cs.AI

OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models

OS-Oracle: 一个跨平台GUI批评模型的综合框架

Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Qiushi Sun, Zhaoyang Liu, Zhoumianze Liu, Yu Qiao, Xiangyu Yue, Zun Wang, Zichen Ding

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港大学MMLab) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 OS-Oracle提出了一种跨平台GUI批评模型框架,通过合成数据和两阶段训练方法,实现了在移动、网页和桌面平台上的高效批评评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15716 2025-12-18 cs.CV cs.AI

Spatia: Video Generation with Updatable Spatial Memory

基于可更新空间记忆的视频生成

Jinjing Zhao, Fangyun Wei, Zhening Liu, Hongyang Zhang, Chang Xu, Yan Lu

机构 * The University of Sydney(悉尼大学) Microsoft Research(微软研究院) HKUST(香港科技大学) University of Waterloo(滑铁卢大学)

AI总结 Spatia通过可更新的空间记忆机制,实现视频生成中的长期空间与时间一致性,支持动态实体生成和3D交互编辑。

Comments Project page: https://zhaojingjing713.github.io/Spatia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15603 2025-12-18 cs.CV

Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition

Qwen-Image-Layered: 通过层分解实现内在可编辑性

Shengming Yin, Zekai Zhang, Zecheng Tang, Kaiyuan Gao, Xiao Xu, Kun Yan, Jiahao Li, Yilei Chen, Yuxiang Chen, Heung-Yeung Shum, Lionel M. Ni, Jingren Zhou, Junyang Lin, Chenfei Wu

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba(阿里巴巴)

AI总结 Qwen-Image-Layered通过层分解实现图像的内在可编辑性,提出端到端扩散模型及多阶段训练策略,提升图像分解质量与编辑一致性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏