arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2509.24817 2026-03-24 cs.CV

UP2You: Fast Reconstruction of Yourself from Unconstrained Photo Collections

UP2You:从无约束照片集合中快速重建自己

Zeyu Cai, Ziyang Li, Xiaoben Li, Boqian Li, Zeyu Wang, Zhenyu Zhang, Yuliang Xiu

机构 * Westlake University(西湖大学) Nanjing University(南京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 UP2You通过数据校正方法高效处理无结构照片,实现高保真的3D人物重建,无需预设模板,提升几何精度和纹理保真度。

Comments Page: https://zcai0612.github.io/UP2You Code: https://github.com/zcai0612/UP2You

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01591 2026-03-24 eess.IV cs.AI cs.CV

Imaging foundation model for universal enhancement of non-ideal measurement CT

用于非理想测量CT通用增强的成像基础模型

Rongjun Ge, Yuxin Liu, Zhan Wu, Shangwen Yang, Yuan Gao, Chenyu You, Ge Wang, Shuo Li, Yuting He, Yang Chen

机构 * School of Instrument Science and Engineering, Southeast University, China(东南大学仪器科学与工程学院, 中国) School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院, 中国) Department of Radiology, Nanjing Drum Tower Hospital, Affiliated Hospital of Medical School, Nanjing University(南京鼓楼医院放射科, 南京大学附属医院) Shandong Fundamental Research Center for Computer Science, Qilu University of Technology (Shandong Academy of Sciences), China(山东省计算机科学基础研究中心, 青鲁科技大学(山东科学院), 中国) Department of Electrical & Computer Engineering, Yale University, USA(耶鲁大学电气与计算机工程系, 美国) Department of Biomedical Engineering, Rensselaer Polytechnic Institute, USA(雷士拉尔理工学院生物医学工程系, 美国) Department of Computer and Data Sciences, Case Western Reserve University, USA(凯斯西储大学计算机与数据科学系, 美国) Department of Biomedical Engineering, Case Western Reserve University, USA(凯斯西储大学生物医学工程系, 美国)

AI总结 本文提出TAMP模型,通过多尺度集成Transformer架构,提升非理想测量CT图像质量,适用于多种临床场景,实验验证其在医学影像中的有效性。

Comments This paper has been accepted by Nature Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02831 2026-03-23 cs.CV

Deep Face Restoration: A Survey

深度人脸修复:综述

Tao Wang, Kaihao Zhang, Jiankang Deng, Tong Lu, Wei Liu, Stefanos Zafeiriou

机构 * The State Key Lab for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Australian National University(澳大利亚国立大学) Imperial College London(伦敦帝国理工学院) Tencent(腾讯)

AI总结 本文综述了基于深度学习的人脸修复方法,分析了问题 formulations、挑战及最新技术,提供了系统评估和开源资源。

Comments Accepted by ACM Computing Surveys, 39 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19514 2026-03-23 cs.AI

Learning to Disprove: Formal Counterexample Generation with Large Language Models

学习以反驳:利用大语言模型进行形式反例生成

Zenan Li, Zhaoyu Li, Kaiyu Yang, Xiaoxing Ma, Zhendong Su

机构 * ETH Zurich(苏黎世联邦理工学院) University of Toronto(多伦多大学) MiroMind(MiroMind公司) Nanjing University(南京大学)

AI总结 本文通过微调大语言模型生成形式反例,解决数学推理中反例发现的不足,提出符号突变策略提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19284 2026-03-23 cs.NE cs.AI

CDEoH: Category-Driven Automatic Algorithm Design With Large Language Models

CDEoH:基于大语言模型的类别驱动自动算法设计

Yu-Nian Wang, Shen-Huan Lyu, Ning Chen, Jia-Le Xu, Baoliu Ye, Qingfu Zhang

机构 * Key Laboratory of Water Big Data Technology of Ministry of Water Resources(水利部水大数据技术重点实验室) College of Computer Science and Software Engineering, Hohai University(河海大学计算机科学与软件工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

AI总结 本文提出CDEoH,通过显式建模算法类别并平衡性能与多样性,提升进化稳定性,在多尺度组合优化问题中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10518 2026-03-23 cs.CV

VR-Thinker: Boosting Video Reward Models through Thinking-with-Image Reasoning

VR-Thinker: 通过图像推理提升视频奖励模型

Qunzhong Wang, Jie Liu, Jiajun Liang, Yilei Jiang, Yuanxing Zhang, Yaozhi Zheng, Xintao Wang, Pengfei Wan, Xiangyu Yue, Jiaheng Liu

机构 * CUHK MMLab(香港中文大学多模态实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Nanjing University(南京大学)

AI总结 本文提出VR-Thinker框架,通过图像推理操作和可配置视觉记忆窗口提升视频奖励模型的推理精度与可靠性,实现在视频偏好基准测试中达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18811 2026-03-20 cs.RO

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12702 2026-03-20 cs.RO

UDON: Uncertainty-weighted Distributed Optimization for Multi-Robot Neural Implicit Mapping under Extreme Communication Constraints

UDON:在极端通信限制下基于不确定性加权的多机器人神经隐式映射分布式优化

Hongrui Zhao, Xunlan Zhou, Boris Ivanovic, Negar Mehr

机构 * Department of Aerospace Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校航空航天工程系) School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) NVIDIA Research(NVIDIA研究) Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系)

AI总结 UDON提出一种实时多智能体神经隐式映射框架,通过引入不确定性加权分布式优化,在极端通信退化条件下实现高质量映射,实验表明其在低至1%通信成功率下仍能保持高保真重建。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18488 2026-03-20 cs.CV

TexEditor: Structure-Preserving Text-Driven Texture Editing

TexEditor: 保持结构的文本驱动纹理编辑

Bo Zhao, Yihang Liu, Chenfeng Zhang, Huan Yang, Kun Gai, Wei Ji

机构 * Nanjing University(南京大学) Shan Dong University(山东大学) Zhejiang University(浙江大学)

AI总结 本文提出TexEditor,通过数据和训练视角增强结构保持,利用TexBlender和StructureNFT提升纹理编辑效果,并引入TexBench验证其通用性。

Comments 19pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11052 2026-03-20 cs.RO

AdaptPNP: Integrating Prehensile and Non-Prehensile Skills for Adaptive Robotic Manipulation

AdaptPNP: 集成抓取与非抓取技能以实现适应性机器人操控

Jinxuan Zhu, Chenrui Tie, Xinyi Cao, Yuran Wang, Jingxiang Guo, Zixuan Chen, Haonan Chen, Junting Chen, Yangyu Xiao, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) RoboScience(机器人科学) East China Normal University(华东师范大学) Peking University(北京大学) Nanjing University(南京大学)

AI总结 本文提出AdaptPNP框架,通过视觉-语言模型整合抓取与非抓取技能,实现复杂机器人操控任务的规划与执行。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24910 2026-03-19 cs.CV

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

基于大规模自改进演示的目标导向视觉-语言导航学习

Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The University of Adelaide(阿德莱德大学) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出SID方法,通过自改进演示提升导航能力,实现高效探索和泛化,显著提升导航性能,达到新状态的SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17554 2026-03-19 cs.CV

Prompt-Free Universal Region Proposal Network

无提示通用区域提议网络

Qihong Tang, Changhan Liu, Shaofeng Zhang, Wenbin Li, Qi Fan, Yang Gao

机构 * Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出无提示通用区域提议网络PF-RPN,通过自适应查询嵌入和级联自提示模块实现无需外部提示的对象定位,适用于多种目标检测场景。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17328 2026-03-19 cs.AI cs.LG

A Progressive Visual-Logic-Aligned Framework for Ride-Hailing Adjudication

一种渐进式的视觉-逻辑对齐框架用于网约车责任判定

Weiming Wu, Zi-Jian Cheng, Jie Meng, Peng Zhen, Shan Huang, Qun Li, Guobin Wu, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Didichuxing Co. Ltd(滴滴出行有限公司)

AI总结 本文提出RideJudge框架,通过SynTraj合成轨迹模式和自适应上下文优化策略,解决网约车责任判定中的视觉与逻辑对齐问题,并采用有序敏感强化学习提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16927 2026-03-19 cs.CV eess.IV

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

利用大型视觉模型实现低空无线网络中多无人机协同感知

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba Cloud(阿里云) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

AI总结 本文提出一种通信高效的多无人机协同感知框架BHU,通过Top-K选择机制和Swin-large-based MaskDINO编码器提升感知性能,同时利用深度强化学习优化协作无人机选择和资源分配,实验表明在资源受限环境下感知性能提升超5%且通信开销降低85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24067 2026-03-19 cs.LG cs.AI

In-Context Compositional Q-Learning for Offline Reinforcement Learning

上下文组合Q学习用于离线强化学习

Qiushui Xu, Yuhao Huang, Yushu Jiang, Lei Song, Jinyu Wang, Wenliang Zheng, Jiang Bian

机构 * Penn State University(宾夕法尼亚州立大学) Nanjing University(南京大学) University of Toronto(多伦多大学) Microsoft Research(微软研究院)

AI总结 本文提出ICQL框架,通过上下文推理问题建模Q学习,利用线性Transformer适应性推断局部Q函数,实现有界近似误差和近优策略提取,实验显示在厨房任务中性能提升达16.4%。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03887 2026-03-19 cs.CV

OccTENS: 3D Occupancy World Model via Temporal Next-Scale Prediction

OccTENS: 通过时间下一尺度预测实现的3D占用世界模型

Bu Jin, Songen Gu, Xiaotao Hu, Yupeng Zheng, Xiaoyang Guo, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Horizon Robotics(地平线机器人) Nanjing University(南京大学)

AI总结 本文提出OccTENS,一种能高效生成高质量长期占用场景的生成模型,通过时间下一尺度预测任务解决效率、时间退化和可控性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16843 2026-03-18 cs.AI

Internalizing Agency from Reflective Experience

从反思经验中内化代理性

Rui Ge, Yichao Fu, Yuyang Qian, Junda Su, Yiming Zhao, Peng Zhao, Hao Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Nanjing University(南京大学)

AI总结 本文提出LEAFE框架,通过反思经验内化恢复代理性,提升长周期任务中的问题解决能力,实验显示在Pass@k任务中优于传统方法。

Comments 17 pages, 5 figures; Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16043 2026-03-18 cs.LG cs.AI cs.CV

Collaborative Temporal Feature Generation via Critic-Free Reinforcement Learning for Cross-User Sensor-Based Activity Recognition

通过无批评强化学习进行协作时间特征生成以实现跨用户基于传感器的活动识别

Xiaozhou Ye, Feng Jiang, Zihan Wang, Xiulai Wang, Yutao Zhang, Kevin I-Kai Wang

机构 * School of Artificial Intelligence (School of Future Technology), Nanjing University of Information Science and Technology(信息科学与技术大学人工智能学院) School of Cyberspace Security, Nanjing University of Information Science and Technology(信息科学与技术大学网络空间安全学院) Jinling Hospital, Affiliated Hospital of Medical School, Nanjing University(南京大学附属医院金陵医院) Department of Electrical, Computer, and Software Engineering, The University of Auckland(奥克兰大学电气、计算机和软件工程系)

AI总结 本文提出CTFG框架,利用无批评强化学习生成可迁移的时空特征,提升跨用户活动识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15228 2026-03-18 cs.CV

HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization

HYDRA:通过表征协调的标记化统一多模态生成与理解

Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文英) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Peking University(北京大学)

AI总结 HYDRA通过表征协调的标记化统一多模态生成与理解,提出了一种新的统一框架,在单一参数空间内整合感知与生成,实验表明其在视觉重建和生成任务中均取得新突破。

Comments Work in progress: We are actively scaling up the models. More updates coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20606 2026-03-18 cs.GT cs.CY cs.LG econ.TH

Strategic Costs of Perceived Bias in Fair Selection

公平选拔中的感知偏见战略成本

L. Elisa Celis, Lingxiao Huang, Milind Sohoni, Nisheeth K. Vishnoi

机构 * Yale University(耶鲁大学) Nanjing University(南京大学) IIT Bombay(印度理工学院班加罗尔分校)

AI总结 本文通过博弈论模型分析不同社会经济群体在感知后选择价值差异下的努力分配,揭示这种差异如何影响代表性、社会福利和效用,提出成本敏感优化框架以减少不平等。

Comments The paper has been accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23359 2026-03-18 cs.CV

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08979 2026-03-18 cs.LG q-bio.MN q-bio.QM

drGT: Attention-Guided Gene Assessment of Drug Response Utilizing a Drug-Cell-Gene Heterogeneous Network

drGT:利用药物-细胞-基因异构网络的注意力引导药物反应基因评估

Yoshitaka Inoue, Hunmin Lee, Tianfan Fu, Rui Kuang, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支) School of Computer Science, Nanjing University(南京大学计算机科学学院)

AI总结 drGT通过异构图深度学习模型,在药物、基因和细胞系间建立预测与机制解释的联系,实现了高回归精度和生物合理性,适用于多种数据集的预测和验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15401 2026-03-17 cs.SE cs.AI

SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?

SWE-Skills-Bench:代理技能在真实软件工程中的实际帮助有多大?

Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu

机构 * MBZUAI(莫扎德人工智能大学) Nanjing University(南京大学) South China University of Technology(华南理工大学) The University of New South Wales(新南威尔士大学)

AI总结 本文提出SWE-Skills-Bench,首个基于需求的基准,评估代理技能在真实软件工程中的边际效用,发现多数技能无明显提升,仅少数专业技能有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏