arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2226
2603.29165 2026-04-01 cs.CV cs.AI cs.RO

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06753 2026-04-01 cs.CV

EarthBridge: A Solution for 4th Multi-modal Aerial View Image Challenge Translation Track

EarthBridge: 4th 多模态航空视图图像挑战翻译赛道的解决方案

Zhenyuan Chen, Guanyuan Shen, Feng Zhang

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出EarthBridge框架,通过Diffusion Bridge Implicit Models和Contrastive Unpaired Translation方法,实现EO、IR和SAR传感器间的高质量图像到图像翻译,解决了跨模态转换中的挑战,取得第二名成绩。

Comments accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22743 2026-04-01 cs.AI

Generative Data Transformation: From Mixed to Unified Data

生成数据变换:从混合到统一数据

Jiaqing Zhang, Mingjia Yin, Hao Wang, Yuxin Tian, Yuyang Ye, Yawen Li, Wei Guo, Yong Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出Taesar框架,通过对比解码机制生成统一序列数据,提升推荐模型性能,优于传统模型中心方法。

Comments Accepted by The Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28182 2026-03-31 cs.CV

A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps

对跨域少样本目标检测的深入研究:微调至关重要,平行解码器有所帮助

Xuanlong Yu, Youyang Sha, Longfei Liu, Xi Shen, Di Yang

机构 * Intellindust AI Lab(Intellindust AI实验室) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院)

AI总结 本文提出混合集成解码器提升微调泛化能力,结合统一渐进微调框架和plateau-aware学习率调度,验证了在CD-FSOD、ODinW-13和RF100-VL数据集上的有效性,尤其在10-shot设置中优于SAM3。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28162 2026-03-31 cs.CV

ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization

ColorFLUX:一种用于旧照片着色的结构-颜色解耦框架

Bingchen Li, Zhixin Wang, Fan Li, Jiaqi Xu, Jiaming Guo, Renjing Pei, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 本文提出基于生成扩散模型FLUX的新型旧照片着色框架,通过结构-颜色解耦策略和改进的直接偏好优化策略,提升旧照片着色的准确性与质量。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28046 2026-03-31 cs.AI

Dogfight Search: A Swarm-Based Optimization Algorithm for Complex Engineering Optimization and Mountainous Terrain Path Planning

狗群搜索:一种基于群体的优化算法,用于复杂工程优化和山地地形路径规划

Yujing Sun, Jie Cai, Xingguo Xu, Yuansheng Gao, Lei Zhang, Kaichen Ouyang, Zhanyu Liu

机构 * College of Science, Liaoning Technical University(辽宁工程技术大学理学院) School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Physics, University of Science and Technology of China(中国科学技术大学物理系)

AI总结 本文提出了一种名为狗群搜索(DoS)的新型元启发式算法,通过动力学位移积分方程构建搜索机制,在复杂工程优化和山地路径规划中表现出色,优于7种先进算法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21643 2026-03-31 cs.CV

Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation

Omni-Weather: 一种统一的多模态模型用于天气雷达理解和生成

Zhiwang Zhou, Yuandong Pu, Xuming He, Yidi Liu, Yixin Chen, Junchao Gong, Xiang Zhuang, Wanghan Xu, Qinglong Cao, Shixiang Tang, Yihao Liu, Wenlong Zhang, Lei Bai

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) UCLA(加州大学洛杉矶分校)

AI总结 Omni-Weather通过统一架构整合天气生成与理解,采用共享自注意力机制和因果推理数据集提升生成质量与可解释性,实验显示其在天气生成和理解上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27625 2026-03-31 cs.CV

Clore: Interactive Pathology Image Segmentation with Click-based Local Refinement

Clore:基于点击的病理图像分割交互式局部细化

Tiantong Wang, Minfan Zhao, Jun Shi, Hannan Wang, Yue Dai

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院)

AI总结 本文提出Clore方法,通过分层交互范式提升病理图像分割精度,减少交互次数,实现高效准确的局部细化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27301 2026-03-31 cs.CV

Dual-Path Learning based on Frequency Structural Decoupling and Regional-Aware Fusion for Low-Light Image Super-Resolution

基于频率结构解耦和区域感知融合的双路径学习用于低光照图像超分辨率

Ji-Xuan He, Jia-Cheng Zhao, Feng-Qi Cui, Jinyang Huang, Yang Liu, Sirui Zhao, Meng Li, Zhi Liu

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) The University of Electro-Communications(电气通信大学)

AI总结 本文提出DTP框架,通过频率感知解耦和区域感知融合提升低光照图像超分辨率,改进PSNR、SSIM和LPIPS指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27165 2026-03-31 cs.CV

RiskProp: Collision-Anchored Self-Supervised Risk Propagation for Early Accident Anticipation

RiskProp: 基于碰撞锚定的自监督风险传播用于早期事故预警

Yiyang Zou, Tianhao Zhao, Peilun Xiao, Hongyu Jin, Longyu Qi, Yuxuan Li, Liyin Liang, Yifeng Qian, Chunbo Lai, Yutian Lin, Zhihui Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Didi Chuxing(滴滴出行) University of Science and Technology of China(中国科学技术大学)

AI总结 RiskProp通过自监督学习消除对异常起始帧的依赖,利用可靠标注的碰撞帧建模时间风险演变,提升早期事故预警的准确性和可解释性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13688 2026-03-31 cs.GR cs.AI

CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion

CraftMesh: 通过泊松无缝融合实现高保真的生成网格操控

James Jincheng, Yuxiao Wu, Youcheng Cai, Ligang Liu

机构 * Hefei Thomas School(合肥托马斯学校) University of Science and Technology of China(中国科学技术大学)

AI总结 CraftMesh通过将网格编辑分解为2D和3D生成模型的联合流程,结合泊松几何融合与纹理和谐技术,实现复杂几何的高保真生成与无缝融合,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26800 2026-03-31 cs.LG cs.AI physics.flu-dyn

DSO: Dual-Scale Neural Operators for Stable Long-term Fluid Dynamics Forecasting

DSO:双尺度神经算子用于稳定长期流体动力学预测

Huanshuo Dong, Hao Wu, Hong Wang, Qin-Yi Zhang, Zhezheng Hao

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

AI总结 本文提出DSO双尺度神经算子,通过分离局部细节和全局趋势处理,提升长期流体预测的稳定性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26365 2026-03-30 cs.CV

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26328 2026-03-30 cs.CV

Verify Claimed Text-to-Image Models via Boundary-Aware Prompt Optimization

通过边界感知提示优化验证声称的文本到图像模型

Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Nankai University(南开大学) Beihang University(北京航空航天大学) University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出边界感知提示优化方法,通过识别模型特定的边界相邻提示来验证文本到图像模型的真实性,实验显示其验证准确率优越。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26262 2026-03-30 cs.CV cs.LG

GLASS: Geometry-aware Local Alignment and Structure Synchronization Network for 2D-3D Registration

GLASS:面向2D-3D配准的几何感知局部对齐与结构同步网络

Zhixin Cheng, Jiacheng Deng, Xinjun Li, Bohao Liao, Li Liu, Xiaotian Yin, Baoqun Yin, Tianzhu Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Meituan Inc(美团)

AI总结 本文提出GLASS网络,通过局部几何增强和图分布一致性模块,解决重复模式下2D-3D配准中的结构不一致问题,提升匹配精度。

Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26260 2026-03-30 cs.CV cs.AI

GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation

GeoGuide:基于层次几何引导的开放词汇3D语义分割

Xujing Tao, Chuxin Wang, Yubo Ai, Zhixin Cheng, Zhuoyuan Li, Liangsheng Liu, Yujia Chen, Xinjun Li, Qiao Li, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(深空探测全国重点实验室,深空探测实验室)

AI总结 GeoGuide提出了一种新的框架,通过预训练3D模型整合层次几何-语义一致性,以提升开放词汇3D分割的性能,通过不确定性基于的超点蒸馏模块和实例级掩码重建模块等方法增强局部语义一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14510 2026-03-30 cs.LG

LiteCache: A Query Similarity-Driven, GPU-Centric KVCache Subsystem for Efficient LLM Inference

LiteCache: 一种基于查询相似性的、以GPU为中心的KVCache子系统,用于高效的大语言模型推理

Jiawei Yi, Ping Gong, Youhui Bai, Zewen Jin, Shengnan Wang, Jiaqi Ruan, Jia He, Jiaan Zhu, Pengcheng Wang, Haibo Wang, Weiguang Wang, Xia Zhu, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Independent Researcher(独立研究者) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 LiteCache通过基于查询相似性的头粒度缓存算法QSAC,减少CPU开销,充分利用PCIe带宽,提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23997 2026-03-27 cs.CV

HGGT: Robust and Flexible 3D Hand Mesh Reconstruction from Uncalibrated Images

HGGT:从未校准图像中鲁棒且灵活的3D手形重建

Yumeng Liu, Xiao-Xiao Long, Marc Habermann, Xuanze Yang, Cheng Lin, Yuan Liu, Yuexin Ma, Wenping Wang, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Max-Planck-Institut für Informatik(马克斯·普朗克信息学研究所) Macau University of Science and Technology(澳门科技大学) Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出HGGT方法,通过将手形重建视为视觉-几何基础任务,首次联合推断3D手形和相机姿态,实现了从未校准视角的鲁棒性和灵活性,优于现有方法并在真实场景中表现优异。

Comments project page: https://lym29.github.io/HGGT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04033 2026-03-27 cs.CV

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

基于框架的思考:通过帧奖励模型生成视频失真评估

Yuan Wang, Borui Liao, Huijuan Huang, Jinda Lu, Ouxiang Li, Kuien Liu, Meng Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出REACT框架,通过帧级奖励模型评估生成视频的结构性失真,结合人类偏好数据集和高效合成流程,提升视频生成质量评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05228 2026-03-27 quant-ph cs.AI cs.SY eess.SY

Physics-Informed Evolution: An Evolutionary Framework for Solving Quantum Control Problems Involving the Schrödinger Equation

物理信息演化:用于求解涉及薛定谔方程的量子控制问题的进化框架

Kaichen Ouyang, Mingyang Yu, Zong Ke, Jun Zhang, Yi Chen, Huiling Chen

机构 * University of Science and Technology of China(中国科学技术大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学) Wenzhou University(温州大学) Hanyang University ERICA Campus(汉阳大学ERICA校区)

AI总结 本文提出物理信息演化框架,将物理定律信息融入进化算法适应度函数,用于求解量子控制问题,验证了该方法在三种基准测试中的有效性。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25077 2026-03-27 cs.CV

Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs

弥合感知与推理:用于多模态大语言模型中RLVR的标记重加权

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Guoyin Wang, Jiancan Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Independent Researcher(独立研究员)

AI总结 本文提出Token-Reweighting策略,通过动态重加权多模态大语言模型中的感知与推理标记,提升RLVR性能,实现视觉 grounding 和推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏