arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1177
2605.15301 2026-05-18 cs.AI

Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution

Solvita:通过代理进化增强大型语言模型以应对编程竞赛

Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen Liu, Shihao Li, Xinping Lei, Yifan Yao, Weihao Xie, Letian Zhu, Jiaheng Liu

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 Solvita通过闭环系统和可训练知识网络,使代理动态学习,提升编程竞赛任务的准确性和经验积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15224 2026-05-18 cs.AI cs.MA

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

ICRL: 通过强化学习学习内化自我批评

Jianbo Lin, Xiaomin Yu, Yi Xin, Yifu Guo, Zhuosong Jiang, Zhongqi Yue, Weishi Wang, Heqing Zou, Chengwei Qin, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) SAP Microsoft Research(微软研究院)

AI总结 本文提出ICRL框架,通过联合训练求解器和批评者,使求解器在无外部批评时也能自我改进,提升代理和数学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14716 2026-05-18 cs.GR cs.CV cs.LG

AnchorRoute: Human Motion Synthesis with Interval-Routed Sparse Contro

AnchorRoute: 通过区间路由稀疏控制的人体运动合成

Pengcheng Fang, Tengjiao Sun, Dongjie Fu, Xiaoyu Zhan, Yanwen Guo, Hansung Kim, Xiaohao Cai

机构 * University of Southampton(索姆塞特大学) Mogo AI Ltd.(Mogo AI有限公司) Nanjing University(南京大学)

AI总结 AnchorRoute通过稀疏锚点实现人体运动合成,结合生成与细化过程,提升稀疏控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14948 2026-05-15 cs.CV

ACE-LoRA: Adaptive Orthogonal Decoupling for Continual Image Editing

ACE-LoRA:适应性正交解耦用于持续图像编辑

Yuehao Liu, Weijia Zhang, Xuanming Shang, Zhizhou Chen, Yanhao Ge, Shanyan Guan, Chao Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) VIVO

AI总结 ACE-LoRA通过动态正则化框架解决持续图像编辑中的灾难性遗忘问题,采用适应性正交解耦和历史信息压缩策略,提出首个全面的CIE-Bench基准,验证方法在指令忠实度、视觉真实性和抗遗忘性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14773 2026-05-15 cs.LG cs.AI

Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training

超越选择范围:一种插拔式振荡数据量调度用于高效模型训练

Suorong Yang, Hanqi Zhu, Hai Gan, Fangjian Su, Guang Li, Furao Shen, Soujanya Poria

机构 * National University of Singapore(国立新加坡大学) Nanjing University(南京大学) Hokkaido University(北海道大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出PODS框架,通过动态调节数据选择比例,在保持优化稳定性的同时提升训练效率,实验显示其在多种任务中均能提升效率与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14731 2026-05-15 cs.GR cs.CV cs.SD

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

UMo:统一稀疏运动建模用于实时协同语音化身

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Mogo AI Ltd.(Mogo AI有限公司) University of Southampton(南安普顿大学)

AI总结 UMo通过统一稀疏运动建模架构,结合文本、音频和运动令牌,实现高效实时密集重建,提升面部表情和手势的高保真动画生成,同时在低延迟条件下保持精细的语音-运动对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14696 2026-05-15 cs.CV

EponaV2: Driving World Model with Comprehensive Future Reasoning

EponaV2:通过全面的未来推理驱动世界模型

Jiawei Xu, Zhizhou Zhong, Zhijian Shu, Mingkai Jia, Mingxiao Li, Jia-Wang Bian, Qian Zhang, Kaicheng Zhang, Jin Xie, Jian Yang, Wei Yin

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(PCA实验室、VCIP、计算机科学学院、南开大学) Horizon Robotics HKUST(香港科技大学) NJUPT(南京工程大学) NTU(国立台湾大学) Anyverse School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院、南京大学)

AI总结 本文提出EponaV2,一种新的驾驶世界模型范式,通过全面的未来推理实现高质量规划。模型通过预测更全面的未来表示,结合3D和语义模态,提升环境理解与现实推理能力,从而改进轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14416 2026-05-15 cs.AI

A Unified Knowledge Embedded Reinforcement Learning-based Framework for Generalized Capacitated Vehicle Routing Problems

面向通用有容量车辆路径问题的统一知识嵌入强化学习框架

Wen Wang, Xiangchen Wu, Liang Wang, Hao Hu, Xianping Tao

机构 * Nanjing University(南京大学)

AI总结 本文提出一种结合知识嵌入的强化学习框架,通过分解问题和动态规划提升解决有容量车辆路径问题的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07594 2026-05-15 cs.RO

MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents

MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆

Xin Ding, Xinrui Wang, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Liang Mi, Hanxin Zhu, Kun Li, Yunxin Liu, Zhibo Chen, Ting Cao

机构 * University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21174 2026-05-15 cs.LG

Breaking the Reasoning Horizon in Entity Alignment Foundation Models

突破实体对齐基础模型中的推理地平线

Yuanning Cui, Zequn Sun, Wei Hu, Kexuan Xin, Zhangjie Fu

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) University of Queensland(昆士兰大学) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证工程研究中心)

AI总结 本文提出基于并行编码策略的实体对齐基础模型,通过局部锚点引导信息流和合并关系图,有效解决实体对齐中长距离依赖捕捉问题,验证了模型在未见过的知识图谱上的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13457 2026-05-14 cs.CV

OP4KSR: One-Step Patch-Free 4K Super-Resolution with Periodic Artifact Suppression

OP4KSR:一种一步式无补丁4K超分辨率方法,具有周期性伪影抑制

Chengyan Deng, Pengbin Yu, Zhentao Chen, Wei Shen, Kai Zhang, Meng Li, Lunxi Yuan, Xue Zhou, Li Yu

机构 * School of Automation Engineering, University of Electronic Science and Technology of China(电子科技大学自动化工程学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

AI总结 OP4KSR提出一种基于Flux架构的一步式4K超分辨率方法,利用F16 VAE压缩降低内存消耗,同时通过RoPE基频重缩放和周期性损失抑制伪影,实现高效且高质量的4K超分辨率生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04804 2026-05-14 cs.CL

OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models

OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型

Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA)) Nanjing University(南京大学) The Hong Kong University of Science(香港科学大学) Sichuan University(四川大学) Peking University(北京大学)

AI总结 OmniSIFT通过非对称令牌压缩框架提升多模态大语言模型效率,采用时空视频修剪和视觉引导音频选择模块,实现低参数高鲁棒性。

Comments [ICML 2026] Code Link: https://github.com/dingyue772/OmniSIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13229 2026-05-14 cs.AI cs.SE

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

通过语法引导和语义感知的偏好优化改进代码翻译

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

AI总结 本文提出CTO方法,通过对比学习训练跨语言语义模型,结合编译器反馈实现代码翻译的语法和语义优化,实验表明其在C++、Java和Python翻译中表现优异。

Comments Accepted in the 35th International Joint Conference on Artificial Intelligence (IJCAI 2016)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12691 2026-05-14 cs.AI

On the Size Complexity and Decidability of First-Order Progression

关于一阶推进的大小复杂性与可判定性

Jens Classen, Daxin Liu

机构 * Department of People and Technology, Roskilde University, Denmark(罗斯基尔德大学人机技术系,丹麦) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国)

AI总结 本文研究了一阶推进在局部效应、正常和无环动作类中的大小复杂性,证明其在合理假设下仅呈多项式增长,并展示在可判定片段中推进保持可判定性。

Comments This is an extended version of an identically-titled paper accepted for publication at IJCAI 2026. This version contains an appendix with further proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07433 2026-05-14 cs.LG cs.CV

Data Agent: Learning to Select Data via End-to-End Dynamic Optimization

数据代理:通过端到端动态优化学习数据选择

Suorong Yang, Fangjian Su, Hai Gan, Ziqi Ye, Jie Li, Baile Xu, Furao Shen, Soujanya Poria

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出数据代理框架,通过端到端动态优化解决数据选择问题,提升训练效率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12201 2026-05-13 cs.SE cs.AI

Uncertainty Quantification for LLM-based Code Generation

基于大语言模型的代码生成的不确定性量化

Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

机构 * State Key Lab of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ETH Zürich(苏黎世联邦理工学院) Birkbeck, University of London(伦敦大学伯克贝克学院)

AI总结 本文提出RisCoSet方法,通过多重假设检验构建风险控制的预测集,用于大语言模型代码生成任务,有效减少代码移除并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12195 2026-05-13 cs.LG

Fair Conformal Classification via Learning Representation-Based Groups

基于表示学习的公平符合分类

Senrong Xu, Yanke Zhou, Yuhao Tan, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

机构 * State Key Lab of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Birkbeck, University of London(伦敦大学伯克贝克学院)

AI总结 本文提出一种公平符合推理框架,通过学习基于表示的群体构建预测集,确保在自适应识别的子群体上实现条件覆盖,提升分类任务的公平性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12013 2026-05-13 cs.CV cs.AI

L2P: Unlocking Latent Potential for Pixel Generation

L2P:解锁像素生成的潜在能力

Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Jiawei Chen, Zhuoqi Zeng, Wei Zhang, Chengjie Wang, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) Hainan-biuh(海南-比乌) Weess Gmbh(韦斯公司)

AI总结 本文提出L2P框架,通过利用预训练LDM的知识,高效构建像素空间模型,无需大量数据和计算资源,实现快速收敛和高分辨率生成。

Comments project page: https://nju-pcalab.github.io/projects/L2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11904 2026-05-13 cs.CV cs.AI

Beyond Point-wise Neural Collapse: A Topology-Aware Hierarchical Classifier for Class-Incremental Learning

超越点 wise 神经坍塌:一种拓扑感知的分层分类器用于类增量学习

Huiyu Yi, Zhiming Xu, Dunwei Tu, Zhicheng Wang, Baile Xu, Furao Shen

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,中国南京) School of Computer Science, Nanjing University, Nanjing, China(计算机科学学院,南京大学,中国南京) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,中国南京)

AI总结 本文提出 HC-SOINN 分类器,通过局部到全局的表示捕捉类 manifold 的拓扑结构,并引入 STAR 方法主动变形学习的拓扑以适应非线性特征漂移,实验验证了其在 manifold 变形下的鲁棒性。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11901 2026-05-13 cs.CR cs.AI

AccLock: Unlocking Identity with Heartbeat Using In-Ear Accelerometers

AccLock:利用耳内加速度计的心跳信号实现身份解锁

Lei Wang, Jiangxuan Shen, Xi Zhang, Dalin Zhang, Jingyu Li, Haipeng Dai, Chenren Xu, Daqing Zhang, He Huang

机构 * Soochow University(苏州大学) Macquarie University(麦考瑞大学) Aalborg University(奥尔堡大学) Peking University(北京大学) Nanjing University(南京大学)

AI总结 本文提出AccLock系统,通过耳内BCG信号提取用户特定特征,实现无交互的被动身份验证,具有零参与、环境噪声鲁棒性强等优势,实验表明其在33名参与者中达到3.13%的FAR和2.99%的FRR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09725 2026-05-13 cs.DC cs.LG

Efficient Remote KV Cache Reuse with GPU-native Video Codec

高效利用GPU原生视频编解码器实现远程KV缓存重用

Liang Mi, Weijun Wang, Jinghan Chen, Ting Cao, Haipeng Dai, Yunxin Liu

机构 * Nanjing University(南京大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 本文提出基于GPU原生视频编解码器的远程KV缓存重用方案,通过紧凑布局和高效传输减少TTFT,实验显示比现有方法提升3.51倍。

Comments Accepted by SIGCOMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11742 2026-05-13 cs.LG

Online Continual Learning with Dynamic Label Hierarchies

在线持续学习与动态标签层次结构

Xinrui Wang, Shao-Yuan Li, Bartłomiej Twardowski, Alexandra Gomez-Villa, Songcan Chen

机构 * College of Computer Science(计算机科学学院) Technology, Nanjing University of Aeronautics(技术学院,南京航空航天大学) MIIT Key Laboratory of Pattern Analysis(模式分析 MIIT 实验室) Computer Vision Center, Spain(西班牙计算机视觉中心) Computer Sciences Department, Universitat Autonoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系,西班牙) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) IDEAS Research Institute, Warsaw, Poland(华沙 IDEAS 研究院,波兰) Joint Laboratory of Spatial intelligent Perception(空间智能感知联合实验室)

AI总结 本文提出DHOCL框架,通过动态层次结构解决持续学习中的层次一致性与灾难性遗忘问题,HALO方法通过组织原型实现快速适应与知识整合。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11714 2026-05-13 cs.RO

Introducing Environmental Constraints to Grasping Strategies for Paper-Like Flexible Materials Using a Soft Gripper

引入环境约束以改进软夹具对纸张类柔性材料的抓取策略

Yi Dong, Yang Li, Jinjun Duan, Zhendong Dai

机构 * College of Mechanical and Electrical Engineering, Nanjing University(南京大学机械与电子工程学院) Jiangsu Key Laboratory of Bionic Materials and Equipment, Nanjing University of Aeronautics and Astronautics(江苏生物材料与设备重点实验室,南京航空航天大学)

AI总结 本文研究了使用通用软夹具抓取纸张类柔性材料的策略,通过环境约束分析其机械和运动模型,并设计评估系统验证材料和工况对抓取的影响。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08802 2026-05-13 cs.CV

CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

CoLVR: 通过对比优化增强探索性潜在视觉推理

Ziyang Ding, Linjian Meng, Yiming Wu, Yuhan Li, Yuhao Liu, Zhen Zhao

机构 * Shandong University(山东大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 CoLVR通过引入潜在对比训练框架,利用角度扰动引导学习多样化且探索性的表示,提升潜在视觉推理的探索能力,在VSP和Jigsaw任务中分别提升5.83%和8.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06218 2026-05-13 cs.LG

AffineLens: Capturing the Continuous Piecewise Affine Functions of Neural Networks

AffineLens:捕捉神经网络中的连续分段仿射函数

Yi Wei, Xuan Qi, Furao Shen, Jian Zhao, Vittorio Murino, Cigdem Beyan

机构 * State Key Laboratory of Novel Software Technology School of Intelligence Science and Technology Nanjing University, Jiangsu, China(软件新技术国家重点实验室 智能科学与技术学院 南京大学 江苏 中国) AI for Good Istituto Italiano di Tecnologia, Genoa, Italy DITEN University of Genoa, Genoa, Italy(AI for Good 意大利技术研究院,热那亚,意大利 DITEN 热那亚大学,热那亚,意大利) State Key Laboratory of Novel Software Technology School of Artificial Intelligence Nanjing University, Jiangsu, China(软件新技术国家重点实验室 人工智能学院 南京大学 江苏 中国) AI for Good Istituto Italiano di Tecnologia, Genoa, Italy Department of Computer Science University of Verona, Verona, Italy(AI for Good 意大利技术研究院,热那亚,意大利 计算机科学系 热那亚大学,热那亚,意大利)

AI总结 本文提出AffineLens框架,用于计算神经网络中分段仿射函数的超平面排列和多面体结构,通过可视化区域划分和决策边界,提供对神经网络表达性的深入分析。

详情

展开后加载摘要…

URL PDF HTML 收藏