arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

共收录 1275
2408.10441 2026-06-01 cs.CL

Goldfish: Monolingual Language Models for 350 Languages

Goldfish: 面向350种语言的单语语言模型

Tyler A. Chang, Catherine Arnett, Zhuowen Tu, Benjamin K. Bergen

机构 * Department of Cognitive Science(认知科学系) Department of Linguistics(语言学系) Department of Computer Science(计算机科学系) University of California San Diego(加州大学圣地亚哥分校)

AI总结 针对低资源语言,发现大型多语言模型在基本语法生成上不如双元模型,而小规模单语模型在困惑度和语法性基准上表现更优,并发布了覆盖350种语言的1000多个单语模型套件Goldfish。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12500 2026-06-01 cs.LG stat.ME

Learning General Causal Structures with Hidden Dynamic Process for Climate Analysis

学习具有隐藏动态过程的通用因果结构用于气候分析

Minghao Fu, Biwei Huang, Zijian Li, Yujia Zheng, Ignavier Ng, Guangyi Chen, Yingyao Hu, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校) Johns Hopkins University, Baltimore, MD, USA(约翰·霍普金斯大学)

AI总结 提出统一框架CaDRe,联合发现观测变量间的因果关系和隐藏动态过程,在非参数设置下可识别,并在气候数据上验证了有效性和可解释性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05488 2026-06-01 cs.AI cs.CY

OLG++: A Semantic Extension of Obligation Logic Graph

OLG++:义务逻辑图的语义扩展

Subhasis Dasgupta, Jon Stephens, Amarnath Gupta

机构 * University of California San Diego(加州大学圣地亚哥分校)

AI总结 提出OLG++,通过引入空间、时间、当事人组、可废止性和逻辑分组等节点与边类型,扩展义务逻辑图以建模市政和跨司法管辖区的法规规则,并通过食品商业法规示例展示其在法律问答中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30345 2026-05-29 cs.AI cs.CL cs.LG

SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations

SchGen: 基于语义接地代码表示的PCB原理图生成

Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Microsoft Research Asia(微软亚洲研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 提出SchGen,首个从自然语言请求生成可编辑PCB原理图的大语言模型,通过语义接地代码表示将几何驱动问题转化为语义驱动匹配任务,并构建大规模数据集,在连线准确性和功能正确性上显著优于现有方法。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30283 2026-05-29 cs.AI cs.ET

mcp-proto-okn: Natural-language access to open scientific knowledge graphs through the Model Context Protocol

mcp-proto-okn:通过模型上下文协议实现对开放科学知识图谱的自然语言访问

Peter W. Rose, Benjamin M. Good, Amanda M. Saravia-Butler, Charlotte A. Nelson, James P. Balhoff, Yaphet Kebede, Patricia L. Whetzel, Christopher Bizon, Andrew I. Su, Sergio E. Baranzini

机构 * San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) The Scripps Research Institute(斯克里普斯研究所) Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学部门,NASA阿姆斯研究中心) Mate Bioservices(Mate生物服务) Renaissance Computing Institute, University of North Carolina at Chapel Hill(复兴计算研究所,北卡罗来纳大学夏洛特分校) Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,神经病学系,加州大学旧金山分校)

AI总结 提出基于模型上下文协议的服务器mcp-proto-okn,使AI助手能通过自然语言发现、查询和集成科学知识图谱,降低跨领域知识图谱分析门槛。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15239 2026-05-29 cs.LG

Size Transferability of Graph Transformers with Convolutional Positional Encodings

图Transformer的尺寸可迁移性与卷积位置编码

Javier Porras-Valenzuela, Zhiyang Wang, Xiaotao Shang, Yusu Wang, Alejandro Ribeiro

机构 * Department of Electrical and Systems Engineering(电气与系统工程系) University of Pennsylvania(宾夕法尼亚大学) University of California San Diego(圣地亚哥大学)

AI总结 通过图神经网络位置编码建立图Transformer与流形神经网络的联系,证明其在小图上训练后可泛化到大图,并在标准基准和实际地形最短路径估计任务中验证可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29505 2026-05-29 cs.CV

ESAM++: Efficient Online 3D Perception on the Edge

ESAM++:边缘上的高效在线3D感知

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco

机构 * Stanford University(斯坦福大学) Google(谷歌) UC San Diego(圣地亚哥大学)

AI总结 提出ESAM++,一种轻量级可扩展的在线3D场景感知方法,通过3D稀疏特征金字塔网络(SFPN)在边缘设备上实现高效、准确的3D实例分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29440 2026-05-29 cs.CL cs.AI cs.IR

SkillBrew: Multi-Objective Curation of Skill Banks for LLM Agents

SkillBrew: LLM智能体技能库的多目标策展

Wentao Hu, Zhendong Chu, Yiming Zhang, Junda Wu, Ming Jin, Xiangyu Zhao, Yilei Shao, Yanfeng Wang, Qingsong Wen

机构 * City University of Hong Kong(香港城市大学) Squirrel Ai Learning University of Science and Technology of China(中国科学技术大学) University of California, San Diego(加州大学圣地亚哥分校) Griffith University(格里菲斯大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出SkillBrew框架,将技能库策展建模为带效用约束的帕累托优化问题,通过双层提议-验证循环实现技能库的精简与多样性。

Comments 16 pages. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29153 2026-05-29 cs.LG cs.AI physics.comp-ph

Unveiling Multi-regime Patterns in SciML: Distinct Failure Modes and Regime-specific Optimization

揭示科学机器学习中的多机制模式:不同的失败模式与机制特定优化

Yuxin Wang, Yuanzhe Hu, Xiaokun Zhong, Xiaopeng Wang, Haiquan Lu, Tianyu Pang, Michael W. Mahoney, Yujun Yan, Pu Ren, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) University of California, San Diego(加州大学圣地亚哥分校) University of California, Berkeley(加州大学伯克利分校) National University of Singapore(新加坡国立大学) Lawrence Berkeley National Laboratory(伯克利国家实验室) International Computer Science Institute(国际计算机科学研究所)

AI总结 通过机制感知诊断框架,研究科学机器学习模型在不同超参数设置下的多机制行为,发现三种一致机制结构、优化效果的机制特异性以及精细失败模式,为提升鲁棒性提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28328 2026-05-28 cs.LG cs.AI

Learning the Error Patterns of Language Models

学习语言模型的错误模式

Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California-San Diego(加州大学圣地亚哥分校)

AI总结 提出前缀过滤器(prefix filters)来捕捉LLM在特定领域中的错误模式,并通过Palla算法高效学习这些过滤器,从而提升输出有效性,例如在TypeScript生成中将编译率提升60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28044 2026-05-28 cs.AI

Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

相关并不保证:引用RAG的证据力度校准

Pin Qian, Su Wang, Xiaoyuan Wang, Yihang Chen, Wenxuan Xu, Qiaolin Yu, Shuhuai Lin, Sipeng Zhang, Junxian You, Xinpeng Wei

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校) University of Glasgow(格拉斯哥大学)

AI总结 针对引用RAG中证据力度不足的问题,提出FORCEBENCH基准测试,通过对比证据校准声明与力度增强变体,评估模型在五个操作轴上的单调性,发现标准支持提示不足以校准证据力度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27921 2026-05-28 cs.AI cs.CL cs.CY cs.HC

Show, Don't TELL: Explainable AI-Generated Text Detection

展示,而非告知:可解释的AI生成文本检测

Aldan Creo, Suraj Ranganath

机构 * School of Computing, Information and Data Sciences(计算与数据科学学院) University of California, San Diego(加州大学圣地亚哥分校) United States of America(美国)

AI总结 提出一种名为TELL的新型可解释架构,通过内置解释机制和强化学习训练,在保持高检测性能(AUROC 0.927)的同时提供文本级注释,帮助用户基于自身判断识别AI生成文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27873 2026-05-28 cs.AI

AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models

AIBuildAI-2:一种用于自动构建AI模型的知识增强智能体

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

AI总结 针对现有自动构建AI模型的智能体因依赖大语言模型静态参数知识而性能受限的问题,提出AIBuildAI-2,通过引入分层、可进化的外部知识系统,动态加载相关上下文,实现设计决策的专家知识支撑,在MLE-Bench上取得70.7%奖牌率并在心脏病预测竞赛中排名前6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27649 2026-05-28 cs.CL cs.LG

Disentangling Language Roles in Multilingual LLM Task Execution

多语言大模型任务执行中的语言角色解耦

Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

机构 * Marquette(马凯特大学) Cornell(康奈尔大学) UC San Diego(南加州大学圣地亚哥分校) UPenn(普林斯顿大学) UT Austin(德克萨斯大学奥斯汀分校) Maryland(马里兰大学) Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) Melbourne(墨尔本大学) Stanford(斯坦福大学)

AI总结 提出MTM-Bench基准,通过完全交叉设计解耦指令、内容和响应三种语言角色,评估多语言LLM的任务执行能力,发现响应语言角色是性能下降的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15864 2026-05-28 cs.CV cs.CL

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉

Chufan Shi, Cheng Yang, Yaokang Wu, Linghao Jin, Bo Shui, Taylor Berg-Kirkpatrick, Xuezhe Ma

机构 * University of Southern California(南加州大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22769 2026-05-28 cs.AI cs.LG

AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications

AMA-Bench:评估智能体应用的长时记忆

Yujie Zhao, Boqin Yuan, Junbo Huang, Haocheng Yuan, Zhongming Yu, Haozhou Xu, Lanxiang Hu, Abhilash Shankarampeta, Zimeng Huang, Wentao Ni, Yuandong Tian, Jishen Zhao

机构 * UCSD(加州大学圣塔克拉拉分校) Recursive

AI总结 提出AMA-Bench基准,通过真实与合成轨迹评估LLM智能体的长时记忆,并基于因果图与工具增强检索提出AMA-Agent系统,在基准上提升11.16%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12468 2026-05-28 cs.LG cs.FL

Continuous Diffusion Models Can Obey Formal Syntax

连续扩散模型可以遵守形式语法

Jinwoo Kim, Taylor Berg-Kirkpatrick, Loris D'Antoni

机构 * Department of Computer Science and Engineering, University of California-San Diego, San Diego, USA(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

AI总结 提出一种无需训练的引导方法,利用正则表达式约束连续扩散语言模型的生成过程,使其满足形式语法,并在JSON和自然语言基准上实现68-96%的约束满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25981 2026-05-27 cs.CL

When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation

LLM 代理何时对表面噪声与语义噪声做出不同处理?一项基于 68 个单元格的测量研究及留出轨迹级验证

Liyun Zhang, Jiayi Guo

机构 * School of Information and Software Engineering, UESTC(信息与软件工程学院,电子科技大学) Jacobs School of Engineering, UC San Diego(工程学院,加州大学圣地亚哥分校)

AI总结 本研究通过 68 个单元格的测量实验,发现大语言模型驱动的思维链和 ReAct 代理对语义扰动(如释义、同义词)比表现扰动(如格式、重排序)更敏感,并基于留出模型和轨迹级机制分析提出了“隐蔽发散”解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26535 2026-05-27 cs.LG cs.AI cs.CV cs.NA math.NA

Recursive Flow Matching

递归流匹配

Jiahe Huang, Sihan Xu, Sharvaree Vadgama, Rose Yu

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Michigan(密歇根大学)

AI总结 提出递归流匹配(RecFM)框架,通过自一致性约束对齐不同离散化尺度的轨迹,实现高保真单步或少步(2-4步)动态生成,在科学基准上相比领先扩散模拟器加速20倍且提升预测精度。

Comments Project page: https://jhhuangchloe.github.io/RecFM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05204 2026-05-27 cs.CV

D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models

D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法

Dengyang Jiang, Xin Jin, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Ruoyi Du, Xiangpeng Yang, Qilong Wu, Zhen Li, Peng Gao, Harry Yang, Steven Hoi

机构 * The Hong Kong University of Science and Technology(香港科技大学) Z-Image Team, Alibaba Group(阿里集团Z-Image团队) University of California, San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。

Comments Project Page: https://vvvvvjdy.github.io/d-opsd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18103 2026-05-27 cs.AI

Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling

稳定性意味着冗余:Delta注意力选择性停止用于高效长上下文预填充

Yujie Chen, Tailai Chen, Yifeng Gao, Zoe Wanying He, Yijue Xu, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对长上下文场景中预填充计算成本高的问题,提出一种无需训练的Delta注意力选择性停止策略(DASH),通过监控自注意力层更新动态来停止稳定令牌的处理,从而在不牺牲模型准确性和硬件效率的前提下实现预填充加速。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25620 2026-05-26 cs.AI

Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations

回归简约潜在变量:从视觉基础学习以任务为中心的世界模型

Minghao Fu, Fan Feng, Nicklas Hansen, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

AI总结 提出TC-WM框架,通过将预训练视觉嵌入线性投影为紧凑潜在状态、对比学习对齐子空间并重建嵌入,将基础模型特征转化为任务充分的世界表示,实现更好的世界建模质量和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25357 2026-05-26 cs.CV cs.MA

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

面向可靠胎儿超声解读的多智能体协作

Xiaotian Hu, Mingxuan Liu, Junwei Huang, Kasidit Anmahapong, Yifei Chen, Yiming Huang, Xuguang Bai, Zihan Li, Hongjia Yang, Yingqi Hao, Hong Xu, Yu Jiang, Tian Tian, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) University of California San Diego(加州大学圣地亚哥分校) West China Second University Hospital, Sichuan University(四川大学西昌医学院)

AI总结 提出FetUSAgents多智能体系统,通过协作LLM代理和双路径证据仲裁(DPEA)整合视觉工具与临床推理,在胎儿超声VQA、报告生成等任务上超越最强基线25%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23853 2026-05-26 cs.AI

ClawTrace: Cost-Aware Tracing for LLM Agent Skill Distillation

ClawTrace: 面向LLM智能体技能蒸馏的成本感知追踪

Boqin Yuan, Yue Su, Renchu Song, Sen Yang, Jing Qin

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对技能蒸馏管道缺乏每步成本信号的问题,提出ClawTrace记录成本归因轨迹并生成TraceCard,通过CostCraft生成保留、剪枝和修复三类技能补丁,发现剪枝补丁作为质量护栏而保留补丁导致回归,主张按规则类型评估可复用技能。

Comments Accepted at Agent Skills '26 Workshop, ACM Conference on AI and Agentic Systems (CAIS 2026), San José, CA, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24929 2026-05-26 stat.ML cs.IT cs.LG math.IT

Estimating Mixture Distributions via Stochastic Mirror Descent

通过随机镜像下降估计混合分布

Mohammadreza Ahmadypour, Tara Javidi, Farinaz Koushanfar

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of California San Diego(加州大学圣地亚哥分校)

AI总结 针对从样本中估计未知分布的问题,提出基于随机镜像下降(SMD)的混合模型估计器族,通过选择Bregman散度实现灵活估计,在大规模候选分量下保持高效,并在KL散度和ℓ2范数下达到近最优收敛率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24765 2026-05-26 cs.CR cs.LG

CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering

CyberMaskQA: 一个用于评估大语言模型在网络安全问答中隐私意识的基准

Matilda Gaddi, Jin Noh, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, San Diego (UCSD)(加州大学圣地亚哥分校)

AI总结 针对现有基准缺乏隐私保护评估的问题,提出CyberMaskQA基准,通过结合人工场景与LLM语义扩展生成带隐私标签的数据集,以评估模型在网络安全问答中的推理与隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24752 2026-05-26 cs.LG cs.CC cs.DS math.PR

A computational phase transition for learning-to-sample from Ising models

从Ising模型中学习采样的计算相变

Andrej Risteski, Thuy-Duong Vuong

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, UC San Diego(加州大学圣地亚哥分校计算机科学与工程系)

AI总结 本研究构造了谱阈值以上的有界宽度Ising模型族,证明在标准密码学假设下学习采样是计算困难的,从而在谱阈值处建立了尖锐的计算相变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24405 2026-05-26 cs.LG cs.AI

Generative OOD-regularized Model-based Policy Optimization

生成式OOD正则化的基于模型的策略优化

Aysin Tumay, Jiahe Huang, Elise Jortberg, Rose Yu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Abiomed(阿比omed)

AI总结 提出GORMPO算法,利用生成式密度估计在稀疏状态-动作空间中限制策略更新到高密度区域,以解决离线强化学习中的分布外动作问题,并在真实医疗数据集和离线RL数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23898 2026-05-25 cs.AI

SPACENUM: Revisiting Spatial Numerical Understanding in VLMs

SPACENUM: 重新审视视觉语言模型中的空间数值理解

Jianshu Zhang, Yijiang Li, Huifeixin Chen, Haoran Lu, Letian Xue, Bingyang Wang, Han Liu

机构 * Northwestern(西北大学) UCSD(加州大学圣地亚哥分校) USC(南加州大学) GaTech(佐治亚理工学院)

AI总结 提出SpaceNum框架,通过Num2Space和Space2Num双向任务评估VLM在动态过渡和静态布局中对空间数值的理解,发现模型依赖浅层空间线索,难以建立稳定的坐标感知表示。

Comments Project page: https://sterzhang.github.io/SpaceNum-Home

详情

展开后加载摘要…

URL PDF HTML 收藏