arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2507.01099 2026-05-19 cs.CV cs.AI cs.LG cs.RO

Geometry-aware 4D Video Generation for Robot Manipulation

面向机器人操作的几何感知4D视频生成

Zeyi Liu, Shuang Li, Eric Cousineau, Siyuan Feng, Benjamin Burchfiel, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

AI总结 本文提出了一种几何感知的4D视频生成模型,通过跨视角点图对齐进行训练,以确保生成视频在多视角下的3D一致性,从而在单个RGB-D图像输入下生成时空一致的未来视频序列,并在不依赖相机姿态的情况下实现稳定的视觉和空间对齐预测。

Comments ICLR 2026; Project website: https://robot4dgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00409 2026-05-19 eess.AS cs.AI cs.LG

Perceptual implications of automatic anonymization in pathological speech

病态语音中自动匿名化的人感知影响

Soroosh Tayebi Arasteh, Saba Afza, Tri-Thien Nguyen, Lukas Buess, Maryam Parvin, Tomas Arias-Vergara, Paula Andrea Perez-Toro, Hiu Ching Hung, Mahshad Lotfinia, Thomas Gorges, Elmar Noeth, Maria Schuster, Seung Hee Yang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universit\"at Erlangen-N\"urnberg, Erlangen, Germany. Department of Urology, Stanford University, Stanford, CA, USA. Department of Radiology, Stanford University, Stanford, CA, USA. Lab for AI in Medicine, RWTH Aachen University, Aachen, Germany. Department of Diagnostic Interventional Radiology, University Hospital RWTH Aachen, Aachen, Germany. Institute of Radiology, University Hospital Erlangen, Erlangen, Germany. Department of Foreign Language Education, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany. Department of Otorhinolaryngology, Head Neck Surgery, Ludwig-Maximilians-Universität München, Munich, Germany. Speech \& Language Processing Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany.

AI总结 本研究通过结构化协议评估自动匿名化病态语音的人感知影响,发现匿名化在不同疾病中存在显著差异,且感知质量下降,但临床严重程度评分保持稳定,同时发现感知结果与计算隐私指标脱钩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17271 2026-05-19 math.OC cs.LG

Scalable Bi-causal Optimal Transport via KL Relaxation and Policy Gradients

基于KL松弛和策略梯度的可扩展双因果最优传输

Haoyang Cao, Jesse Hoekstra, Renyuan Xu, Yumin Xu, Ruixun Zhang

机构 * Department of Applied Mathematics and Statistics, Data Science and AI Institute, and Mathematical Institute for Data Science, Johns Hopkins University(应用数学与统计学系、数据科学与人工智能学院以及数据科学数学研究所,约翰霍普金斯大学) Department of Statistics, Oxford-Man Institute of Quantitative Finance, and Nuffield College, University of Oxford(统计系、牛津-曼定量金融研究所以及牛津大学努尔菲尔德学院) Management Science & Engineering Department, Stanford University(管理科学与工程系,斯坦福大学) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文提出了一种基于KL松弛和策略梯度的可扩展双因果最优传输方法,通过引入KL惩罚项将硬约束转化为可处理的散度惩罚,从而解决连续分布和长时域下双因果耦合约束的计算难题,展示了在稳健子对冲和时间序列统计降缩等应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17198 2026-05-19 q-bio.NC cs.CV

MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

MIRAGE:鲁棒的多模态架构将fMRI到图像模型从视觉扩展到心理意象

Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda, Shuhb Khanna, Jonathan Xu, Paul S. Scotti, Thomas Naselaris

机构 * University of Minnesota(明尼苏达大学) Medical AI Research Center (MedARC)(医学人工智能研究中心 (MedARC)) University of Sydney(悉尼大学) Stanford University(斯坦福大学) Alljoined Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

AI总结 本文提出MIRAGE方法,通过多模态文本和图像特征训练,实现从脑活动解码心理意象,展示了在NSD-Imagery基准上SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17176 2026-05-19 cs.AI

CAREBench: Evaluating LLMs' Emotion Understanding by Assessing Cognitive Appraisal Reasoning

CAREBench: 通过评估认知评价推理来评估LLMs的情感理解

Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He

机构 * Department of Informatics(信息学院) King’s College London(伦敦国王学院) Institute of Psychology(心理学研究所) University of Tartu(塔尔图大学) Department of Psychology(心理学系) Stanford University(斯坦福大学) The Alan Turing Institute(艾伦·图灵研究所)

AI总结 本文提出CAREBench,首个全面标注认知评价推理、评价评分和多标签情感标注的基准,通过系统实验发现更强模型在某些任务上匹配或超越人类,但在评价推理和积极情绪识别上表现不足,揭示了当前模型未能内部化捕捉人类主观异质性的机制。

Comments 27 pages,18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02028 2026-05-19 cs.CL

Language models fail at extended rule following

语言模型在扩展规则遵循中表现不佳

Tianxiang Dai, Jonathan Fan

机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

AI总结 研究发现语言模型在重复应用规则时无法保持精确状态,即使增加模型规模和计算资源也无法克服这一缺陷,表明需要新的模型架构来实现可靠的规则遵循。

Comments for accessing the data and code for reproduction of the study, see https://txdai.github.io/counting-reliability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12243 2026-05-19 cs.RO

HandelBot: Real-World Piano Playing via Fast Adaptation of Dexterous Robot Policies

HandelBot:通过快速适应灵巧机器人策略实现真实世界钢琴演奏

Amber Xie, Haozhi Qi, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室)

AI总结 本文提出HandelBot框架,结合仿真策略和快速适应,通过两阶段流程实现高精度双手钢琴演奏,实验表明其在真实环境中的表现优于直接仿真部署。

Comments Website: https://amberxie88.github.io/handelbot

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20981 2026-05-19 cs.CL cs.AI cs.SI

Patients Speak, AI Listens: LLM-based Analysis of Online Reviews Uncovers Key Drivers for Urgent Care Satisfaction

患者发声,AI倾听:基于大语言模型的在线评论分析揭示了紧急护理满意度的关键驱动因素

Xiaoran Xu, Zhaoqian Xue, Chi Zhang, Jhonatan Medri, Junjie Xiong, Jiayan Zhou, Jin Jin, Yongfeng Zhang, Siyuan Ma, Lingyao Li

机构 * Electrical Engineering department, University of South Florida(佛罗里达州立大学电气工程系) Department of Biostatistics, Epidemiology and Bioinformatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与生物信息学系) Computer Science and Engineering department, University of South Florida(佛罗里达州立大学计算机科学与工程系) Mathematics & Statistics, University of South Florida(佛罗里达州立大学数学与统计学系) Department of Computer Science and Engineering, University of Missouri Science and Technology(密苏里科技大学计算机科学与工程系) School of Medicine, Stanford University(斯坦福大学医学院) Department of Computer Science, Rutgers University(罗格斯大学计算机科学系) Department of Biostatistics, Vanderbilt University(范德比尔特大学生物统计学系)

AI总结 本文利用大语言模型分析在线评论,揭示紧急护理满意度的关键因素,发现人际因素和运营效率是主要决定因素,其他因素在调整后无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16604 2026-05-19 cs.LG

R2V Agent: Teaching SLMs When to Ask for Help

R2V Agent:教SLMs何时请求帮助

Raghu Vamshi Hemadri, Humaira Firdowse Mohammed, Rishabh Maheshwary, Srivatsava Daruru, Sagar Davasam, Vikas Yadav, Srinivas Sunkara, Sai Rajeswar

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) University of California, San Diego(加州大学圣地亚哥分校) Stanford University(斯坦福大学) ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学)

AI总结 R2V-Agent通过风险校准的SLM-LLM路由框架提升交互代理的可靠性,结合小型语言模型策略、更强的教师LLM、轻量级过程验证器和校准的步骤路由器,在多个基准测试中显著提升性能与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16527 2026-05-19 cs.LG cs.AI

Hypergraph Pattern Machine: Compositional Tokenization for Higher-Order Interactions

超图模式机:用于高阶交互的组合分词

Kyrie Zhao, Zehong Wang, Tianyi Ma, Fang Wu, Xiangru Tang, Pietro Lio, Sheng Wang, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学) Stanford University(斯坦福大学) Yale University(耶鲁大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学)

AI总结 本文提出超图模式机,通过学习子集的组合模式,改进高阶交互的建模,从而在超图基准和真实案例中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16341 2026-05-19 cs.LG

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

Orth-Dion:消除分布式低秩谱优化中的几何不匹配

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Guillaume Rabusseau, Hiroki Naganuma

机构 * Keio University(庆应大学) Stanford University(斯坦福大学) Midwestern University(中西部大学) California Institute of Technology(加州理工学院) Mila Université de Montréal(蒙特利尔大学)

AI总结 Orth-Dion通过替换列归一化为右因子的QR正交化,解决分布式低秩谱优化中的几何不匹配问题,实现与Dion相同通信成本下的最优收敛率。

Comments 24 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14009 2026-05-19 cs.RO

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++: 基于视觉-语言模型的视觉无人机导航:高斯辐射场与可微动力学

Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)

AI总结 GRaD-Nav++提出一种轻量级视觉-语言-动作框架,通过可微强化学习在3D高斯点云模拟器中训练,实现基于自然语言指令的实时无人机导航,展示在多任务和多环境下的高效导航能力。

Comments Published in: IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

Journal ref Chen, Qianzhong, et al. "Grad-nav++: Vision-language model enabled visual drone navigation with gaussian radiance fields and differentiable dynamics." IEEE Robotics and Automation Letters 11.2 (2025): 1418-1425

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12648 2026-05-19 math.OC cs.LG

Glocal Smoothness: Line search and adaptive step sizes can help in theory too!

全球局部平滑性:线搜索和自适应步长在理论上也能有所帮助!

Curtis Fox, Aaron Mishkin, Sharan Vaswani, Mark Schmidt

机构 * Stanford University(斯坦福大学)

AI总结 本文提出全球局部平滑性概念,通过函数属性定义,允许用迭代无关常数界迭代复杂度,展示线搜索优于固定步长,且在某些情况下梯度下降比加速方法更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16255 2026-05-18 cs.DC cs.AI

Designing Datacenter Power Delivery Hierarchies for the AI Era

为AI时代设计数据中心电力交付层级

Grant Wilkins, Fiodar Kazhamiaka, Alok Gautam Kumbhare, Chaojie Zhang, Ricardo Bianchini

机构 * Stanford University(斯坦福大学) Microsoft Azure Research(微软Azure研究院)

AI总结 本文研究了AI时代数据中心电力交付层级设计的挑战,提出了一种评估框架,结合吞吐量、功率和成本指标,分析多资源短缺对部署容量、资本支出和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16054 2026-05-18 cs.LG cs.AI

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15855 2026-05-18 cs.CV

Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?

少即是多:我们是否需要为扩散模型的强化学习微调进行每一步优化?

Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 本文研究了扩散模型强化学习微调中优化步骤的影响,提出AdaScope方法通过动态控制训练时机提升生成质量并降低计算成本。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15564 2026-05-18 cs.LG cs.CE eess.IV

CrystalBoltz: End-to-End Protein Structure Determination via Experiment-Guided Diffusion for X-Ray Crystallography

CrystalBoltz:通过实验引导扩散实现端到端蛋白质结构确定用于X射线晶体学

Minseo Kim, Huanghao Mai, Jay Shenoy, Alec Follmer, Gordon Wetzstein, Frederic Poitevin

机构 * Stanford University(斯坦福大学) SLAC National Accelerator Laboratory(SLAC国家加速器实验室) UC Davis(加州大学戴维斯分校)

AI总结 CrystalBoltz通过实验引导扩散模型实现端到端蛋白质结构确定,利用贝叶斯推断优化原子结构,降低坐标RMSD和R因子,提升X射线晶体学结构确定效率。

Comments Project page: https://soniaminseokim.github.io/crystalboltz-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15221 2026-05-18 cs.RO cs.CV

Vision-Based Safe Human-Robot Collaboration with Uncertainty Guarantees

基于视觉的具有不确定性保证的人机协作

Jakob Thumm, Marian Frei, Tianle Ni, Matthias Althoff, Marco Pavone

机构 * Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系) Chair of Imaging and Computer Vision, RWTH Aachen University(亚琛工业大学影像与计算机视觉教授职位) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Department of Computer Engineering, Technical University of Munich(慕尼黑技术大学计算机工程系)

AI总结 本文提出一种基于视觉的人体姿态估计与运动预测框架,通过置信度保证实现安全的人机协作。结合aleatoric不确定性估计与OOD检测,提供高概率置信度的置信区间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04310 2026-05-18 cs.RO

frax: Fast Robot Kinematics and Dynamics in JAX

frax:基于JAX的快速机器人运动学与动力学

Daniel Morton, Marco Pavone

机构 * Departments of Mechanical Engineering and Aeronautics & Astronautics, Stanford University(机械工程系和航空与航天系,斯坦福大学)

AI总结 frax提供高性能纯Python接口,支持CPU、GPU和TPU,实现高效的实时控制与并行计算,适用于机器人运动学和动力学的高性能计算需求。

Comments ICRA 2026 Workshop on Frontiers of Optimization for Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07514 2026-05-18 cs.LG cs.AI cs.CV

A Unified View of Score-Based and Drifting Models

基于分数的和漂移模型的统一视角

Chieh-Hsin Lai, Bac Nguyen, Naoki Murata, Yuhta Takida, Toshimitsu Uesaka, Yuki Mitsufuji, Stefano Ermon, Molei Tao

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团) Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

AI总结 本文揭示漂移模型与基于分数生成模型的紧密联系,证明漂移本质上是分数匹配目标,通过核估计非参数化实现,而扩散模型则参数化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03243 2026-05-18 cs.RO

HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations

HoMMI:从人类示范中学习全身移动操作

Xiaomeng Xu, Jisang Park, Han Zhang, Eric Cousineau, Aditya Bhat, Jose Barreiros, Dian Wang, Jeannette Bohg, Shuran Song

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究院)

AI总结 本文提出HoMMI框架,通过人类示范直接学习全身移动操作,结合眼动感知增强数据收集能力,解决人机体感知差距问题,实现长周期移动操作任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19069 2026-05-18 cs.AI

Asking the Right Questions: Improving Reasoning with Generated Stepping Stones

问对问题:通过生成的中间步骤提升推理能力

Hengyuan Hu, Tingchen Fu, Minqi Jiang, Alexander H Miller, Yoram Bachrach, Jakob Nicolaus Foerster

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Oxford(牛津大学)

AI总结 本文研究了生成中间步骤对提升LLM推理能力的作用,提出ARQ框架通过生成问题增强推理过程,展示了生成问题的有效性和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16274 2026-05-18 cs.LG stat.ML

Regret and Sample Complexity of Online Q-Learning via Concentration of Stochastic Approximation with Time-Inhomogeneous Markov Chains

通过随机近似浓度分析的时间非齐次马尔可夫链的在线Q学习的后悔与样本复杂性

Rahul Singh, Siddharth Chandak, Eric Moulines, Vivek S. Borkar, Nicholas Bambos

机构 * MBZUAI, UAE(MBZUAI, 阿拉伯联合酋长国) Stanford University, USA(斯坦福大学, 美国) EPITA, France(EPITA, 法国) Indian Institute of Technology Bombay, India(印度班加罗尔理工学院, 印度)

AI总结 本文首次为无限时间折扣马尔可夫决策过程中的经典在线Q学习提供了后悔界,不依赖乐观或奖励项。通过分析退火Q学习并结合平滑ε_n-贪心探索方案,证明了近似O(N^{9/10})的后悔界,并获得样本复杂性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14671 2026-05-18 cs.CV

ART: Articulated Reconstruction Transformer

ART:关节重建转换器

Zizhang Li, Cheng Zhang, Zhengqin Li, Henry Howard-Jenkins, Zhaoyang Lv, Chen Geng, Jiajun Wu, Richard Newcombe, Jakob Engel, Zhao Dong

机构 * Reality Labs Research, Meta(Meta现实实验室) Stanford University(斯坦福大学)

AI总结 ART通过部分基于预测的方法,从稀疏多状态RGB图像中重建完整3D关节物体,实现了高效的关节物体重建。

Comments Project Page: https://kyleleey.github.io/ART/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05451 2026-05-18 cs.CV

ViewBridge: Curriculum Knowledge Distillation for Activity View-Invariance Under Extreme Viewpoint Changes

ViewBridge:用于极端视角变化下的活动视角不变性的课程知识蒸馏

Arjun Somayazulu, Efi Mavroudi, Changan Chen, Lorenzo Torresani, Kristen Grauman

机构 * UT Austin(得克萨斯大学奥斯汀分校) Meta AI Stanford University(斯坦福大学) Northeastern University(东北大学)

AI总结 本文提出ViewBridge框架,通过课程学习和知识蒸馏方法,在严重视角遮挡下学习丰富的视频表示,提升了极端视角变化下的活动识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15000 2026-05-15 cs.CL cs.AI

Quantifying and Mitigating Premature Closure in Frontier LLMs

对前沿大语言模型中过早闭合进行量化与缓解

Rebecca Handler, Suhana Bedi, Nigam Shah

机构 * Department of Medicine, Stanford University(斯坦福大学医学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系)

AI总结 本文研究了大语言模型在医疗任务中过早闭合的问题,通过评估五个前沿模型发现其在不确定情况下仍频繁给出答案,安全提示虽能减少错误,但仍有残留问题,需进一步验证医疗LLM是否能判断何时不应回答。

Comments 14 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14990 2026-05-15 cs.CV

Characterizing the visual representation of objects from the child's view

从儿童视角表征物体的可视化分析

Jane Yang, Tarun Sepuri, Alvin Wei Ming Tan, Khai Loong Aw, Michael C. Frank, Bria Long

机构 * Department of Psychology, University of California San Diego(加州大学圣地亚哥分校心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 研究分析了儿童日常经验中物体类别表征的视觉输入,发现常见物体如杯子、椅子占据主导地位,而多数类别出现频率低。尽管物体视角多样,但检测到的类别在上位类别中表现出更强的聚类特征。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01015 2026-05-15 cs.CV

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏