arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-01 至 2026-06-01 共收录 90 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 30 篇

2605.30506 2026-06-01 cs.RO cs.CV 92%

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

VLM-GLoc:视觉语言模型增强的蒙特卡洛定位,用于杂乱准静态环境中的鲁棒语义全局定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 提出VLM-GLoc方法,利用开放词汇视觉语言模型作为统一语义观测前端,通过逆语义提议机制和文本到地图检索,在几何模糊和语义歧义的准静态环境中实现鲁棒全局定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31196 2026-06-01 cs.CV cs.AI cs.CL cs.RO 90%

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

探索视觉-语言模型中的碰撞接地以实现安全的人机协作

Jun Wang, Xiaohao Xu, Xiaonan Huang

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 针对安全人机协作,提出碰撞接地概念及物理基准TouchSafeBench,评估视觉-语言模型在分类当前安全状态和预警即将碰撞任务中的表现,发现现有模型不可靠,视觉流畅性不等于物理责任性。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31227 2026-06-01 cs.CV 86%

HiERO-StepG @ Ego4D Step Grounding Challenge: hierarchical activity understanding enables zero-shot step grounding

HiERO-StepG @ Ego4D Step Grounding Challenge: 层次化活动理解实现零样本步骤定位

Andrea Zenotto, Simone Alberto Peirone, Francesca Pistilli, Giuseppe Averta

机构 * Politecnico di Torino(托里诺理工大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 提出HiERO-StepG方法,利用弱监督层次化表示学习和聚类,无需任务特定微调即可实现零样本步骤定位,在Ego4D挑战中达到56.27% R@1 (IoU=0.3)。

Comments Technical report for the Ego4D Goal Step - Step Grounding challenge at CVPR 2026, derived from arXiv:2505.12911

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08145 2026-06-01 cs.CV cs.AI cs.LG 85%

Self-Captioning Multimodal Interaction Tuning: Amplifying Exploitable Redundancies for Robust Vision Language Models

自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型

Yuriel Ryan, Hei Man Ip, Adriel Kuek, Paul Pu Liang, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) DSO National Laboratories(国防部国家实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :vision language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。

Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06484 2026-06-01 cs.CL 85%

ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs

ValueGround: 评估多模态大语言模型中文化条件化的视觉价值基础

Zhipin Wang, Christoph Leiter, Christian Frey, Mohamed Hesham Ibrahim Abdalla, Josif Grabocka, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出ValueGround基准,通过最小对比图像对评估多模态大语言模型在文化条件化视觉价值判断中的表现,发现模型在可视化选项下准确率显著低于文本选项。

Comments Updated preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12686 2026-06-01 cs.RO 85%

SignScene: Visual Sign Grounding for Mapless Navigation

SignScene: 用于无地图导航的视觉标志接地

Nicky Zimmerman, Joel Loo, Benjamin Koh, Zishuo Wang, David Hsu

机构 * Smart Systems Institute, National University of Singapore, 3 Research Link, 117602, Singapore.(新加坡国立大学智能系统研究所) School of Computing, National University of Singapore, 13 Computing Drive, 117417, Singapore.(新加坡国立大学计算机学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn)

AI总结 提出SignScene,一种以标志为中心的空间语义表示方法,利用视觉语言模型将标志的语义指令与场景元素和导航动作对应,实现无地图导航,在114个查询中达到88%的接地准确率。

Comments Under review for a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30957 2026-06-01 cs.RO 80%

RDGen: Demonstration Generation for High-Quality Robot Learning via Reinforcement Learning

RDGen: 通过强化学习生成高质量机器人学习的演示

Zijian Zhu, Menglin Zou, Zhuang Li, Yaojie Tu, Xinhai Sun

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn)

AI总结 提出RDGen框架,利用从仿真到真实的强化学习策略生成高质量机器人演示轨迹,用于训练视觉-语言-动作模型,相比人工遥操作产生更平滑轨迹并提升下游性能。

Comments 13 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30742 2026-06-01 cs.CV 79%

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

注释并非全部所需:面向无监督时间语句定位的跨模态知识迁移网络

Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Yu Cheng, Keke Tang, Kai Zou

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全学院) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Henan University(河南大学) The Chinese University of Hong Kong(香港中文大学) Guangzhou University(广州大学) Protagolabs Inc.(Protagolabs公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 提出跨模态知识迁移网络,通过从图像-名词和视频-动词任务中迁移实体感知和事件感知知识,实现无监督时间语句定位,无需配对视频-查询标注。

Comments Published in Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26711 2026-06-01 cs.CL cs.LG 79%

The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models

外部观察者的必要性:充分性差距的形式化——序列模型中混合可识别性与上下文基础化的数学扩展

Francesco Corielli

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文通过构建二元混合过程,形式化了由未观测隐状态导致的充分性差距,并引入辅助信号建立上下文主导阈值,证明温度缩放无法弥补缺失上下文,而外部观察者或验证器在高风险领域是必要的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30984 2026-06-01 cs.CV cs.AI cs.CL 79%

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

生成报告还是重复模板?测量和缓解三维CT报告生成中的模板崩溃

Tom Maye-Lasserre, Yitong Li, Bailiang Jian, Morteza Ghahremani, Benedikt Wiestler, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM Hospital(TUM医院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对三维CT报告生成中模型输出多样性低、病理检测能力差的模板崩溃问题,提出解耦框架CLarGen,通过分离临床检测与语言合成,显著提升临床准确性并保持报告流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30639 2026-06-01 cs.CV cs.AI cs.RO 79%

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

PInVerify:面向主动实例验证的离线具身基准

Yuhang Jiang

机构 * University of Trento(特伦托大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。

Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-06-01 cs.CV cs.CL 77%

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31145 2026-06-01 cs.CV cs.AI cs.LG 75%

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位

Mohammed Asad Karim, Vinay Kumar Verma

机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。

Comments Accepted at ICML 2026. * Equal Contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09632 2026-06-01 cs.CV cs.CL 70%

X-GS: An Extensible Framework for Perceiving and Thinking via 3D Gaussian Splatting

X-GS:基于3D高斯溅射的感知与思考可扩展框架

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出X-GS框架,包含感知器和思考器,统一多种3DGS技术实现实时在线SLAM与语义蒸馏,并支持多模态模型完成下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20395 2026-06-01 cs.CV cs.RO 70%

SpaCeFormer: Fast Proposal-Free Open-Vocabulary 3D Instance Segmentation

SpaCeFormer: 快速无提议开放词汇3D实例分割

Chris Choy, Junha Lee, Chunghyun Park, Minsu Cho, Jan Kautz

机构 * NVIDIA

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出SpaCeFormer,一种基于空间曲线变换的无提议方法,在0.12-0.30秒内完成场景分割,比多阶段2D+3D流水线快2-3个数量级,并构建了最大开放词汇3D实例分割数据集SpaCeFormer-3M,在ScanNet200上零样本mAP达11.1,提升2.8倍。

Comments Project page: https://nvlabs.github.io/SpaCeFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02220 2026-06-01 cs.CV cs.RO 70%

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

LangMap:一个用于分层开放词汇目标导航的人工验证基准

Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, Feras Dayoub, Anton van den Hengel

机构 * AIML, Adelaide University(AIML,阿德莱德大学) East China Normal University(华东师范大学) NERC-RVC, Hunan University(NERC-RVC,湖南大学) The University of Western Australia(西澳大学) Breaker Industries

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 针对现有基准在分层语义目标导航中的不足,提出LangMap基准,通过人工验证的语义标注和对比注释协议,支持场景、房间、区域和实例四个层级的目标导航任务,并引入PlaNaVid基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-06-01 cs.CL cs.AI cs.CV cs.MM 62%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31212 2026-06-01 cs.CV cs.AI cs.CL 62%

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education

基准测试与增强文本到图像模型以生成早期算术教育中的视觉表示

Junling Wang, Boqi Chen, Heejin Do, Mubashara Akhtar, April Yi Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) ETH AI Center(ETH人工智能中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对早期算术教育中的方程到视觉生成任务,构建了E2V-Bench基准并评估了现有T2I模型,发现其在计数和关系结构上存在严重错误,进而探索了基准引导的增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30638 2026-06-01 cs.LG cs.AI 62%

Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment

分数广播与去相关:基于广播的信用分配通用框架

Mustafa Uzun, Mete Erdogan, Cengiz Pehlevan, Alper T. Erdogan

机构 * KUIS AI Center, Koc University, Turkey(科克大学KUIS人工智能中心,土耳其) Electrical and Electronics Engineering, Koc University, Turkey(科克大学电子与电气工程系,土耳其) Department of Electrical Engineering, Stanford University, USA(斯坦福大学电气工程系,美国) John A. Paulson School of Engineering & Applied Sciences, Harvard University, USA(哈佛大学约翰·A·保罗森工程与应用科学学院,美国) Kempner Institute, Harvard University, USA(哈佛大学凯姆纳研究所,美国) Center for Brain Science, Harvard University, USA(哈佛大学脑科学中心,美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出分数广播与去相关(SBD)框架,通过输出分数与隐藏层激活的正交性原理,统一了多种可微损失函数下的广播式信用分配,并理论支撑了三因子学习规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20873 2026-06-01 cs.AI cs.LG 62%

PlanningBench: Generating Scalable and Verifiable Planning Data for Evaluating and Training Large Language Models

PlanningBench: 生成可扩展且可验证的规划数据以评估和训练大型语言模型

Ziliang Zhao, Zenan Xu, Shuting Wang, Hongjin Qian, Yan Lei, Minda Hu, Zhao Wang, Shihan Dou, Zhicheng Dou, Pluto Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学校) LLM Department, Hunyuan Team, Tencent(腾讯 Hunyuan 团队 LLM 部门) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出PlanningBench框架,通过约束驱动合成管道生成可扩展、多样化且可验证的规划数据,用于评估和训练LLMs,并验证其在提升规划能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31143 2026-06-01 cs.HC cs.AI 57%

Extending the UXR Point of View Pyramid: A Generative AI-Augmented Methodology for Human-Centred AI Systems

扩展UXR观点金字塔:一种面向人本AI系统的生成式AI增强方法论

Festus Fatai Adedoyin, Huseyin Dogan, Melike Akca, Abiodun Adedeji

机构 * School of Computing and Engineering, Bournemouth University(伯恩茅斯大学计算机与工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对英国债务管理中的AI金融系统,通过扩展UXR观点金字塔,提出一种结合生成式AI的增强方法论,包括AI增强观点金字塔、结构化提示架构和AI驱动的Playbook卡片系统,以提升可解释性、公平性和问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30637 2026-06-01 cs.AI 57%

EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs

EHRBench: 基于电子健康记录的自动化可靠临床决策基准测试,用于大语言模型

Yuzhang Xie, Keqi Han, Yunpeng Xiao, Hejie Cui, Guanchen Wu, Ziyang Zhang, Kai Shu, Jiaying Lu, Xiao Hu, Carl Yang

机构 * Emory University(埃默里大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出EHRBench,通过EHR-LLM-KB交互流水线自动构建近百万问答对,涵盖诊断、治疗和预后三大临床决策任务,系统评估30余种LLM的性能与鲁棒性。

Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Datasets and Benchmarks Track, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 57%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10468 2026-06-01 eess.AS cs.AI cs.HC cs.MM cs.SD 57%

G-STAR: End-to-End Global Speaker-Tracking Attributed Recognition

G-STAR: 端到端全局说话人跟踪属性识别

Jing Peng, Ziyi Chen, Haoyu Li, Yucheng Wang, Duo Ma, Mengtian Li, Yunfan Du, Dezhu Xu, Kai Yu, Shuai Wang

机构 * Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院) ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出G-STAR框架,通过缓存条件说话人跟踪模块与Speech-LLM转录骨干耦合,实现长时重叠多说话人语音的端到端说话人属性识别,支持组件优化和联合训练,在局部和全局评估中均表现优异。

Comments submitted to Emnlp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31175 2026-06-01 cs.CL 50%

Towards Efficient LLMs Annealing with Principled Sample Selection

迈向基于原则性样本选择的高效LLM退火

Yuanjian Xu, Jianing Hao, Wanbo Zhang, Zhong Li, Guang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过损失景观的谱几何特性,将退火阶段的数据选择建模为有约束优化问题,提出DiReCT框架,利用Hessian谱对梯度施加方向约束,实现高效样本选择,显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31125 2026-06-01 cs.HC 50%

Generative AI in developing User Experience Research Point of View: A NotebookLM case study

生成式AI在用户体验研究观点开发中的应用:NotebookLM案例研究

Mona Giff, Stephen Giff, Huseyin Dogan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出并评估了一种利用Google NotebookLM增强用户体验研究观点(UXR PoV)框架的正式方法,通过五个提示词在四个阶段中应用,实验表明NotebookLM能有效协作生成PoV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31066 2026-06-01 cs.RO 50%

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

空中VLA模型能协作吗?基于CARLA-Air的闭环空地协调评估

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过构建CARLA-Air仿真环境,评估空中视觉-语言-动作模型在空地协作任务中的表现,发现当前模型难以将单智能体能力转化为稳定协作行为,并指出零样本协作需要伙伴状态显式感知、低延迟动作协调和团队目标对齐三个关键组件。

Comments Code at https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30661 2026-06-01 cond-mat.soft cond-mat.mes-hall cond-mat.mtrl-sci 50%

Wetting as an emergent property of water: reformulating Young equation on molecular grounds

润湿作为水的涌现性质:在分子基础上重新表述杨氏方程

Nicolas Loubet, Gustavo Appignanesi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过定义分子润湿系数ω_m,将宏观接触角与水的氢键缺陷能量成本联系起来,建立统一的分子框架,揭示润湿是水的内在涌现性质。

Journal ref Journal of the American Chemical Society (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30539 2026-06-01 cs.MA 50%

A Theory-Guided LLM Pedagogical Agent for STEM+C Scaffolding Without Over-Reliance

理论引导的LLM教学代理:用于STEM+C支架式教学,避免过度依赖

Clayton Cohn, Surya Rayala, Siyuan Guo, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Ryan Li, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Ashwin T S, Meiyi Ma, Gautam Biswas

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于证据-决策-反馈框架的多智能体协作代理Copa,结合社会认知理论与社会建构主义,通过自适应对话支持促进STEM+C学习,实验证明其能增强学生信心和概念表达能力而不导致依赖。

Comments Submitted to Computers & Education. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16204 2026-06-01 cs.CY 50%

Who, Why, and How: Disentangling the Effects of Moderation Source, Context, and Language on Post-Removal Behavior

谁、为什么以及如何:解析审核来源、背景和语言对帖子移除后行为的影响

Siyi Zhou, Lindsay Young, Marlon Twyman, Emilio Ferrara

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究基于HAII-TIME理论,利用Reddit大规模数据集,通过概率行为分类、ANOVA和OLS回归等方法,分析了审核来源、违规背景和语言风格对用户移除后行为的影响,发现机器人审核比人工审核更有效,且违规严重性调节了语言策略的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏