arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2607.12340 2026-07-15 cs.SE cs.CR 新提交 50%

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

不存在的技能:对大语言模型代理中幻觉技能推荐的大规模研究

Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大语言模型代理中技能名称幻觉漏洞,通过大规模测量发现各配置均有此问题,系统生成众多幻觉名称且非随机,测试的模型级防御存在安全与可用性冲突,修复需全生态系统结构改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12220 2026-07-15 cs.RO 新提交 50%

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10387 2026-07-14 eess.AS cs.CL 新提交 50%

GigaChat Audio: Time-aware Large Audio Language Model

GigaChat音频:时间感知大型音频语言模型

Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。

Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 50%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10626 2026-07-14 cs.CL 新提交 50%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10245 2026-07-14 cs.CL cs.IR 新提交 50%

PTEI: Integrating Personality Traits to Enhance Emotional Intelligence in Large Language Models

PTEI:在大语言模型中整合人格特质以提高情商

Amir Reza Jafari, Praboda Rajapaksha, Reza Farahbakhsh, Noel Crespi

机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08800 2026-07-13 cs.SD 新提交 50%

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

双BEATs:通过抖动在音频大语言模型中解锁零样本立体声音频感知

Shuo-Chun Lin, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(台湾中央研究院资讯科学研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型空间感知局限,提出双BEATs架构,通过在编码前注入抖动噪声解决归一化问题,在三元方向分类任务中验证该方法有出色空间分辨率且能零样本泛化,证明标准模型经正则化可实现广义立体声音频理解。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 50%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 50%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07129 2026-07-09 cs.RO 新提交 50%

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields

基于以对象为中心的神经场的示范组合运动生成

Ahmet Ercan Tekden, Yasemin Bekiroglu

机构 * Chalmers University of Technology(查尔姆斯理工大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于以对象为中心神经场的示范组合运动生成框架,通过时空组合性连接感知与运动,结合规范神经场与潜在条件变形渲染场景,用时间混合专家生成轨迹,在模拟和实际实验中展现良好性能。

Comments Accepted by IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交 50%

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03863 2026-07-08 cs.CL 新提交 50%

Rethinking Scientific Discovery in the Agentic Era

在智能时代重新思考科学发现

Yining Zheng, Yuxin Wang, Jiahao Lu, Shicheng Fang, Weiyi Wang, Yongzhuo Yang, Bowen Li, Haochen Ma, Chen Hu, Bowen Chen, Yang Wang, Huanhui Chen, Yitong Chen, Jiajun Chen, Zhiyuan Li, Yanlin Li, Zhuo Yang, Qifeng Wu, Jiaying He, Zhijie Jinluo, Xiaohu Xu, Yi Feng, Juncheng Qian, Yizhou Chen, Yang Cheng, Tong Zhu, Tianlei Ying, Hongyu Yu, Hongjun Xiang, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究提出智能科学操作系统SCION,以科学智能体为元工具连接科研要素,核心是研究执行计划,集成多种方法支持长期科研工作,经实验验证其在多方面优于现有基线,推动AI成为可溯源、可复用的科研创新协调操作层。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05069 2026-07-07 cs.CL 新提交 50%

MIRAGE: Defending Long-Form RAG Against Misinformation Pollution

MIRAGE:抵御长文本检索增强生成中的错误信息污染

Saadeldine Eletter, Ruihong Zeng, Yuxia Wang, Maxim Panov, Aleksandr Rubashevskii, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究长文本检索增强生成(RAG)中错误信息污染问题,提出无训练、模型无关的MIRAGE防御方法,构建基于自然语言推理的跨文档声明图并应用防御声明门,提升事实性,优于现有方法。

Comments ACL-style preprint. 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04981 2026-07-07 cs.RO 新提交 50%

Designing Touch for Trauma-Informed Social Robots: A Design Space for Direct and Indirect Actuation

为创伤知情社交机器人设计触觉:直接和间接驱动的设计空间

Madeleine Rischer, Benedikt Bußmann

机构 * AI Ethics Research Hub(人工智能伦理研究中心) Helmut Schmidt University(海姆-施密特大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究如何设计社交机器人的触觉驱动以符合创伤知情护理原则,区分直接和间接触觉,提出包含驱动方式、目标、预期效果三维度的设计空间并分析,为开发创伤敏感社交机器人提供概念基础。

Comments Accepted as a workshop paper at Beyond Words 2, co-located with the International Conference on Social Robotics (ICSR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 50%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04350 2026-07-07 cs.CL 新提交 50%

WPG-MoE: Weak-Prior-Guided Dense Mixture-of-Experts for User-Level Social Media Depression Detection

WPG-MoE:用于用户级社交媒体抑郁症检测的弱先验引导密集专家混合模型

Xian Li, Yuanhe Tian, Yang Yang, Guoqing Wang, Yan Song

机构 * University of Electronic Science and Technology of China(电子科技大学) Zhongguancun Academy(中关村科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究社交媒体抑郁症检测,提出基于共享大语言模型骨干的WPG-MoE框架,通过推导用户级弱语义先验将用户软路由到匹配的专家,以解决单一检测器决策问题,实验表明其性能优于基线。

Comments 23 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03884 2026-07-07 cs.SE 新提交 50%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02430 2026-07-03 cs.HC 新提交 50%

Physical surfaces make touch interactions in virtual reality precise, efficient, and bimanual

物理表面使虚拟现实中的触控交互更精确、高效且支持双手操作

Wen Ying, Seongkook Heo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究比较了无触觉反馈、触觉反馈和物理表面三种条件对VR高精度任务的影响,发现物理表面显著提升选择精度、追踪效率和草图质量,并增加双手使用。

Comments This paper has been accepted by the "International Journal of Human-Computer Studies (IJHCS)" [Project Link] https://wy-blacksheep.github.io/projects/physical-surface/ [Paper Link] https://www.sciencedirect.com/science/article/pii/S1071581926001254 [Video Link] https://youtu.be/e_nzOkZIIKA

Journal ref International Journal of Human-Computer Studies, 215:103850, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02174 2026-07-03 cs.RO cs.HC 新提交 50%

Choreographing the Way of Water: A Computational Framework for Aquatic Robotic Art

编排水之道:水生机器人艺术的计算机框架

Aswin Ramachandran, Christopher Golling, Sebastian Burmester, Noa Sendlhofer, Jan Kamm, Ruiheng Jiang, Raffaello D'Andrea

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出水生机器人编排框架Way of Water,通过浏览器式编舞工具、序列凸规划轨迹生成和模型预测控制,实现非编程艺术家对水面船队的音乐响应式编舞,并在苏黎世湖和威尼斯双年展验证。

Comments Video: https://youtu.be/G4cM6xbG7PA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 50%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00601 2026-07-02 cs.CL 新提交 50%

"Don't Say It!": Constraints, Compliance, and Communication when Language Models Play Taboo

“别说出来!”:语言模型玩禁忌游戏时的约束、合规与沟通

Sara Candussio, Francesca Padovani, Daniel Scalena, Malvina Nissim

机构 * Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学) University of Milano - Bicocca(米兰比可卡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究语言模型在禁忌游戏中如何在严格词汇约束下生成有效描述,通过提示、生成时约束和内部表示操纵干预,评估合规性与沟通效果,发现模型在约束下表现弱于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31682 2026-07-01 cs.RO 新提交 50%

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

HABIT:用于机器人操作的人类感知行为与交互训练数据集

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出HABIT数据集,包含10K+集、160+小时的人类在场机器人演示,覆盖协作、共事和监督三类交互任务,训练出人类感知行为(时空同步、避让、手势理解)并支持快速适应新交互任务。

Comments 30 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31041 2026-07-01 cs.CL 新提交 50%

A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases

一种语义层中介的智能体,用于异构企业数据库的自然语言到SQL转换

Ha Jeong Kim, Saksonita Khoeurn, Ye Ji Yoon

机构 * DAQUV Corp.(DAQUV公司) Chungbuk National University(忠北大学) BigDataLabs, Co., Ltd.(BigDataLabs有限公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种通过语义层中介的NL2SQL智能体,利用语义模型查询(SMQ)解耦语义与物理SQL,在Spider2-snow基准上达到94.15%执行准确率,排名第三。

Comments Submitted to FITAT 2026 for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30973 2026-07-01 cs.CL 新提交 50%

From Propositional to Perceptual Asymmetry: Extending Frictive Policy Optimization to Asymmetric Partial Information Dialogue

从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话

Yifan Zhu, Kyeongmin Rim, James Pustejovsky

机构 * Brandeis University(布兰迪斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 将摩擦策略优化从共享感知场景扩展到感知不对称场景,通过跨语料库分析和LLM探测验证,发现摩擦函数仅在参与者信息视野内有效,并提出标注改进。

Comments 11 pages. To appear in Proceedings of SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26276 2026-07-01 cs.CR 新提交 50%

Expecting (Targeted Ads)? Network Analysis of User Health Data Leakage in Fertility Tracking Apps

期待(定向广告)?生育追踪应用中用户健康数据泄露的网络分析

Yeeun Jo, Shahanaasree Sivakumar, Mahnoor Jameel, Camille Cobb, Adam Bates, Brad Reaves

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过对20款Android生育追踪应用的网络测量,发现部分应用存在显式或隐式的用户健康数据泄露给第三方广告服务,同时也有应用在无泄露情况下使用广告变现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27650 2026-06-29 cs.MA 新提交 50%

GenWorld: Empirically Grounded Urban Simulation Infrastructure for Scalable LLM-Agent Studies

GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施

Gen Li, Jieyuan Lan, Pengcheng Xu, Zongyuan Wu, Masaki Ogura, Tao Feng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。

Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27375 2026-06-26 cs.RO 新提交 50%

Scalable Behavior Cloning with Open Data, Training, and Evaluation

基于开放数据、训练和评估的可扩展行为克隆

Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出ABC开源行为克隆栈,包含最大遥操作数据集ABC-130K(3500小时/13万片段/195任务),并开源硬件、训练和仿真流程,通过协同训练实现仿真与真实评估关联,验证DiT和VLA模型设计,成功执行折纸盒、取信用卡等灵巧任务。

Comments 30 pages. Project page: https://abc.bot

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27098 2026-06-26 cs.AR 新提交 50%

Residual GPU Cache State on Apple M4 Pro

Apple M4 Pro 上的残留 GPU 缓存状态

Faruk Alpay, Baris Basaran

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过测量 Apple M4 Pro 上 GPU 命令完成后的缓存状态,发现大 GPU 足迹会导致后续 CPU 访问变慢,但第二次访问可消除大部分开销,表明存在残留共享缓存置换而非 DRAM 争用。

Comments 16 pages, 10 figures, 2 tables; ancillary artifacts included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 50%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏