arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2568 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 764 篇

2607.21769 2026-07-27 cs.HC 新提交 50%

From Grasping to Speaking: Generative AI-Based Environment-Grounded VR Communication Training for Autistic Individuals

从抓握到说话:基于生成式人工智能的自闭症个体环境基础VR沟通训练

Ziming Li, Roshan L. Peiris

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探索基于生成式人工智能的VR沟通训练对自闭症个体的作用,通过9名受训者和7名教练参与的三种模式实验发现,C+O+G模式更受青睐,可用性和工作量相当,有助于沟通实践融入任务执行,还讨论了相关设计考量。

Comments 14 pages, ASSETS2026

Journal ref The 28th International ACM SIGACCESS Conference on Computers and Accessibility (ASSETS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21462 2026-07-24 cs.CY 新提交 50%

White Box Evidence Packages for Policy Audit Reports

政策审计报告的白盒证据包

Seunghyun Yoo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在政策审计中评审者如何判断报告有无证据支持,引入可控评估框架,在多种证据条件下生成报告让评审员评估。结果显示内部证据影响报告引用推理方式,混合接口最有用,随机控制揭示风险,还将内部模型访问重构为证据设计问题。

Comments 16 pages, 5 figures. Presented at the Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 50%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18557 2026-07-22 physics.geo-ph 新提交 50%

AGENTS4GEOS: agentic platform for open-source multi-physics simulation

AGENTS4GEOS:用于开源多物理场模拟的智能体平台

Adriano M. A. Côrtes, Roberto M. Velho, Fernando A. Rochinha, Alvaro L. G. A. Coutinho, Mauricio Araya-Polo, Hervé Gross

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。

Comments 14 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17538 2026-07-21 cs.AR cs.CL cs.DB cs.ET cs.IR 新提交 50%

D-NOVA: In-Storage Retrieval Accelerator via Dual-Bound 3D NAND-Optimized Similarity Search with Vector Adaptation

D-NOVA:通过具有向量适配的双边界3D NAND优化相似性搜索实现存储内检索加速器

Chang Eun Song, Sumukh Pinge, Tianqi Zhang, Sung Eun Kim, Tajana S. Rosing, Mingu Kang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对RAG密集向量检索性能瓶颈,提出软硬件协同设计的存储内检索加速器D-NOVA。通过深度嵌入搜索功能、采用新距离度量及引入适配器,实现高效检索,相比CPU和现有加速器有显著性能和能效提升,展现全存储向量搜索加速RAG的潜力。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026), Athens, Greece. Chang Eun Song and Sumukh Pinge are co-first authors and contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 50%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15566 2026-07-20 cs.HC 新提交 50%

Physiological Prior-Driven Label Enhancement for Cross-Subject EEG Emotion Recognition

用于跨主体脑电情感识别的生理先验驱动标签增强

Hongyu Zhu, Lin Chen, Yuming Fu, Mounim A. El-Yacoubi, Mingsheng Shang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对跨主体脑电情感识别中标签噪声问题,提出PhyDA框架,通过生理噪声量化器和数据自适应标签细化器,统一神经生理先验与数据驱动的标签细化,实验证明该方法显著优于基线,具有可解释性和鲁棒性。

Comments Submitted; 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 50%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15535 2026-07-20 cond-mat.mtrl-sci 新提交 50%

Symbolic Predicate-Guided Language Agents for Inverse Design of Perovskite Oxides

用于钙钛矿氧化物逆设计的符号谓词引导语言智能体

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究钙钛矿氧化物逆设计,引入 DSL 引导策略,将自然语言规则转化为符号谓词,开发 ORCHESTRA 框架。该策略能增强 LLM 智能体推理能力,无需大量特定任务数据集或额外训练,提升材料设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 50%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 视觉定位与Grounding :MLLM(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14026 2026-07-16 cs.CE 新提交 50%

From Forecasts to Auditable Reports: Evidence Contracts for LLM-Assisted Housing-Guarantee Risk Monitoring

从预测到可审计报告:大语言模型辅助住房担保风险监测的证据契约

Hyeongcheol Kim, Yoontae Hwang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究将住房担保风险预测转化为可审计报告的挑战,提出证据约束报告流程,利用韩国租房押金数据,结合预测模型与结构化证据、验证及分析师监督,提升高风险检测能力,经评估报告支持实际决策,证明该方法可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13059 2026-07-16 cs.RO 新提交 50%

GPUSimBench: Towards Scalable and Reliable GPU-Accelerated Simulators in Embodied AI

GPUSimBench:迈向具身人工智能中可扩展且可靠的GPU加速模拟器

Huzhenyu Zhang, Shenghai Yuan, Wenrui Yan, Li Ma, Hengjie Li, Jingcheng Pang, Dmitry Yudin

机构 * Shanghai AI Laboratory(上海人工智能实验室) MIRAI(未来人工智能研究所) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究具身人工智能中GPU加速模拟器问题,通过GPUSimBench工具,建立物理基础评估、基准测试并行可扩展性,揭示并量化GPU批处理执行的不确定性,确定模拟器堆栈随机经验模式,强调无界扩展对可重复性的影响。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12340 2026-07-15 cs.SE cs.CR 新提交 50%

Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents

不存在的技能:对大语言模型代理中幻觉技能推荐的大规模研究

Weifeng Yuan, Wenbo Guo, Feng Dong, Haoyu Wang, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究大语言模型代理中技能名称幻觉漏洞,通过大规模测量发现各配置均有此问题,系统生成众多幻觉名称且非随机,测试的模型级防御存在安全与可用性冲突,修复需全生态系统结构改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12220 2026-07-15 cs.RO 新提交 50%

Contract-Grounded Behavior Tree Synthesis via Coding Agents

通过编码代理实现基于契约的行为树合成

Jonathan Salfity, Robert Blake Anderson, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究从自然语言合成机器人行为树时基础设定易出现的问题,提出基于契约的合成架构,编码代理查询服务器获取契约后合成行为树,经实验评估两个大语言模型,结果显示该架构能实现高验证率和成功率,且可转移到物理硬件。

Comments IEEE RA-L Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10387 2026-07-14 eess.AS cs.CL 新提交 50%

GigaChat Audio: Time-aware Large Audio Language Model

GigaChat音频:时间感知大型音频语言模型

Aleksandr Kutsakov, Mariia Sadovina, Georgii Gospodinov, Alexandr Maximenko, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究音频条件语言模型长录音时间定位难题,提出时间感知音频语言模型,利用合成监督交织时间标记与音频令牌,在多基准测试中实现高精度,支持相关描述与总结,通过消融实验明确多因素影响,并发布模型权重和数据集。

Comments Accepted to Interspeech 2026. Model and dataset: https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 50%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10626 2026-07-14 cs.CL 新提交 50%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10245 2026-07-14 cs.CL cs.IR 新提交 50%

PTEI: Integrating Personality Traits to Enhance Emotional Intelligence in Large Language Models

PTEI:在大语言模型中整合人格特质以提高情商

Amir Reza Jafari, Praboda Rajapaksha, Reza Farahbakhsh, Noel Crespi

机构 * Telecom SudParis, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对大语言模型在复杂情感推理中不如人类的问题,提出PTEI框架,通过提取人格特质并用于人格感知提示引导模型推理,结合对比学习优化检索系统,经实验验证其能增强模型情感理解能力,与CoT推理结合可进一步提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08800 2026-07-13 cs.SD 新提交 50%

Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering

双BEATs:通过抖动在音频大语言模型中解锁零样本立体声音频感知

Shuo-Chun Lin, Hen-Hsen Huang

机构 * Institute of Information Science, Academia Sinica(台湾中央研究院资讯科学研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 研究针对多模态大语言模型空间感知局限,提出双BEATs架构,通过在编码前注入抖动噪声解决归一化问题,在三元方向分类任务中验证该方法有出色空间分辨率且能零样本泛化,证明标准模型经正则化可实现广义立体声音频理解。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 50%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02966 2026-07-10 cs.CL 新提交 50%

Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG

提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习

Haotian Zhou, Weiran Huang, Siqi Liu, Xiting Wang, Xin Zhang, Zhihao Wen

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) Ant International, Ant Group(蚂蚁集团蚂蚁国际) Shanghai Innovation Institute(上海创新研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。

Comments 42 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07129 2026-07-09 cs.RO 新提交 50%

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields

基于以对象为中心的神经场的示范组合运动生成

Ahmet Ercan Tekden, Yasemin Bekiroglu

机构 * Chalmers University of Technology(查尔姆斯理工大学) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出基于以对象为中心神经场的示范组合运动生成框架,通过时空组合性连接感知与运动,结合规范神经场与潜在条件变形渲染场景,用时间混合专家生成轨迹,在模拟和实际实验中展现良好性能。

Comments Accepted by IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06990 2026-07-09 cs.RO 新提交 50%

A Closed-Loop Multi-Agent Framework for Robust Multi-Robot Manipulation

用于鲁棒多机器人操作的闭环多智能体框架

Yi-Xiang He, Lan Wei, Haoming Cen, Jian-Jian Jiang, Zhuohao Li, Guanxing Lu, Yihan Yang, Dandan Zhang, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Imperial College London(帝国理工学院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对多机器人操作中高级推理应用于实际执行的挑战,提出基于分层闭环智能体的LLM框架,含规划、操作、验证智能体。经实际实验验证,该框架成功率高、适应性强,为多样操作任务提供可推广方法。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03863 2026-07-08 cs.CL 新提交 50%

Rethinking Scientific Discovery in the Agentic Era

在智能时代重新思考科学发现

Yining Zheng, Yuxin Wang, Jiahao Lu, Shicheng Fang, Weiyi Wang, Yongzhuo Yang, Bowen Li, Haochen Ma, Chen Hu, Bowen Chen, Yang Wang, Huanhui Chen, Yitong Chen, Jiajun Chen, Zhiyuan Li, Yanlin Li, Zhuo Yang, Qifeng Wu, Jiaying He, Zhijie Jinluo, Xiaohu Xu, Yi Feng, Juncheng Qian, Yizhou Chen, Yang Cheng, Tong Zhu, Tianlei Ying, Hongyu Yu, Hongjun Xiang, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究提出智能科学操作系统SCION,以科学智能体为元工具连接科研要素,核心是研究执行计划,集成多种方法支持长期科研工作,经实验验证其在多方面优于现有基线,推动AI成为可溯源、可复用的科研创新协调操作层。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05069 2026-07-07 cs.CL 新提交 50%

MIRAGE: Defending Long-Form RAG Against Misinformation Pollution

MIRAGE:抵御长文本检索增强生成中的错误信息污染

Saadeldine Eletter, Ruihong Zeng, Yuxia Wang, Maxim Panov, Aleksandr Rubashevskii, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究长文本检索增强生成(RAG)中错误信息污染问题,提出无训练、模型无关的MIRAGE防御方法,构建基于自然语言推理的跨文档声明图并应用防御声明门,提升事实性,优于现有方法。

Comments ACL-style preprint. 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04981 2026-07-07 cs.RO 新提交 50%

Designing Touch for Trauma-Informed Social Robots: A Design Space for Direct and Indirect Actuation

为创伤知情社交机器人设计触觉:直接和间接驱动的设计空间

Madeleine Rischer, Benedikt Bußmann

机构 * AI Ethics Research Hub(人工智能伦理研究中心) Helmut Schmidt University(海姆-施密特大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究如何设计社交机器人的触觉驱动以符合创伤知情护理原则,区分直接和间接触觉,提出包含驱动方式、目标、预期效果三维度的设计空间并分析,为开发创伤敏感社交机器人提供概念基础。

Comments Accepted as a workshop paper at Beyond Words 2, co-located with the International Conference on Social Robotics (ICSR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 50%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04350 2026-07-07 cs.CL 新提交 50%

WPG-MoE: Weak-Prior-Guided Dense Mixture-of-Experts for User-Level Social Media Depression Detection

WPG-MoE:用于用户级社交媒体抑郁症检测的弱先验引导密集专家混合模型

Xian Li, Yuanhe Tian, Yang Yang, Guoqing Wang, Yan Song

机构 * University of Electronic Science and Technology of China(电子科技大学) Zhongguancun Academy(中关村科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究社交媒体抑郁症检测,提出基于共享大语言模型骨干的WPG-MoE框架,通过推导用户级弱语义先验将用户软路由到匹配的专家,以解决单一检测器决策问题,实验表明其性能优于基线。

Comments 23 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03884 2026-07-07 cs.SE 新提交 50%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02430 2026-07-03 cs.HC 新提交 50%

Physical surfaces make touch interactions in virtual reality precise, efficient, and bimanual

物理表面使虚拟现实中的触控交互更精确、高效且支持双手操作

Wen Ying, Seongkook Heo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究比较了无触觉反馈、触觉反馈和物理表面三种条件对VR高精度任务的影响,发现物理表面显著提升选择精度、追踪效率和草图质量,并增加双手使用。

Comments This paper has been accepted by the "International Journal of Human-Computer Studies (IJHCS)" [Project Link] https://wy-blacksheep.github.io/projects/physical-surface/ [Paper Link] https://www.sciencedirect.com/science/article/pii/S1071581926001254 [Video Link] https://youtu.be/e_nzOkZIIKA

Journal ref International Journal of Human-Computer Studies, 215:103850, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏