arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-11 至 2026-08-11 共收录 168 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 48 篇

2608.07932 2026-08-11 cs.CV 新提交 79%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12602 2026-08-11 cs.CV 版本更新 79%

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT

解耦与推理:3D胸部CT中自由文本发现的解剖学引导两阶段体素级定位

Kwang-Hyun Uhm, Inhwa Son, Sung-Jea Ko

机构 * Department of Artificial Intelligence, Gachon University(韩国加图立大学人工智能系) MEDAI

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究3D胸部CT中自由文本发现的体素级定位难题,提出解耦框架,分病变分割和文本-体积推理两阶段,利用解剖学引导解决空间模糊性,在基准测试中取得领先,证明解耦是处理该复杂性的有效范式。

Comments Accepted to MICCAI 2026 (Spotlight Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00898 2026-08-11 cs.CL cs.DL 版本更新 79%

Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law

引用溯源:通过法律引用图检测和减少LLM引用幻觉

Volodymyr Ovcharov

机构 * LEX AI LLC

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 提出引用溯源(CG)指标,利用乌克兰法院判决的引用图(1.008亿判决,5.02亿边)检测LLM法律引用幻觉,并通过CG-DPO方法(基于真实判决构建偏好对)减少幻觉,在100个法律查询上CG为0.791-0.873,幻觉率13-21%。

Comments 21 pages, 4 figures, 5 tables. Substantially revised: title, framing and several v1 results changed. Adds a coverage sweep and a separability analysis; corrects the DPO configuration, the density-accuracy correlation and the qualitative examples. Code and data: https://huggingface.co/datasets/overthelex/citation-grounding-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09818 2026-08-11 cs.CV cs.AI 新提交 79%

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

MedPixel:用于医学推理与分割的统一像素-语言模型

Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang

专题命中 视觉定位与Grounding :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出统一医学像素-语言模型MedPixel,引入44万样本的MedPLG-440K数据集,通过联合多任务微调与像素级偏好优化训练,支持多类医学任务,性能优异且具备零样本迁移与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新 78%

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26046 2026-08-11 cs.RO cs.CV 版本更新 77%

RoboAtlas: Contextual Active SLAM

RoboAtlas:上下文感知主动SLAM

Alexander Schperberg, Shivam K. Panda, Abraham P. Vinod, Rokaha Bhagawan, M. K. Jawed, Stefano Di Cairano

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。

Comments Alexander Schperberg and Shivam K. Panda made equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19180 2026-08-11 cs.CV cs.AI 版本更新 73%

SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing

SNR-Edit: 基于结构的噪声校正用于无反向的流式编辑

Lifan Jiang, Boxi Wu, Yuhang Pei, Tianrun Wu, Yongyuan Chen, Yan Zhao, Shiyu Yu, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) UniTTEC Co. Ltd.(UniTTEC有限公司) Research center, Ningbo Meidong Container Terminal Co.,Ltd.(宁波梅东集装箱码头有限公司研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 SNR-Edit通过自适应噪声控制实现无反向的流式编辑,提升潜在轨迹的结构保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 70%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 70%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29064 2026-08-11 cs.CL cs.CV cs.HC cs.MA 版本更新 70%

Persona Prompting in Multimodal Urban Perception: Descriptive Convergence and Interpretive Variation

分析多模态大语言模型代理在城市感知中生成解释的角色效应

Neemias da Silva, Matt Ratto, Myriam Delgado, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * Universidade Tecnologica Federal do Parana(巴西南里奥格兰德联邦技术大学) University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 通过对比不同角色提示和无角色设置下多模态大语言模型生成的文本,发现标题描述趋同,但理由描述随社会经济和政治属性系统变化,感知标签无显著差异。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09125 2026-08-11 cs.RO 新提交 67%

Trajectory Divergence Horizon Decision for Reliable Dual-Arm Surgical Subtask Manipulation

可靠双臂手术子任务操作的轨迹发散 horizon 决策

Mingwu Su, Guankun Wang, Jinsong Lin, Rulin Zhou, Ziyi Hao, Zhiwei Fang, Huxin Gao, Jiewen Lai, Jiazheng Wang, Fan Zhang, Hongliang Ren

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学) Huawei Technologies Co. Ltd.(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 针对现有VLA策略在手术操作中易累积误差的问题,提出TDHD机制,构建双臂手术基准并收集600个演示,实验显示其可提升器械和组织操作的成功率。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27341 2026-08-11 cs.AI cs.CV cs.LG 版本更新 67%

A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

外科AI的比较研究:数据、计算和扩展的潜力与局限

Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara, Shauna Otto, Zhuang-Fang Yi, John Zhu, Neeraj Mainkar, Margaux Masson-Forsythe, Daniel A. Donoho, X. Y. Han

机构 * Center for Applied AI, Chicago Booth(应用人工智能中心,芝加哥商学院) Surgical Data Science Collective(外科数据科学集体) Children’s National Hospital(儿童医学中心) Operations Management & Tolan Center for Healthcare, Chicago Booth(运营管理与托兰医疗中心,芝加哥商学院)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过2026年最先进的AI方法,研究了外科手术工具检测中的性能和限制,发现即使使用多十亿参数模型和大量训练数据,当前的视觉语言模型在神经外科手术工具检测任务中仍表现不足,且模型规模和训练时间的增加对性能提升效果有限,表明当前AI在手术应用中仍面临显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 62%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 62%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-11 cs.AI cs.LG 版本更新 62%

Emergence Invariance: From Symbolized Thought to Structural Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

Comments 51 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 62%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09475 2026-08-11 cs.CV 新提交 57%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09316 2026-08-11 cs.CV 新提交 57%

MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

MemeMind:用于离线上下文优化的参考引导轨迹构建

Run Yang, Weihang Wang, Boheng Sheng, Yuchen He, Jielei Zhang, Pengyu Chen, Zhiyu Wu, Qiang Sun, Huyang Sun, Longwen Gao

机构 * Bilibili(哔哩哔哩) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 MemeMind针对离线上下文优化中失败rollout缺失成功示例的问题,通过参考引导构建工具轨迹,在梗解读任务上提升了Qwen3-VL模型的性能。

Comments 24 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09139 2026-08-11 cs.CV 新提交 57%

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

CodecArena:基于视觉强化学习的编解码器质量评估

Jiaye Fu, Weiqi Li, Qiankun Gao, Yanchen Zhao, Xiandong Meng, Jian Zhang, Siwei Ma, Jiaqi Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究针对视频编码主流指标无法准确评估内容保真度的问题,提出首个视频编码质量评估视觉-语言框架CodecArena,采用视觉强化学习方案优化,构建相关数据集与基准,在源不相交内容上实现优于现有方法的人类判断一致性。

Comments The project page is: https://jyfu-vcl.github.io/codecarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08844 2026-08-11 cs.CV 新提交 57%

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

基于文本提示的Segment Anything Model 3(SAM3)实现无掩码标注的内镜图像手术器械分割

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于SAM3与微调Qwen的两阶段框架,无需标注即可实现内镜图像的手术器械实例级分割,在EndoVis数据集上性能优于直接使用SAM3,为无标注分割提供了新方向。

Comments Accepted at the Medical Image Understanding and Analysis (MIUA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08126 2026-08-11 cs.LG cs.CL 新提交 57%

Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计

Gregorius Reynaldi Pratama, Kuo-Kun Tseng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 57%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 57%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07531 2026-08-11 cs.CL cs.AI 新提交 57%

Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards

Search-G1:基于表征内在奖励的接地搜索智能体

Cheng Ruoxi, Ma Haoxuan, Zhang Hongyi, Zhang Junming, Duan Ranjie, Xia Qiaolin, Wang Hao, Lu Yu, Shi Haibo, Ma Xingjun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出Search-G1框架,通过两个经干预校准的读数构成的表征内在奖励,改善了搜索增强语言智能体的接地性与搜索成本的权衡,在多基准和模型规模上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07504 2026-08-11 cs.HC cs.AI econ.GN q-fin.EC 新提交 57%

Innovating with Generative AI: A Human Bottleneck Framework

生成式AI助力创新:人类瓶颈框架

Julian De Freitas, Ayelet Israeli, Gideon Nave, Artem Timoshenko, Olivier Toubia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出人类瓶颈框架,分析生成式AI对创新过程各阶段瓶颈的影响,区分瓶颈类型并探讨AI对传统创新流程的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 57%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 57%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17162 2026-08-11 cs.AI 版本更新 57%

The Belief-Desire-Intention Ontology for modelling mental reality and agency

信念-愿望-意图本体用于建模心理现实与代理

Sara Zuppiroli, Carmelo Fabio Longo, Anna Sofia Lippolis, Rocco Paolillo, Lorenzo Giammei, Miguel Ceriani, Francesco Poggi, Antonio Zinilli, Andrea Giovanni Nuzzolese

机构 * CNR - Institute of Cognitive Sciences and Technologies(CNR认知科学与技术研究所) CNR - Institute for Research on Population and Social Policies(CNR人口与社会政策研究所) CNR - Research Institute on Sustainable Economic Growth(CNR可持续经济增长研究所) University of Bologna - Department of Philosophy(博洛尼亚大学哲学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种形式化的BDI本体,通过模块化设计模式实现信念、愿望、意图及其动态关系,结合LLMs和Semas平台验证其在认知基础和语义可互操作性中的应用。

Journal ref Journal of Web Semantics (2026) 90:100885

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09698 2026-08-11 cs.HC cs.CL 新提交 50%

VeriForge: Mitigating Latent Knowledge Gaps in Narrative Drafting via Mixed-Initiative Scaffolding

VeriForge:通过混合式主动脚手架缓解叙事创作中的潜在知识缺口

Ruqi Sun, Jiaping Li, Wenhui Tao, Ximing Zheng, Yuefeng Tan, Jiahao Wei, Yuxin Ma

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VeriForge是混合式主动写作系统,通过主动内联高亮、双流查询、空间知识画布三种机制,帮助作者识别叙事创作中的潜在知识缺口,提升领域知识整合能力,获用户与专家认可。

Comments 14 pages, 5 figures, Accepted by UIST'26

详情

展开后加载摘要…

URL PDF HTML 收藏