arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1267 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 340 篇

2601.14288 2026-06-18 astro-ph.CO cs.AI cs.CE gr-qc hep-th 版本更新 57%

DeepInflation: an AI agent for research and model discovery of inflation

DeepInflation:用于暴胀研究与模型发现的AI智能体

Ze-Yu Peng, Hao-Shi Yuan, Qi Lai, Jun-Qian Jiang, Gen Ye, Jun Zhang, Yun-Song Piao

机构 * School of Physical Sciences, University of Chinese Academy of Sciences, Beijing 100049, China International Centre for Theoretical Physics Asia-Pacific, University of Chinese Academy of Sciences, 100190 Beijing, China Taiji Laboratory for Gravitational Wave Universe, University of Chinese Academy of Sciences, 100049 Beijing, China School of Fundamental Physics Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China Institute of Theoretical Physics, Chinese Academy of Sciences, P.O. Box 2735, Beijing 100190, China D\' e partement de Physique Th\' e orique, Universit\' e de Gen\` e ve, 24 quai Ernest-Ansermet, CH-1211 Gen\` e ve 4, Switzerland

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出基于多智能体架构的AI智能体DeepInflation,集成大语言模型、符号回归引擎和检索增强生成知识库,自动发现与最新观测一致的单场慢滚暴胀势,并解释理论背景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24696 2026-06-17 cs.CV 版本更新 57%

NeuroClaw Technical Report

NeuroClaw 技术报告

Cheng Wang, Zhibin He, Zhihao Peng, Shengyuan Liu, Yufan Hu, Carl Yang, Lifang He, Lichao Sun, Xiang Li, Yixuan Yuan

机构 * Electronic Engineering Department, The Chinese University of Hong Kong, China(香港中文大学电子工程系) School of Electronic Information, Northwest University, China(西北大学电子信息学院) Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系) Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(莱斯利大学计算机科学与工程系) Department of Radiology, Massachusetts General Hospital, Boston, MA, USA(麻省总医院放射科) Kempner Institute for Natural and Artificial Intelligence, Harvard University, Cambridge, MA, USA(哈佛大学自然与人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对神经影像学中多模态数据、长流程和可重复性挑战,提出NeuroClaw多智能体研究助手,通过数据驱动决策、环境管理和三层技能架构实现可执行可复现的神经影像分析,并在NeuroBench基准上显著优于直接调用智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17616 2026-06-17 cs.LG 版本更新 57%

Conditional Attribution for Root Cause Analysis in Time-Series Anomaly Detection

时间序列异常检测中根因分析的条件归因

Shashank Mishra, Karan Patil, Cedric Schockaert, Didier Stricker, Jason Rambach

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Paul Wurth S.A(保罗·沃思公司) Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵河-巴尔夫技术大学凯撒斯劳滕-兰道)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种条件归因框架,通过检索与异常观测上下文相似的正态实例进行依赖保持的解释,结合变分自编码器和UMAP流形嵌入实现高维时间序列的高效归因,并在SWaT和MSDS基准上提升了根因识别准确率与鲁棒性。

Comments Accepted at ECML PKDD. 16 pages, 8 figures, 13 tables, and an appendix

Journal ref ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19528 2026-06-17 stat.ML cs.LG math.ST stat.TH 版本更新 57%

Learning Upper Lower Value Envelopes to Shape Online RL: A Principled Approach

学习上下值包络以塑造在线强化学习:一种原则性方法

Sebastian Reboul, Hélène Halconruy

机构 * SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris) Wiremind Cargo 16 Bd Poissonnière 75009 Paris Modal’X, Université Paris-Nanterre, 92000 Nanterre(Modal’X, Université Paris-Nanterre, 92000 Nanterre)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出一种两阶段框架,利用离线数据学习值函数的上下界,并将其融入在线算法,通过解耦上下界实现更灵活紧致的近似,理论分析给出高概率遗憾界,实验表明显著降低遗憾。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01131 2026-06-16 cs.MA cs.AI 版本更新 57%

MedCollab: IBIS-Guided Multi-Agent Collaboration with Hierarchical Disease Relation Chains for Clinical Diagnosis

MedCollab:基于IBIS引导的多智能体协作与分层疾病关系链的临床诊断

Yuqi Zhan, Xinyue Wu, Tianyu Lin, Yutong Bao, Xiaoyu Wang, Weihao Cheng, Huangwei Chen, Feiwei Qin, Zhu Zhu

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所) Rupert-Karls-University Heidelberg(海德堡鲁珀特-卡尔大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Children’s Hospital, Zhejiang University School of Medicine, National Clinical Research Center for Children and Adolescents’ Health and Diseases(浙江大学医学院儿童医院,国家儿童青少年健康与疾病临床研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出MedCollab框架,通过IBIS结构化论证和分层疾病关系链(HDRC)增强多智能体协作,提升临床诊断的准确性、可追溯性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05774 2026-06-15 cs.CV 版本更新 57%

LiAuto-GeoX: Efficient Grounded Driving Transformer

LiAuto-GeoX: 高效接地驾驶Transformer

Jiawei Lian, Haoyi Sun, Yang Wu, Lifu Mu, Siyuan Wang, Le Hui, Ning Mao, Tao Wei, Pan Zhou, Kun Zhan, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Li Auto Inc.(Li Auto公司) Northwestern Polytechnical University(西北工业大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出LiAuto-GeoX,通过稀疏激光雷达先验和几何保持蒸馏框架,实现高效、实时的自车中心密集3D重建,并显著提升下游自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04602 2026-06-12 cs.AI 版本更新 57%

Parthenon Law: A Self-Evolving Legal-Agent Framework

Parthenon Law: 一种自我进化的法律智能体框架

Hejia Geng, Leo Liu

机构 * tapntell.ai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Parthenon框架,通过分解模型、工具、知识等组件并引入反泄漏学习循环,使法律领域的大语言模型智能体能够从经验中自我进化,显著提升法律事务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19072 2026-06-12 cs.SE cs.AI 版本更新 57%

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu

机构 * Monash University Australia(墨尔本大学澳大利亚) The University of Melbourne Australia(墨尔本大学澳大利亚) Atlassian USA(Atlassian美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。

Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08558 2026-06-11 cs.LG stat.ML 版本更新 57%

Impact of Connectivity on Laplacian Representations in Reinforcement Learning

连通性对强化学习中拉普拉斯表示的影响

Tommaso Giorgi, Pierriccardo Olivieri, Keyue Jiang, Laura Toni, Matteo Papini

机构 * University of Edinburgh(爱丁堡大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文研究了连通性对强化学习中拉普拉斯表示的误差影响,通过分析状态图的代数连通性,推导了线性价值函数近似误差的上界,并展示了表示学习管道中的端到端误差分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 57%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16415 2026-06-11 cs.CV 版本更新 57%

CountZES: Counting via Zero-Shot Exemplar Selection

CountZES: 通过零样本示例选择进行计数

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对零样本计数中示例质量差导致计数不准的问题,提出CountZES方法,通过检测锚定、密度引导和特征共识三阶段协同选择多样化示例,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 50%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24861 2026-08-13 cond-mat.stat-mech cs.IT math.IT 版本更新 50%

First-Order Recoverability Collapse in Self-Referential Information Decoders

自指信息解码器中的一阶可恢复性崩溃

Pieter van Rooyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自适应系统在持续非平衡驱动下耦合推理与不可逆动作的可恢复性,发现容量饱和导致可恢复性丧失和诊断发散,反馈使转变变为一阶,出现双稳态区域和滞后现象。

Comments 25 pages, 5 figures, 2 tables. v2: substantially revised - narrowed classification claim (trained artifact vs operating loop), closed-loop phase diagram, instrumented-pipeline measurements with empirical-service spinodal analysis. Part of the Recoverable Self-Coding program (Entropy 2026, Barcelona)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 50%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-12 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09874 2026-08-12 cs.CL cs.SI 版本更新 50%

Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis

模拟有组织群体行为:新框架、基准和分析

Xinkai Zou, Yiming Huang, Zhuohang Wu, Jian Sha, Nan Huang, Longfei Yun, Jingbo Shang, Letian Peng

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Irvine(加州大学尔湾分校) Meta

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出新框架和基准,用于模拟有组织群体决策,通过结构化分析模型提升预测性能,并揭示群体行为随时间的变化及跨群体相似性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14380 2026-08-10 cs.CL 版本更新 50%

VISHC at PsyDefDetect: Mitigating Data Scarcity in Psychological Defense Classification with Context-Aware Synthetic Augmentation

通过上下文感知的合成增强缓解心理防御分类中的数据稀缺

Hoang-Thuy-Duong Vu, Quoc-Cuong Pham, Huy-Hieu Pham

机构 * College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam(越南 Vin大学工程与计算机科学学院,河内,越南) VinUni-Illinois Smart Health Center, VinUniversity, Hanoi, Vietnam(越南 Vin大学与伊利诺伊大学智能健康中心,河内,越南) Center for Innovations in Health Sciences, VinUniversity, Hanoi, Vietnam(越南 Vin大学健康科学创新中心,河内,越南)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出上下文感知合成增强框架与混合分类模型,解决心理防御机制分类中的数据稀缺问题,实验表明方法在低资源环境下取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27549 2026-08-06 cs.SE 版本更新 50%

How Effective Are NPM Malicious Package Detectors? A Large-Scale Empirical Study

理解NPM恶意软件包检测:基于基准的实证分析

Wenbo Guo, Zhongwen Chen, Zhengzi Xu, Chengwei Liu, Ming Kang, Shiwen Song, Chengyue Liu, Yijia Xu, Weisong Sun, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于基准测试分析NPM恶意软件包检测,构建包含6420个恶意和7288个良性包的数据集,评估8种工具的性能,揭示工具精度-召回率由代码意图解析决定,GuardDog达到93.32% F1,SAP_DT检测率提升至79.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02582 2026-08-05 cs.SE 版本更新 50%

ACEM: A Cost Estimation Model for Agentic Software Engineering

ACEM:面向智能体软件工程的成本估算模型

Mohammad El-Ramly

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。

Comments 27 pages, under journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17977 2026-08-03 cs.RO 版本更新 50%

RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

RynnBrain 1.1:迈向更具能力和通用性的具身基础模型

Kehan Li, Bohan Hou, Minghao Zhu, Tianyi Zhang, Zesen Cheng, Zhikai Wang, Sicong Leng, Xin Li, Xiao Lin, Biying Yao, Minghua Zeng, Jiangpin Liu, Ronghao Dang, Jiayan Guo, Siteng Huang, Haoyu Zhao, Heng Ping, Yaxi Zhao, Tong Zhao, Kexiang Wang, Tong Lu, Shengke Xue, Jiahao Tang, Yulei Wang, Zejing Wang, Jianwei Gao, Shijian Lu, Chengju Liu, Jianfei Yang, Mingxiu Chen, Deli Zhao

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 介绍RynnBrain 1.1具身基础模型家族,其经统一框架训练,相比1.0版本有改进。开发RynnBrain - VLA并部署。该模型在多方面成果显著,初始化策略表现优,联合训练提升了得分和成功率。

Comments KL,BH,MZ,TZ,ZC,ZW,SL,XL,XL,BY,MZ,JL,RD contribute equally. Project Lead: Kehan Li and Xin Li project: https://alibaba-damo-academy.github.io/RynnBrain github: https://github.com/alibaba-damo-academy/RynnBrain huggingface: https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11 modelscope: https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02383 2026-07-31 cs.CL 版本更新 50%

MEDIAREF: A Public Knowledge Store for Media Background Checks

了解你的来源:用于媒体背景核查的公共知识库

Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。

Comments Code and Data: https://github.com/nedjmaou/mediaref

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12507 2026-07-31 cs.CL cs.CY 版本更新 50%

Towards Structurally Explainable Machine-Generated Text Detection: A Graph-Perspective Framework

面向结构可解释的机器生成文本检测:一种图视角框架

Xu Zheng, Zhuomin Chen, Esteban Schafir, Sipeng Chen, Hojat Allah Salehi, Haifeng Chen, Farhad Shirani, Mo Sha, Wei Cheng, Dongsheng Luo

机构 * Florida International University(佛罗里达国际大学) NEC Laboratories America(NEC美洲实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对机器生成文本检测的黑箱局限,本文提出 \textsc{LM$^2$otifs} 图视角框架,通过词汇共现图与图神经网络实现检测,其结构基序的可解释性与性能均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12791 2026-07-30 eess.SY cs.SY 版本更新 50%

The GIST Korea Test System: A Public-Data Synthetic Model of the Korean Power Grid

GIST 2064节点测试系统:韩国电网的公开数据合成模型

Yun-Su Kim

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 基于公开数据构建韩国电网2064节点合成模型,采用多源最短路径重组OpenStreetMap电力层布局,校准线路长度至国家统计值,并验证了潮流收敛性。

Comments 14 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22669 2026-07-29 physics.chem-ph 版本更新 50%

DeepHartree: A Poisson-Coupled Neural Field for One-Shot Density Functional Theory

DeepHartree:一种与泊松方程耦合的神经场,用于可扩展的密度泛函理论

Jiankun Wu, Jinming Fan, Chao Qian, Shaodong Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepHartree通过与泊松方程耦合的神经场,加速了线性组合原子轨道密度泛函理论的SCF求解,解决了计算瓶颈问题,实现了跨基组和系统的零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 50%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13357 2026-07-24 cs.HC 版本更新 50%

TANDE: Disentangling Verbal and Nonverbal Backchannels in Emotional AI-Avatar Conversations with Young Adults

TANDE:在与年轻人的情感人工智能-虚拟化身对话中区分言语和非言语反馈渠道

Ann-Kareen Gedeus, Jack Good, Nadine Wagener, Angelique Taylor

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究在与年轻人的情感人工智能-虚拟化身对话中反馈渠道模式的影响,引入TANDE这个由LLM驱动的ECA,通过实验探讨其对融洽关系、同理心和参与度的作用及性别差异,得出相关设计启示。

Comments This paper has been accepted for publication at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01224 2026-07-21 cs.CL 版本更新 50%

Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs

迷失在巴别塔中:LLMs中偶然多语言主义的负面影响

Anjishnu Mukherjee, Chutong Meng, Antonios Anastasopoulos

机构 * Department of Computer Science(计算机科学系) George Mason University(乔治·马歇尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文指出当前多语言NLP陷入偶然多语言主义的脆弱且误导性范式,导致模型在多语言情境中表现不均、脆弱且不透明,需转向设计驱动的多语言主义。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08879 2026-07-21 cs.CL 版本更新 50%

GRASP: Grounded CoT Reasoning with Dual-Stage Optimization for Multimodal Sarcasm Target Identification

GRASP:基于双阶段优化的 grounded CoT 推理用于多模态讽刺目标识别

Faxian Wan, Xiaocui Yang, Yifan Cao, Shi Feng, Daling Wang, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 GRASP通过整合视觉定位与显式Co-T推理,解决多模态讽刺目标识别中的细粒度定位问题,提出MSTI-MAX数据集和双阶段联合优化策略,实验表明其在多模态讽刺目标识别中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10113 2026-07-20 cs.CY cs.HC 版本更新 50%

Dark Personality Traits and Online Toxicity: Linking Self-Reports to Reddit Activity

黑暗人格特质与在线毒性:将自我报告与Reddit活动联系起来

Aldo Cerulli, Benedetta Tessa, Giuseppe La Selva, Oronzo Mazzeo, Lorenzo Cima, Lucia Monacis, Stefano Cresci

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了黑暗人格特质与在线行为之间的关系,发现自我报告的不文明互动与黑暗人格特质相关,但计算特征无法可靠预测人格特质。

Comments Article published in Computers in Human Behavior. Please cite the published version

Journal ref Computers in Human Behavior, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17723 2026-07-20 q-fin.GN 版本更新 50%

LR-Robot: A Unified Supervised Intelligent Framework for Real-Time Systematic Literature Reviews with Large Language Models

LR-Robot:一种结合大语言模型的实时系统性文献综述统一监督智能框架

Wei Wei, Jin Zheng, Zining Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LR-Robot框架,结合AI与专家监督,实现系统性文献综述的多维分类、关系映射和细粒度主题演化分析,通过期权定价案例展示其在文献综合中的应用与效果。

Comments I've uploaded an updated paper and now it's already on arXiv (arXiv:2604.14793)

详情

展开后加载摘要…

URL PDF HTML 收藏