arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-12 至 2026-08-12 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 27 篇

2607.18577 2026-08-12 cs.CV 版本更新 91%

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

无基础的注意力:医学视觉语言模型中视觉解释的因果评估

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(萨伊勒实验室,纽黑文大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(title);LLaVA(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究医学视觉语言模型中视觉解释的因果评估,通过多种方式审核注意力热图忠实度,发现没有评估的VLM满足忠实标准,热图虽视觉上安心但不忠实,临床解释需可控指标和因果扰动而非仅视觉检查。

Comments iMIMIC Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 90%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 视觉定位与Grounding :MLLM(title,title_cn);grounding(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10981 2026-08-12 cs.CV 新提交 90%

ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes

ThinkAfford:面向杂乱场景中细粒度3D grounding的以可供性为中心的推理

Xinrui Lin, Sha Zhang, Shumin Wang, Zenghuan Zhu, Jiajun Deng, Yanyong Zhang

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 该研究提出ThinkAfford模型,通过解耦可供性提议生成与指令推理,结合GRPO优化,在SceneFun3D验证集上的3D grounding指标优于基线方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09302 2026-08-12 cs.CV 版本更新 89%

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

用于宫腔镜手术场景分割的自举式视觉-语言模型

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出首个基于VLM的宫腔镜手术场景分割方法VLM-hyster,通过类别特定文本提示与掩码蒸馏分支提升性能,在自行构建的4020张图像数据集上表现优于现有模型,获多中心验证,具临床应用潜力。

Comments Accept by Biomedical Signal Processing and Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11201 2026-08-12 cs.CV 新提交 85%

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

VidForensics-M1:用于AI生成视频取证的、具备可验证时间定位的元检测强化学习

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) Peking University(北京大学) Renmin University of China(中国人民大学) Microsoft(微软公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对AI生成视频检测泛化性不足的问题,首次将元检测引入该领域,提出结合可验证时间证据的VidForensics-M1模型及相关机制,实现了鲁棒可泛化的检测。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06869 2026-08-12 cs.CV cs.CL 版本更新 85%

DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

DAEP:面向医学视频语料时序答案 grounding 的难度感知证据规划

Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu

机构 * TikTok, ByteDance(字节跳动TikTok) Beijing Institute of Graphic Communication(北京印刷学院) Lingnan University(岭南大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 BIGC团队提出DAEP方案,通过多模态证据排名与难度感知规划,在NLPCC 2026共享任务中以0.2728的平均得分获第一名,提升了医学视频时序答案定位的性能。

Comments 12 pages, 2 figures, 5 tables, accepted by NLPCC 2026 Shared Task Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新 84%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15821 2026-08-12 cs.CL cs.AI cs.LG 版本更新 84%

The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

真相留在家族中:通过模型谱系中继承的真相头增强上下文基础

Miso Choi, Seonga Choi, Mincheol Kwon, Woosung Joung, Jinkyu Kim, Jungbeom Lee

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title);MLLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究发现基础LLM与下游变体间存在上下文真相分数的强继承性,提出TruthProbe软门控策略放大真相头以提升上下文真实性并减少多模态幻觉。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交 79%

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新 79%

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10368 2026-08-12 cs.HC cs.MM 新提交 78%

Visual-to-Haptic Augmentation in XR: A Wearable Glove for Perceptual Grounding in Multimodal Interaction

XR中的视觉到触觉增强:一种用于多模态交互感知接地的可穿戴手套

Faisal Mohd, Hamdi Elsaddik, Erhan Baturay Onural, Jihong Zhang, Fedwa Laamarti, Abdulmotaleb El Saddik

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究针对XR系统触觉感知利用不足的问题,提出一款可穿戴手套及视觉到触觉映射算法,经20人实验验证,其触觉增强可提升XR交互的真实感与沉浸感,为多模态XR系统提供感知增强层。

Comments 11 pages, 4 figures. Published in the Proceedings of the 1st Workshop on Shaping Future Human Connection: Social Augmentation through XR Technologies (SAXR 2026), April 13, 2026, Barcelona, Spain

Journal ref Proceedings of the 1st Workshop on Shaping Future Human Connection: Social Augmentation through XR Technologies (SAXR 2026), CEUR Workshop Proceedings, Vol. 4226, pp. 252-262, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 71%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10657 2026-08-12 eess.IV cs.CV cs.LG 新提交 62%

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。

Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10037 2026-08-12 cs.LG cs.AI 新提交 62%

DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架

You Lu, Kun Zhang, Bihuan Chen, Xin Peng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04872 2026-08-12 cs.CV cs.AI 版本更新 62%

EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

EventCoT:用于推理时间定位的以事件为中心的视频思维链

Youngkil Song, Yoonjae Baek, Dongwon Kim, Inho Kim, Dongkeun Kim, Suha Kwak

机构 * Pohang University of Science and Technology(浦项科技大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Handong Global University(韩东国际大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出EventCoT框架解决推理时间定位难题,先对视频进行以事件为中心的分词,再在识别出的事件内推理生成答案,通过嵌入匹配确定时间间隔,在相关任务中取得好结果。

Comments 27 pages, 11 figures, 19 tables. Co-corresponding authors: Dongkeun Kim and Suha Kwak

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 62%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11142 2026-08-12 cs.CV 新提交 57%

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring

SAR2Agri:学习SAR强度表征用于农业监测

Moti Rattan Gupta, Anupam Sobti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10995 2026-08-12 cs.CV 新提交 57%

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10366 2026-08-12 cs.AI cs.CL 新提交 57%

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?

Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince

机构 * York University(约克大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DSAgentBench是首个评估智能体在真实计算机环境中自动化完整数据科学工作流的基准,含275项任务,实验显示现有智能体与实际需求存在显著能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 57%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08849 2026-08-12 cs.CL cs.AI cs.DB cs.MA cs.SC 版本更新 57%

SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching

SatIR:可扩展的高召回率约束满足基于信息检索的临床试验匹配

Zikai Zhou, Yufei Jin, Yilin Xu, Yu-Chiang Wang, Chieh-Ju Chao, Monica S. Lam

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Samueli Electrical and Computer Engineering, UCLA(UCLA Samueli电气与计算机工程系) Department of Computer Science and Informatics, Emory University(埃默里大学计算机科学与信息学系) Mayo Clinic(梅奥诊所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SatIR通过将临床试验资格条件和摘要转化为形式约束,结合SMT、关系代数和大语言模型,提升了临床试验匹配的召回率和效率,优于基于相似度的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13319 2026-08-12 cs.AI cs.HC 版本更新 57%

Situation Graph Prediction for User Perspective Modeling

情境图预测:用户建模的结构化视角推断

Jisung Shin, Daniel Platnick, Marjan Alirezaie, Hossein Rahnama

机构 * Flybits Labs, Creative AI Hub(Flybits实验室、创意人工智能中心) University of Toronto(多伦多大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) MIT Media Lab(MIT媒体实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 情境图预测通过结构化视角推断提升用户建模能力,揭示潜在状态推断比表层提取更困难。

Comments Accepted to PILA 2026: Workshop on Personal Intelligence in the Agentic AI Era, at KDD 2026, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 50%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 50%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-12 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09874 2026-08-12 cs.CL cs.SI 版本更新 50%

Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis

模拟有组织群体行为:新框架、基准和分析

Xinkai Zou, Yiming Huang, Zhuohang Wu, Jian Sha, Nan Huang, Longfei Yun, Jingbo Shang, Letian Peng

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Irvine(加州大学尔湾分校) Meta

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出新框架和基准,用于模拟有组织群体决策,通过结构化分析模型提升预测性能,并揭示群体行为随时间的变化及跨群体相似性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏