arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-07 至 2026-07-07 共收录 176 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 57 篇

2607.02689 2026-07-07 cs.CV cs.AI 新提交 62%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-07-07 cs.CV cs.LG 新提交 62%

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments Technical report(work-in-progress). Code will be available at \url{https://github.com/buptyqx/H-OPD}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24107 2026-07-07 cs.CV cs.AI 新提交 62%

DramaDirector: Geometry-Guided Short Drama Generation

DramaDirector: 几何引导的短剧生成

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出几何引导框架DramaDirector,通过检索真实短剧的深度-姿态参考,结合模式约束SFT和GRPO训练规划器,实现从情节到多镜头短剧的生成,在忠实度、一致性和可控性上优于基线。

Comments 20 pages, 17 figures, 6 tables. Code is available at https://github.com/iLearn-Lab/DramaDirector

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16933 2026-07-07 cs.LG cs.AI 新提交 62%

A Unified Causal-Origin Taxonomy of Distributional Shifts in Reinforcement Learning

强化学习中分布偏移的统一因果起源分类法

Ardianto Wibowo, Paulo E Santos, Amer Baghdadi, Matthew Stephenson, Karl Sammut, Jean-Philippe Diguet

机构 * IMT Atlantique(IMT大西洋) Flinders University(弗林德斯大学) IRL Crossing Priori Analytica CNRS(法国国家科学研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 提出一种统一因果起源分类法,将强化学习中的分布偏移按因果来源(内部/外部)和时间边界(显式/隐式/混合)分类,统一了分布内/外泛化与非平稳性分析。

Comments The paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24264 2026-07-07 cs.CV cs.LG 版本更新 62%

Compositional Generalization Requires Linear, Orthogonal Representations in Vision Embedding Models

组合泛化要求视觉嵌入模型具有线性、正交表示

Arnas Uselis, Andrea Dittadi, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Technical University of Munich(慕尼黑技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 研究组合泛化中表示结构需满足的条件,通过形式化三个需求得出其几何约束,为线性表示假设提供理论基础,还推导维度界限并通过实验验证,揭示模型表示结构与组合泛化的关联。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04907 2026-07-07 cs.AI 新提交 57%

Medi-Gemma: A Hybrid Clinical Decision Support System Integrating Deterministic EMR Analytics and Retrieval-Augmented Generation

Medi-Gemma:一种集成确定性电子病历分析与检索增强生成的混合临床决策支持系统

Mohammed Saim Ahmed Quadri, Yunzhe Xue, Justin W. Ady, Usman Roshan

机构 * New Jersey Institute of Technology(新泽西理工学院) Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍用于伤口病理分类和工作流程自动化的临床决策支持系统Medi-Gemma,其采用解耦框架,经多阶段管道处理数据请求,关键贡献是地面真值注入模块,验证表明该架构有诸多优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04761 2026-07-07 cs.CV 新提交 57%

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

DeGenseGS:4D高斯点云渲染中几何与语义解耦的手术场景理解

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究针对自主手术交互中语义与解剖错位问题,提出DeGenseGS框架,独立建模语义演变与几何变形,用时空纠缠模块同步语义与场景动态,还设计机制确保鲁棒性,提升了手术场景理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 57%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交 57%

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04156 2026-07-07 cs.AI cs.SC 新提交 57%

Language models guide symbolic equation discovery by controlling search

语言模型通过控制搜索来指导符号方程发现

Zikai Xie, Wenmei Li, Man Luo, Jun Jiang, Linjiang Chen

机构 * State Key Laboratory of Precision and Intelligent Chemistry, Hefei National Research Center for Physical Sciences at the Microscale, School of Chemistry and Materials Science, University of Science and Technology of China(精确与智能化学国家重点实验室,合肥微尺度物理科学国家研究中心,化学与材料科学学院,中国科学技术大学) Center for Scientific Intelligence Innovation, Hefei, China(智能创新研究中心,合肥,中国) School of Chemistry, School of Computer Science, University of Birmingham(化学系,计算机科学学院,伯明翰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究科学方程发现,对比语言模型不同角色设定,提出语言模型作搜索控制器的方式(LLM-PySR),经实验其在多任务中平衡了准确率、复杂度等,还发现新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03990 2026-07-07 cs.CV 新提交 57%

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

InSpace:从单张360°图像生成具有结构感知的3D室内场景

Gwanhyeong Koo, Hyunsu Kim, Youngji Kim, Taejae Lee, Siwoo Lim, Sunjae Yoon, Suyong Yeon, Chang D. Yoo

机构 * KAIST(韩国科学技术院) NAVER LABS(NAVER实验室) Chung-Ang University(中央大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对单图像到3D生成扩展到室内场景有挑战的问题,提出InSpace框架,利用360°图像,经估计部分场景几何、生成粗结构、产生详细布局和资产几何三阶段,还建数据集,实验表明其性能强。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03853 2026-07-07 cs.CV 新提交 57%

CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation

CogRad:一种用于放射学报告生成的受认知启发的多智能体框架

Saif Ur Rehman Khan, Hasaan Maqsood, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * German Research Center for Artificial Intelligence(德国人工智能研究中心) Intelligentx GmbH(智能X有限公司) Department of Core Informatics, Graduate School of Informatics, Osaka Metropolitan University(大阪城市大学信息科学研究生院核心信息学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出受认知启发的多智能体框架CogRad,围绕放射科医生阅读过程的四个阶段构建报告生成,通过多智能体协作提升报告质量,在多个数据集上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03516 2026-07-07 cs.SE cs.AI cs.CY 新提交 57%

AGL-1: The Enterprise AI Governance Layer as a Control Plane for Trusted Enterprise Intelligence

AGL-1:作为可信企业智能控制平面的企业人工智能治理层

Roopam W. Sure

机构 * Independent Researcher(独立研究员)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究企业人工智能从实验走向运营面临的治理挑战,介绍AGL-1企业人工智能治理层这一参考模型,基于相关原则将治理问题从检索控制扩展到全执行路径治理,定义七个治理领域。

Comments 16 pages, 1 figure; independent technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03245 2026-07-07 cs.LG 新提交 57%

PhenoNEST: A Neuro-Symbolic Framework for Ontology-Aware Multimodal Plant Phenotyping and Trait Discovery

PhenoNEST:用于本体感知多模态植物表型分析和性状发现的神经符号框架

Jayant Ghadge, Soumyashree Kar, Surya S. Durbha

机构 * Centre of Studies in Resources Engineering (CSRE)(资源工程研究中心) Indian Institute of Technology Bombay(孟买印度理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

AI总结 提出构建多模态粒状知识图谱框架,以弥合语义鸿沟,通过蒸馏野外记录提取实体和关系,结合模型与本体对齐,经视觉语言模型生成软图,引入节点连接多模态子图,成功映射野外观察,助力小麦育种。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02912 2026-07-07 cs.CV cs.HC cs.MM 新提交 57%

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition

看见情感:用于脑电图情感识别的面部表情符号代理建模

Jingjing Hu, Guo Dan, Haofan Cheng, Ying Zeng, Zhan Si, Jinxing Zhou, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) PLA Information Engineering University(中国人民解放军信息工程大学) University of Science and Technology of China(中国科学技术大学) MBZUAI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究将脑电图可解释性重构为跨模态生成任务,提出面部表情符号代理建模框架,把高维脑电图信号转化为面部表情符号,在相关基准测试中取得先进准确率,能生成忠实面部动画展现大脑情感演变。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02814 2026-07-07 cs.MA cs.AI cs.CY 新提交 57%

SovereignNegotiation-Bench: Evaluating User-Owned Personal Agents In Delegated Bargaining Under Privacy, Consent, Evidence, And Institutional Pressure

主权谈判基准:在隐私、同意、证据和制度压力下评估委托谈判中用户拥有的个人代理

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究个人代理替用户谈判的情况,介绍主权谈判基准,其能在多方面约束下评估谈判,通过多种场景验证,指出仅协议成功对用户拥有的谈判代理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02719 2026-07-07 cs.CV 新提交 57%

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

GRCD:用于多发现胸部X光对的地面区域变化检测

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

机构 * Department of Computer Science(计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 57%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02571 2026-07-07 cs.CV 新提交 57%

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

双自适应SAM3:基于低秩专家层的分层路由用于参数高效的医学图像分割

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

机构 * Shenzhen Research Institute, The Chinese University of Hong Kong(香港中文大学深圳研究院) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Imperial Global Singapore (IGS), Imperial College London(伦敦帝国理工学院新加坡帝国全球(IGS))

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出双自适应SAM3框架,通过任务感知的动态专家路由器和参数感知的分解参数化专家设计,兼顾分割精度与参数效率,在医学图像分割上有高表现。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03513 2026-07-07 physics.chem-ph cs.LG 新提交 57%

AquaGen: Scaling generative models to molecular dynamics precision on thousands of atoms

AquaGen:将生成模型扩展到数千个原子的分子动力学精度

Emmanuel Bengio, Sanjeev Raja, Yui Tik Pang, Kerstin Klaeser, Cristian Gabellini, Nikhil Shenoy, Francesco Di Giovanni, Prudencio Tossou

机构 * Valence Labs(Valence实验室) UC Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 介绍AquaGen,首个全原子、显式溶剂、周期边界条件感知生成模型,以低成本从玻尔兹曼分布生成分子构型,用于后处理和预测相关属性,在绝对水合自由能预测上展示效用。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29596 2026-07-07 cs.SI cs.LG 版本更新 57%

Boundary Degree as a Node-level Feature for Epidemic Scenario Identification in Agent-based Cascade Simulations

边界度作为基于智能体的级联模拟中流行病场景识别的节点级特征

Amro Alabsi Aljundi, Galen Harrison, Jiangzhuo Chen, Abhijin Adiga, Anil Kumar Vullikanti, Madhav V. Marathe

机构 * Biocomplexity Institute(生物复杂性研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出边界度作为节点级级联特征,通过消融实验证明其单独提升场景识别准确率19%,并理论证明无边界或边信息时某些场景不可区分。

Comments 28 pages, 10 figures, preliminary version; not final

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20494 2026-07-07 cs.LG physics.ao-ph stat.AP 版本更新 57%

A 10,000-Year Global Stochastic Tropical Cyclone Catalog with Wind-Dependent Track Transitions (WHITS)

具有风依赖性路径转换的10,000年全球随机热带气旋目录(WHITS)

Jennifer Nakamura, Upmanu Lall

机构 * Lamont-Doherty Earth Observatory, Columbia University(哥伦比亚大学拉蒙特-多赫蒂地球观测站) School of Complex Adaptive Systems, Arizona State University(亚利桑那州立大学复杂适应系统学院) Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出WHITS方法,通过非参数半马尔可夫路径生成器生成全球10,000年合成气旋目录,以提高保险损失评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07233 2026-07-07 cs.AI 57%

From "Thinking" to "Justifying": Aligning High-Stakes Explainability with Professional Communication Standards

从‘思考’到‘证明’:将高风险可解释性与专业沟通标准对齐

Chen Qian, Yimeng Wang, Yu Chen, Lingfei Wu, Andreas Stathopoulos

机构 * William & Mary(威廉玛丽学院) Anytime AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出‘结果->证明’方法,通过结构化可解释性框架SEF提升系统输出的可验证性与可靠性,在三个领域四个任务中验证了该方法的有效性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 24628-24637

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 57%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 57%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 57%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05069 2026-07-07 cs.CL 新提交 50%

MIRAGE: Defending Long-Form RAG Against Misinformation Pollution

MIRAGE:抵御长文本检索增强生成中的错误信息污染

Saadeldine Eletter, Ruihong Zeng, Yuxia Wang, Maxim Panov, Aleksandr Rubashevskii, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究长文本检索增强生成(RAG)中错误信息污染问题,提出无训练、模型无关的MIRAGE防御方法,构建基于自然语言推理的跨文档声明图并应用防御声明门,提升事实性,优于现有方法。

Comments ACL-style preprint. 19 pages, 5 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04981 2026-07-07 cs.RO 新提交 50%

Designing Touch for Trauma-Informed Social Robots: A Design Space for Direct and Indirect Actuation

为创伤知情社交机器人设计触觉:直接和间接驱动的设计空间

Madeleine Rischer, Benedikt Bußmann

机构 * AI Ethics Research Hub(人工智能伦理研究中心) Helmut Schmidt University(海姆-施密特大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究如何设计社交机器人的触觉驱动以符合创伤知情护理原则,区分直接和间接触觉,提出包含驱动方式、目标、预期效果三维度的设计空间并分析,为开发创伤敏感社交机器人提供概念基础。

Comments Accepted as a workshop paper at Beyond Words 2, co-located with the International Conference on Social Robotics (ICSR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04945 2026-07-07 cs.CL 新提交 50%

You Frame It: How Conceptual Representations Shape LLM Detection and Reasoning about Antisemitism

你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理

Katharina Soemer, Helena Mihaljević

机构 * Goethe University, Frankfurt(法兰克福歌德大学) HTW Berlin(柏林工业大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04350 2026-07-07 cs.CL 新提交 50%

WPG-MoE: Weak-Prior-Guided Dense Mixture-of-Experts for User-Level Social Media Depression Detection

WPG-MoE:用于用户级社交媒体抑郁症检测的弱先验引导密集专家混合模型

Xian Li, Yuanhe Tian, Yang Yang, Guoqing Wang, Yan Song

机构 * University of Electronic Science and Technology of China(电子科技大学) Zhongguancun Academy(中关村科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究社交媒体抑郁症检测,提出基于共享大语言模型骨干的WPG-MoE框架,通过推导用户级弱语义先验将用户软路由到匹配的专家,以解决单一检测器决策问题,实验表明其性能优于基线。

Comments 23 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏