arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2607.23739 2026-07-28 cs.SI 新提交 67%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02718 2026-07-07 cs.CV cs.AI cs.LG 新提交 67%

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

用基础图像生成模型诊断鸟瞰目标检测器

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) DEVCOM Army Research Laboratory(陆军研究实验室(DEVCOM)) Florida State University(佛罗里达州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究用文本引导生成、属性控制编辑和自动属性验证构建可控合成测试平台,对预训练检测器进行细粒度评估,以预测实际性能差距并指导高效数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18633 2026-06-18 cs.MA 新提交 67%

PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

PersonalPlan: 面向个性化编程学习的多智能体系统规划

Zhiyuan Wen, Jiannong Cao, Peng Gao, Haochen Shi, Wengpan Kuan, Bo Yuan, Xiuxiu Qi

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出PersonalPlan,一种两阶段多智能体规划器,通过分层SFT和奖励自适应GRPO生成可执行、个性化且具有教学支架的计划,在MAP-PPL数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14089 2026-06-15 cs.RO 新提交 67%

A Modular Dual-Arm Apple Harvesting Robot with Enhanced Field Performance

一种具有增强田间性能的模块化双臂苹果采摘机器人

Keyi Zhu, Kyle Lammers, Chaaran Arunachalam, Kaixiang Zhang, Renfu Lu, Zhaojian Li

机构 * Michigan State University(密歇根州立大学) United States Department of Agriculture Agricultural Research Service(美国农业部农业研究局)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出一种模块化双臂苹果采摘机器人,采用垂直堆叠臂实现单树上下区域同时作业,结合基础模型感知、7阶加加速度轨迹生成、线性扫描采摘策略等5项改进,在商业果园中达到80.0%采摘成功率和7.53秒平均单臂周期,91.2%果实达到特级标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 67%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-17 cs.CV cs.AI 新提交 62%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13742 2026-08-17 cs.SE cs.AI cs.LG 新提交 62%

Does ISO-Grounded NFR Specification Improve LLM Code Generation? A Comparison of Rich and Structured Interventions against a Natural-Language Baseline

基于ISO标准的非功能性需求(NFR)规范是否能提升大语言模型(LLM)的代码生成能力?针对丰富干预方式、结构化干预方式与自然语言基线的对比研究

Joào Pedro Monteiro Pereira, Vinicius Cardoso Garcia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究对比了ISO标准下丰富自然语言、结构化JSON与单行基线三种NFR规范对LLM代码生成的影响,发现前者可提升代码静态质量,且语义内容比格式更重要。

Comments 11 pages, 2 figures, Accepted for publication at the 20th Brazilian Symposium on Software Components, Architectures, and Reuse (SBCARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 62%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10657 2026-08-12 eess.IV cs.CV cs.LG 新提交 62%

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

用于跨多个显微镜数据集实现稳健白血病细胞分类的检索增强视觉基础模型

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出基于预训练视觉基础模型的两阶段检索增强框架,经多数据集测试,可实现跨异构数据集的稳健白血病细胞分类,为解决领域偏移问题提供低成本替代方案。

Comments Accepted at SPIE Optics + Photonics 2026 for oral presentation. 23 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10037 2026-08-12 cs.LG cs.AI 新提交 62%

DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

DOCSCHISEL:面向大语言模型智能体的自适应工具文档优化框架

You Lu, Kun Zhang, Bihuan Chen, Xin Peng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM智能体工具文档的异质性与泛化问题,提出DocsChisel自适应优化框架,经实验较原始文档及EasyTool、DRAFT基线大幅提升任务成功率,且开销有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09133 2026-08-11 cs.CV cs.AI 新提交 62%

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

当潜变量遗忘像素时:在扩散Transformer超分辨率中恢复保真度

Yu Shi, Yuyao Zhang, Yu-wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对扩散Transformer超分辨率中VAE压缩导致的保真度下降问题,提出像素锚定超分辨率框架,通过复用VAE前的像素证据提升结果的忠实度,实验验证其性能优于现有潜变量生成式超分辨率方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 62%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04698 2026-08-06 cs.CV cs.AI 新提交 62%

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

训练多模态大语言模型(MLLMs)说“不”:基于拒绝校准GRPO的广义指代表达理解

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对MLLMs因训练缺负样本导致无法拒绝不存在对象的问题,提出RC-GRPO方法,在保持定位精度的同时增强拒绝能力,在三个GREC基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03979 2026-08-05 cs.CV cs.AI 新提交 62%

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Video-DeepResearch:迈向新一代多模态深度研究智能体

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Video-DR智能体框架,通过解耦感知-探索流水线与分阶段工具解锁解决现有多模态模型的模态偏差和知识泄漏问题,构建基准并在视频问答任务上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00119 2026-08-04 cs.CV cs.AI 新提交 62%

Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure

卫星禁运下的战争损失统计:受影响基础设施的零样本估计

Saleh Sakib Ahmed, M. Sohel Rahman

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对冲突区人道主义救援中受影响建筑估计受卫星数据禁运阻碍的问题,提出基于打击前地图的零样本几何投影方法,引入两项技术创新,在2026年中东冲突数据上验证了深度增强大视觉语言模型的优势,确立了混合零样本危机映射范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00007 2026-08-04 cs.CL cs.AI cs.LG 新提交 62%

MemoryForge: Synthesize Lifelong Memory for Human-Like LLM Agents

MemoryForge:为类人LLM智能体合成终身记忆

Bohan Tang, Yiwen Guo

机构 * Tencent(腾讯)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MemoryForge是从简短目标画像合成终身记忆的框架,通过记忆条件让冻结LLM动态检索相关记忆,在两类任务实验中使其表现更类人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28618 2026-07-31 cs.CL cs.AI cs.IR cs.LG 新提交 62%

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

AskChem:面向化学文献综合的以主张为中心的基础设施

Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho

机构 * New York University(纽约大学) Matterstack, Inc.(Matterstack公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 AskChem是一种以主张为中心的跨论文化学搜索基础设施,将检索单元改为带来源的主张,提供多种检索结构与访问接口,在基准测试中提升了DOI可解析率,为化学文献综合提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 62%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22612 2026-07-28 cs.SC cs.AI cs.LG cs.MS 新提交 62%

Quotient Tree Arithmetic: Deferred-Division Computation with Bounded Symbolic Depth and Cross-Subtree Cancellation

商树算法:具有有界符号深度和跨子树抵消的延迟除法计算

Gregory Magarshak

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究提出商树算法(QTA),值以延迟商对表示,比值延迟求值。有界深度增长、跨子树抵消和延迟稳定性三个定理支撑。用于机器学习训练有多种优势,还提出矢量化硬件归一化指令,代数基础是环的局部化,联系代数结构理论与硬件原生算术。

Comments 20 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 62%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20691 2026-07-24 cs.CV cs.AI 新提交 62%

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

用于可靠乳腺超声诊断的空间基础概念瓶颈模型

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究乳腺超声诊断中概念瓶颈模型可信度受监督限制问题,提出空间基础概念瓶颈模型(SG-CBM),利用病变轮廓弱监督,通过导出特定区域训练概念图,经交叉验证等提升诊断指标与概念证据空间对齐,强调数据质量监督设计及可信度验证的必要。

Comments Accepted to the Workshop on Data Quality Aware, High-Performance, and Trustworthy AI Systems for Healthcare at IEEE/ACM CHASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20653 2026-07-24 cs.RO cs.CV cs.LG 新提交 62%

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

PhysCoRe:用于材料感知可变形动力学的物理校正残差世界模型

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对可变形物体操作演变预测难题,提出PhysCoRe模型,结合可微MPM模拟器与两个前馈神经网络,通过MfM和RfD模块实现物理校正与残差学习,提升预测精度,其置信度分布为未来探索提供信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20152 2026-07-23 cs.LG cs.AI stat.ML 新提交 62%

Active Inference as a Convex Markov Decision Process

作为凸马尔可夫决策过程的主动推理

Nikola Milosevic, Nicolás Hinrichs, Nico Scherf

机构 * Max Planck Institute for Human Cognitive and Brain Sciences(马克斯·普朗克人类认知与脑科学研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究将主动推理构建为策略优化,证明其可表述为凸马尔可夫决策过程,分析了相关公式并推导MD算法,表明结合世界模型学习与策略优化能赋予主动推理执行性强化学习结构,为其奠定理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19793 2026-07-23 cs.AI cs.CV 新提交 62%

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

多模态智能体搜索中的无声故障:一种诊断分类法与跨评判者评估

Zhengxian Wu, Junjie Gao, Kai Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态智能体搜索中无声故障这一隐藏可靠性问题,引入六类分类法,构建轨迹级诊断管道,通过实验表明表面准确性高估真实正确性,且无声故障与能力相关、常转移。

Journal ref SIGIR 2026 SynthIR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18850 2026-07-22 cs.CV cs.AI 新提交 62%

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

OPD-IAD:通过策略内自蒸馏从语言判断到工业异常检测

Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究如何利用大型视觉语言模型进行工业异常检测,提出OPD-IAD框架,通过策略内自蒸馏和语言引导视觉锚定,将语言判断转化为像素级异常图,在相关方法中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17564 2026-07-21 cs.AI cs.LG 新提交 62%

ZifaMem: Structured Memory for Persona, Preference, and Emotional Continuity in AI Companions

ZifaMem:人工智能伴侣中用于人物形象、偏好和情感连续性的结构化记忆

Jingzhe Fang, Guozhi Xu, Yunfan Cui, Xiaochen Yang, Zhangyu Hua

机构 * ZifaCorp(紫发公司) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对人工智能伴侣情感连续性问题,提出结构化记忆系统ZifaMem,通过组织对话形成多种记忆模型。实验表明其能提升情商得分、改善人物形象基础等,多种记忆系统均有改善,且ZifaMem与Mem0在主要偏好端点统计等效,相关工具已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17136 2026-07-21 cs.SE cs.AI cs.HC cs.LG 新提交 62%

Teach it to stop, not just to click

教它停止,而不仅仅是点击

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体计算机使用强化学习中单次运行结果的误导性,通过验证器引导修复35B智能体,发现成功率受上游方差主导,修复能力分两层,框架级修复有条件,还发现自身过度断言,发布库用于k种子报告,首次进行多模态分段聚合策略内自蒸馏更新。

Comments 15 pages, 3 figures. Reliability protocol and library (cua_reliability), completion verifier, and leakage-free held-out plus bootstrap evaluation harness are open-source

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16903 2026-07-21 cs.CY cs.AI cs.CL cs.LG 新提交 62%

A Method for Learning Value Systems in Generative AI

一种在生成式人工智能中学习价值系统的方法

Andrés Holgado-Sánchez, Holger Billhardt, Sascha Ossowski

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究生成式人工智能中价值系统学习问题,提出将先前验证的方法用于此场景,基于成对偏好数据同时学习价值基础实现与价值系统表示,算法动态排序,评估显示其性能优、权衡小且可解释性强。

Comments Full version of a to be published paper in proceedings of the 9th AAAI/ACM conference in AI, Ethics and Society (AIES 2026). Includes supplementary material. 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏