arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Meituan(美团)

2026-04-14 至 2026-04-14 共收录 4
2604.11778 2026-04-14 cs.CL cs.AI

General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks

General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力

Junlin Liu, Shengnan An, Shuang Zhou, Dan Ma, Shixiong Luo, Ying Xie, Yuan Zhang, Wenling Yuan, Yifan Zhou, Xiaoyu Li, Ziwen Wang, Xuezhi Cao, Xunliang Cai

机构 * University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11689 2026-04-14 cs.CV cs.RO

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

LARY:一种产生通用视觉到动作对齐基准的潜在动作表示

Dujun Nie, Fengjiao Chen, Qi Lv, Jun Kuang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。

Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10425 2026-04-14 cs.CV

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

DiningBench:面向饮食领域的分层多视角基准测试平台

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei Lin, Yong Liu, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Meituan(美团) Wuhan University(武汉大学)

AI总结 本文提出DiningBench,一个分层多视角基准,用于评估视觉语言模型在饮食领域感知与推理能力,包含3021种不同菜品,通过多视角输入和链式推理方法,揭示了当前VLM在细粒度视觉识别和营养推理上的不足。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25866 2026-04-14 cs.CV

DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning

DeepSketcher:内化视觉操作以实现多模态推理

Chi Zhang, Haibo Qiu, Qiming Zhang, Zhixiong Zeng, Lin Ma, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Meituan Inc(美团) Independent Researcher, China(独立研究者)

AI总结 DeepSketcher通过构建图像-文本交织数据集和自包含模型,实现了无需外部工具的视觉思考,提升了多模态推理能力。

Comments CVPR2026 FINDINGS

详情

展开后加载摘要…

URL PDF HTML 收藏