arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-08-14 至 2026-08-14 共收录 4
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13417 2026-08-14 cs.AI 新提交

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

超越最终得分:面向长期人工智能研究与开发的智能体系统评估

Yiwei Li, Wanli Yang, Hexiang Tan, Xiangzhou Huang, Zhengyu Chen, Ziran Li, Borun Chen, Shanglin Lei, Huaisheng Zhu, Hao Tian, Fei Sun, Xunliang Cai, Jingang Wang

机构 * Meituan(美团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文通过新框架评估7个前沿模型在36项长期任务上的表现,发现当前智能体更像工程优化器,方案多基于已有技术,为模型训练等环节改进指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13010 2026-08-14 cs.CL cs.CR cs.IR 新提交

RAGSieve: Self-Referenced Local Contrast for Knowledge-Poison Detection in Retrieval-Augmented Generation

RAGSieve:用于检索增强生成中知识投毒检测的自参考局部对比方法

Xinlong Xu, Yoshua Y. Li

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Meituan(美团)

AI总结 本研究提出RAGSieve框架,含RSQ与RSG两种局部对比方法,在多QA数据集和投毒构造上实现优异检测性能,联合部署可显著降低RAG攻击成功率且保留部分未投毒检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13006 2026-08-14 cs.CL cs.IR 新提交

EviReform: Evidence-Guided Query Reformulation for Multi-Hop Graph Retrieval

EviReform:面向多跳图检索的证据引导式查询重构

Xinlong Xu, Yoshua Y. Li

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Meituan(美团)

AI总结 EviReform将检索请求修订与图中证据聚合分离,结合原始与残差检索信号传播,在多跳问答数据集上较基线模型提升了Recall@5和F1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏