arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2506.16042 2026-05-19 cs.AI cs.LG cs.OS 62%

OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents

OSWorld-Human: 评估计算机使用代理的效率基准

Reyna Abhyankar, Qi Qi, Yiying Zhang

机构 * OpenAI Anthropic Google DeepMind(谷歌DeepMind) ByteDance(字节跳动) Agent S2 GTA1 Lei Jedi

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了计算机使用代理在OSWorld基准上的时间性能,发现大模型调用导致高延迟,并构建了包含人类轨迹的OSWorld Human数据集,评估发现最佳代理仍需更多步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17789 2026-05-19 cs.CL cs.AI 62%

SocialMemBench: Are AI Memory Systems Ready for Social Group Settings?

SocialMemBench: AI记忆系统是否准备好应对社交群体环境?

Olukunle Owolabi

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SocialMemBench,一个针对多党社交群体的AI记忆系统评估基准,通过人类验证的合成社交网络,测试记忆系统在处理共享历史、群体规范和成员退出等复杂社交场景中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17691 2026-05-19 cs.CL cs.AI 62%

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

验证你的权威:在多标签先例处理分类上对LLM进行基准测试

M. Mikail Demir, M. Abdullah Canbaz

机构 * Department of Information Science and Technology(信息科学与技术系) College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院) University at Albany, SUNY(萨利纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的评估框架,通过专家标注的数据集对现代大语言模型进行基准测试,引入了平均严重性误差指标,以更准确地衡量分类错误的实践影响。

Comments Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17565 2026-05-19 cs.AI cs.CL 62%

Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models

泛化还是记忆?国际象棋训练语言模型的脆弱性测试

Ethan Tang

机构 * School of Computing and Augmented Intelligence(计算与增强智能学院)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了国际象棋训练语言模型是泛化还是记忆,通过测试发现其高性能主要源于模式匹配,并展示了LLM-Modulo框架在提升国际象棋谜题解决性能上的效果,证明了与外部验证器结合的通用LLM比直接训练合成数据更灵活。

Comments 14 pages, 2 figures, 4 tables, 3 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17382 2026-05-19 cs.AI cs.CL cs.GR 62%

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

机构 * AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室) Department of Computer Engineering and Information Technology(计算机工程与信息科技系) Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系) University of Genoa(热那亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出QQJ框架,通过专家设计的多维评分标准和高质量标注集校准大语言模型评估器,实现与人类判断一致的可扩展评估方法,验证了结构化定性判断在大规模应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17380 2026-05-19 cs.AI cs.CR cs.LG 62%

ADR: An Agentic Detection System for Enterprise Agentic AI Security

ADR:一种用于企业代理AI安全的代理检测系统

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

机构 * Uber

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。

Comments Accepted at MLSys 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14466 2026-05-19 cs.CL cs.AI 62%

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 62%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17079 2026-05-19 cs.CL cs.AI cs.CY 62%

Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench

LLMs能否像消费者一样思考?通过ConsumerSimBench进行大众级反应重建的基准测试

Tianyu Wang, Jiajun Li, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ConsumerSimBench基准,通过1553个真实中国社交媒体话题和23122个原子化、规则审核过的标准,评估LLM在模拟消费者反应方面的能力,揭示了前沿模型在预测高语境中文消费者讨论中实际关心内容方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16650 2026-05-19 cs.CL cs.AI 62%

SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

SKG-Eval: 通过增量语义知识图谱进行多轮对话的有状态评估

Avijit Shil, Suman Samui

机构 * Maulana Abul Kalam Azad University of Technology(Maulana Abul Kalam Azad 工业技术大学) National Institute of Technology Durgapur(Durgapur 国家理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SKG-Eval框架,通过增量语义知识图谱模型,解决多轮对话评估中长距离不一致问题,提供可解释的评估信号和可复现的评分结果。

Comments 36 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07905 2026-05-19 cs.CL cs.AI 62%

CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers

CoCoReviewBench:面向AI审稿人完整性和正确性的基准测试

Hexuan Deng, Xiaopeng Ke, Yichen Li, Ruina Hu, Dehao Huang, Derek F. Wong, Yue Wang, Xuebo Liu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Zhongguancun Academy, Beijing, China(中关村学院) Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院) Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系) NLP²CT Lab, Department of Computer and Information Science, University of Macau, China(澳门大学自然语言处理实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoCoReviewBench,通过构建领域特定的基准子集和专家注释,提升AI审稿人评估的完整性和正确性,分析显示AI审稿人仍存在正确性不足和幻觉问题,强调推理模型的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11895 2026-05-19 cs.LG cs.AI cs.SE 62%

DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models

DevBench:一个现实的、面向开发者的代码生成模型基准测试

Adarsh Kumarappan, Pareesa Ameneh Golnari, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

机构 * California Institute of Technology(加州理工学院) Microsoft(微软公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DevBench通过真实开发者数据和生成模型合成,构建了包含六种编程语言和任务的1800个实例,评估大语言模型在代码补全任务中的表现,揭示模型在语法精度、语义推理和实用价值上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16268 2026-05-19 cs.HC cs.AI cs.LG 62%

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流

Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM的AI分流代理,通过多轮对话和提问提高客户问题分类准确性,提升银行客户服务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15341 2026-05-18 cs.LG cs.AI 62%

LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design

LEAP:LLM在迭代科学设计中的轨迹级评估

Marilyn Zhang, Tianfeng Chen, Fabián Barzuna, Ankita Rathod, Mark E. Whiting

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LEAPBench框架,通过轨迹级评估方法揭示LLM在迭代科学设计中的学习效率,发现传统基于结果的评估方法存在偏差,轨迹指标能更准确反映效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14752 2026-05-15 cs.LG cs.AI 62%

Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions

认知不确定性引导的知识蒸馏用于准确分类学生误解

Qirui Liu, Hao Chen, Weijie Shi, Jiajie Xu, Jia Zhu

机构 * South China University of Technology(华南理工大学) Tencent Financial Technology(腾讯金融科技) The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application, Zhejiang Normal University(浙江省智能教育技术与应用重点实验室,浙江师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段知识蒸馏框架,通过认知不确定性机制挖掘高价值样本,提升学生误解分类的准确率,实验表明在少量数据下优于现有方法。

Comments ACL 2026 Findings. 10 pages, 5 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 62%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 62%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 62%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14055 2026-05-15 cs.CL cs.AI 62%

PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts

PEML:参数高效多任务学习与优化连续提示

Anjir Ahmed Chowdhury, Syed Zawad, Xiaolong Ma, Xu Dong, Feng Yan

机构 * IBM Research(IBM研究院) Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEML,通过优化连续提示和低秩适应实现多任务学习的高效微调,实验显示在多个基准测试中准确率提升显著。

Comments 26 pages, 8 figures, 18 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13848 2026-05-15 cs.AI cs.CL cs.DC 62%

GraphBit: A Graph-based Agentic Framework for Non-Linear Agent Orchestration

GraphBit:一种基于图的代理框架用于非线性代理编排

Yeahia Sarker, Md Rahmat Ullah, Musa Molla, Shafiq Joty

机构 * MTSU InfinitiBit GmbH Salesforce Research

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GraphBit通过显式定义DAG流程提高代理编排的可重复性和可审计性,在多个基准任务中表现优于现有框架,实现高准确率、低延迟和高吞吐量。

Comments 12 pages, 5 figures, 4 tables. Submitted to arXiv, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13485 2026-05-14 cs.LG cs.CL cs.IT math.IT 62%

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

Transformer中的有效上下文:碎片化与分词分析

Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten

机构 * Department of Communications and Electronics(通讯与电子系) Institut Polytechnique de Paris(巴黎高等理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了不同表示方式对Transformer有限上下文预测的影响,发现碎片化会增加信息损失,而分词方法能扩展上下文范围,揭示了表示选择的信息论框架。

Comments 30 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13021 2026-05-14 cs.LG cs.AI 62%

Rethinking Efficient Graph Coarsening via a Non-Selfishness Principle

重新思考通过非自私原则的高效图粗化

Xu Bai, Bin Lu, Kun Zhang, Shengbo Chen, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学信息科学与电子工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) School of Environment Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学环境科学与工程学院) School of Artificial Intelligence, Nanchang University, Nanchang, China(南昌大学人工智能学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(中国科学院地理科学与资源研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非自私原则的图粗化方法NOPE,通过局部各向同性假设降低计算复杂度,实现线性内存和近线性时间复杂度,实验显示在高阶节点上具有显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12645 2026-05-14 cs.CL cs.AI 62%

Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

通过强化学习训练LLMs进行意图感知的个性化问答

Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG 62%

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 62%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12525 2026-05-14 cs.SI cs.AI cs.CL 62%

PERCEIVE: A Benchmark for Personalized Emotion and Communication Behavior Understanding on Social Media

PERCEIVE:面向社交媒体个性化情绪与交流行为理解的基准测试

Jian Liao, Yujin Zheng, Suge Wang, Jianxing Zheng, Deyu Li

机构 * School of Computer and Information Technology, Shanxi University, China(山西大学计算机与信息学院) Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, Shanxi University, China(教育部计算智能与中文信息处理重点实验室,山西大学,中国) Joint Laboratory of Tourism Big Data in Shanxi Province, China(山西省旅游大数据联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PERCEIVE是首个整合五维社交感知的双语大规模基准,通过真实用户互动捕捉读者个性化情绪响应,推动社交智能NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12477 2026-05-13 cs.LG cs.CL 62%

MEME: Multi-entity & Evolving Memory Evaluation

MEME:多实体与演进记忆评估

Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能实验室) Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) NAVER AI Lab(NAVER人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨多实体与演进内存系统在持续环境中的表现,发现默认配置下所有系统在依赖推理上表现不佳,仅文件型代理配合Claude Opus 4.7能部分改善,但成本高且不实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24985 2026-05-13 cs.CV cs.AI cs.LG cs.RO 62%

DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes

DarkQA:在低光室内场景中对视觉-原始问题进行问答的视觉语言模型基准测试

Yohan Park, Hyunwoo Ha, Wonjun Jo, Tae-Hyun Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DarkQA针对低光环境下视觉语言模型的感知基本能力进行基准测试,通过多级低光条件评估,揭示模型在复杂任务中的局限性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11727 2026-05-13 cs.AI cs.CL cs.CV 62%

Allegory of the Cave: Measurement-Grounded Vision-Language Learning

洞穴的寓言:基于测量的视觉-语言学习

Kepeng Xu, Li Xu, Gang He, Wenxin Yu

机构 * Xidian University(西电大学) Southwest University of Science and Technology(西南科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏