K-EXAONE Technical Report
K-EXAONE 技术报告
机构 * LG AI Research(LG人工智能研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。
Comments 29 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
K-EXAONE 技术报告
机构 * LG AI Research(LG人工智能研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。
Comments 29 pages
V-FAT:基于文本偏见的视觉真实性基准测试
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Meituan(美团) ; University of Oxford(牛津大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。
Comments 12 pages, 6 figures
LPFQA: 一个基于长尾专业论坛的LLM评估基准
机构 * ByteDance Seed Peking University(字节跳动种子北京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。
Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) ; Stony Brook University(石溪大学) ; Brookhaven National Laboratory(布鲁赫斯国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。
Comments 34 pages, 18 figures
WRAVAL -- 书写辅助评估
机构 * Amazon Fire Tablets(亚马逊火平板) ; Amazon Devices Product(亚马逊设备产品部) ; Amazon Devices OS(亚马逊设备操作系统部)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 WRAVAL提出了一种评估框架,用于评估小型语言模型在非推理任务中的能力,特别是在缺乏预定义数据集的情况下,通过任务特定微调展示其潜力。
表格作为大语言模型的一种模态
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; University of Michigan(密歇根大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 TAMO通过将表格视为独立模态,结合文本令牌,提升大语言模型对表格数据的推理能力。
Comments Accepted to NeurIPS 2025
自我验证就是通过日本司法考试所需
机构 * Keio University(.keio大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。
LongBench Pro: 一个更现实且全面的双语长上下文评估基准
机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 LongBench Pro通过人机协作构建,提供1500个双语长上下文样本,评估46个模型发现长上下文优化比参数扩展更有效,有效上下文长度较短且存在跨语言偏差,混合思考设计具有潜在优势。
当拒绝转为接受:量化基于LLM的科学评审员对间接提示注入的脆弱性
机构 * BITS Pilani ; KIIT University(KIIT大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究量化了基于LLM的科学评审系统对间接提示注入攻击的脆弱性,揭示了通过隐藏文本注入和布局感知攻击翻转评审决定的风险,并提出WAVS指标评估此类攻击的严重性。
Encyclo-K:通过动态组成的知识陈述评估LLM
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学) ; The University of Manchester(曼彻斯特大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Encyclo-K通过动态组合知识陈述,提出了一种评估LLM全面理解能力的基准测试框架,有效解决了现有基准测试的局限性。
SciEvalKit: 一个用于科学通用智能的开源评估工具包
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SciEvalKit是一个开源工具包,用于评估科学通用智能,涵盖科学多模态感知、推理、理解等核心能力,并提供灵活的评估流程和可定制的基准测试环境。
Something Just Like TRuST:Span和目标的毒性识别
机构 * Penn State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 TRuST是一个大规模数据集,用于评估和减轻大型语言模型的毒性,通过精心设计的定义和标注方案,提升毒性检测、目标识别和有毒词汇识别的性能。
大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。
GRAPHMOE: 通过引入自我反思机制提升混合专家网络的认知深度
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) ; The University of Manchester(曼彻斯特大学) ; The University of Pittsburgh(匹兹堡大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Sydney(悉尼大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 GRAPHMOE通过引入自我反思机制,提升混合专家网络的认知深度,实现语言模型的先进性能。
Comments 10 pages
基准成功,临床失败:当强化学习优化于基准,而非患者
机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) ; University of Bonn(波恩大学) ; Lamarr Institute(拉马尔研究所) ; Department of Health Queensland(昆士兰健康部) ; Griffith University(格里菲斯大学) ; University Hospital Bonn(波恩大学医院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。
多模态大语言模型在空间智能方面的综合评估
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出EASI框架,用于评估多模态大语言模型在空间智能方面的综合表现,揭示GPT-5在SI中的优势与不足,并展示专有模型在困难任务上的劣势。
Comments Codebase: https://github.com/EvolvingLMMs-Lab/EASI/ ; Leaderboard: https://huggingface.co/spaces/lmms-lab-si/EASI-Leaderboard
关于LLM辅助临床试验招募的综述
机构 * University of Tübingen(图宾根大学) ; Boehringer Ingelheim(勃林格殷曼)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了LLM在临床试验招募中匹配试验与患者任务的应用,分析了现有方法和挑战,并探讨了未来发展方向。
Comments Accepted to IJCNLP-AACl 2025
高效深度学习用于短期太阳能辐照时间序列预测:胡志明市的基准研究
机构 * University of Surrey(塞维利亚大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过对比十种深度学习架构,发现Transformer在短期太阳能辐照预测中表现最佳,且通过知识蒸馏实现模型压缩,降低误差。
Comments preprint, 40 pages
Bielik 7B v0.1:波兰语言模型——开发、见解与评估
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Bielik 7B v0.1通过创新技术提升波兰语处理能力,实现多项NLP任务性能提升,为语言AI发展提供新基准。
Journal ref Computer Science 26(4) (2025) 131-161
OmniBench: 向通用多语言模型的未来迈进
机构 * University of Manchester(曼彻斯特大学) ; Queen Mary University of London(伦敦大学玛丽女王学院) ; Hongkong University of Science and Technology(香港科学与技术大学) ; Nanjing University(南京大学) ; Dartmouth College(达特茅斯学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 OmniBench提出了一种评估通用多语言模型三模态处理能力的基准,揭示了现有模型在多模态推理中的不足,并提出OmniInstruct数据集以改进训练方法。
Comments Accepted by The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS2025)
SelfCheck-Eval: 一个用于大型语言模型中零资源幻觉检测的多模块框架
机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) ; L3S Research Center, Leibniz University Hannover(汉诺威莱布尼茨大学L3S研究中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 SelfCheck-Eval提出了一种多模块框架,专门用于检测大型语言模型在数学推理中的幻觉问题,通过三个独立模块提升检测效果。
校准大语言模型法官:用于快速可靠不确定性估计的线性探针
机构 * FAIR at Meta(Meta 的 FAIR 研究所) ; Meta Superintelligence Labs(Meta 超智能实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。
弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。
Comments AAAI 2026 (Oral)
HeartBench: 探索大语言模型中拟人智能的核心维度
机构 * Ant Group(蚂蚁集团) ; Xiamen University(厦门大学) ; Beijing Normal University(北京师范大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 HeartBench通过理论驱动的分类体系评估中文大语言模型的情感、文化和伦理维度,揭示其在拟人智能方面的性能上限及改进方向。
Comments 10 pages
揭示语言模型的学习心智:一种认知框架与实证研究
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) ; Microsoft Research Asia(微软亚洲研究院) ; University of Cambridge(剑桥大学) ; Microsoft(微软)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种认知框架,将学习能力分解为三个维度,并通过实证研究揭示LLMs在不同学习场景下的表现与局限性。
创意代理:通过想象力赋能代理以完成创意任务
机构 * School of Computer Science Peking University(北京大学计算机学院)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。
Comments The first two authors contribute equally
Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496
O3SLM:开放权重、开放数据和开放词汇草图-语言模型
机构 * IISc(印度理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。
Comments Accepted to AAAI 2026
VTCBench: 视觉-语言模型能否通过视觉-文本压缩理解长上下文?
机构 * 1 Institute of Automation, Chinese Academy of Sciences ; 2 School of Artificial Intelligence, University of Chinese Academy of Sciences ; 3 Centre for Artificial Intelligence ; Robotics, Hong Kong Institute of Science \& Innovation, CAS ; 4 Independent Researcher
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 VTCBench评估视觉-文本压缩对视觉语言模型长上下文理解能力的影响,发现多数模型在处理压缩信息时表现不佳。
注意力不是你需要的
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于格拉斯曼流的无注意力架构,通过低秩子空间操作实现更结构化的神经推理,实验显示其在语言建模和自然推理任务中表现优异。
通过可微内部对齐嵌入实现嵌入式安全对齐智能
机构 * Sardar Vallabhbhai National Institute of Technology (SVNIT)(萨达尔·瓦拉布尔·尼尔达理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出嵌入式安全对齐智能框架,通过可微内部对齐嵌入实现多智能体强化学习中的安全对齐,探讨了反事实对齐惩罚、感知注意力等机制及理论性质。
Comments 32 pages, 1 figure. Theoretical framework; no empirical results