Neuron-Aware Active Few-Shot Learning for LLMs
面向大语言模型的神经元感知主动少样本学习
机构 * University of Pittsburgh, USA(匹兹堡大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出NeuFS框架,利用神经元激活模式从模型内部动态选择最具价值的少样本示例,提升大语言模型在专业领域的适应性和性能。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向大语言模型的神经元感知主动少样本学习
机构 * University of Pittsburgh, USA(匹兹堡大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出NeuFS框架,利用神经元激活模式从模型内部动态选择最具价值的少样本示例,提升大语言模型在专业领域的适应性和性能。
BuilderBench:智能体的构建模块
机构 * Princeton University(普林斯顿大学) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。
Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench
长程推理的递归模型
机构 * Toyota Technological Institute at Chicago(丰田技术研究所)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG
AI总结 提出递归模型,通过递归调用自身在隔离上下文中解决子任务,突破上下文长度限制,理论证明可指数级降低活跃上下文需求,实验验证在SAT求解和围棋任务中提升长程准确性。
Comments in ICML 2026
CheckRLM: 检索增强推理中的有效知识-思维连贯性检查
机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) ; Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) ; Northeastern University(东北大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 提出CheckRLM框架,通过检索增强生成及时检查和纠正推理链中的事实错误,确保推理与知识一致,降低长程推理错误累积成本。
Comments 24 pages, 7 figures
多样证据,更好预测:信息不对称下的多智能体商议
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; College of Engineering, Carnegie Mellon University(卡内基梅隆大学工程学院)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI
AI总结 针对多智能体系统中信息同质化导致商议效果不佳的问题,提出通过设计信息不对称(共享公开证据与私有证据)降低智能体间误差相关性,并构建InfoDelphi框架,在预测任务上显著提升性能。
群体跟随机器人的自适应陪伴:处理动态变化的群体编队
机构 * National Cheng Kung University(国立成功大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出基于视觉语言模型的自适应群体陪伴方法,通过语义推理推断同伴位置、维持社交距离并理解群体动态,结合MPPI控制器实现稳定安全跟随,在五个场景中成功率提升15%,碰撞率降低25%。
Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
CaP-X: 用于基准测试和改进机器人操作编码智能体的框架
机构 * nvidia ; stanford(斯坦福大学) ; cmu(卡内基梅隆大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。
Aria: 基于依赖图的检索与迭代自动形式化智能体
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI
AI总结 提出Aria系统,通过两阶段思维图过程递归分解定理陈述为依赖图并构建形式化,结合AriaScorer验证语义正确性,在ProofNet、FATE-X和同调猜想数据集上显著超越现有方法。
GMO-E$^2$DIT:面向电商图像的接地多操作编辑
机构 * Wuhan University(武汉大学) ; Xi’an Jiaotong University(西安交通大学) ; Sun Yat-sen University(中山大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 提出GMO-E$^2$DIT框架,通过VLM代理构建区域接地编辑议程,结合掩码条件图像编辑器和反思循环,实现多操作、可审计的电商图像编辑,在指令准确性和编辑保真度上超越现有基线。
CaST-Bench:面向视频问答的因果链时空推理基准
机构 * Woven by Toyota(丰田公司) ; The University of Tokyo(东京大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 提出CaST-Bench基准,通过构建包含因果链时空标注的数据集和评估指标,系统评测视觉语言模型在视频因果推理中的细粒度证据定位能力。
Comments CVPR 2026
CreativityPrism:大语言模型创造力的跨域评估框架
机构 * University of Pittsburgh(匹兹堡大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Notre Dame(诺特丹大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 提出CreativityPrism框架,整合发散思维、创意写作和逻辑推理三个领域的八项任务,从质量、新颖性和多样性三个维度评估LLM创造力,发现前沿模型在创意写作和逻辑推理上领先,但在发散思维上无显著优势,且各维度间相关性弱。
Comments Published in Transactions on Machine Learning Research (06/2026)
谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号
机构 * Argonne National Laboratory(阿贡国家实验室) ; University of Chicago(芝加哥大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。
Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)
SPLIT:英语和乌克兰语LLM回应中的跨语言共情与文化根基
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SPLIT基准测试,评估LLM在英语和乌克兰语危机情境下的共情准确性、语言自然性和文化根基,发现模型在乌克兰语中表现下降,且人类与AI评估者一致性弱。
Comments 19 pages, 5 figures, 3 tables. Benchmark paper introducing SPLIT for evaluating empathy, linguistic naturalness, and cultural grounding in English and Ukrainian LLM responses
OntoLearner: 一个用于大语言模型本体学习的模块化Python库
机构 * TIB – Leibniz Information Centre for Science and Technology(TIB – 莱布尼茨科学与技术信息中心) ; L3S Research Center, Leibniz University of Hannover(L3S研究中心,莱布尼茨汉诺威大学) ; IBM Research(IBM研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出OntoLearner框架,统一本体访问、LLM驱动学习管道和标准化基准,通过跨领域大规模实验揭示本体学习的主要瓶颈是模型知识编码与本体组织的结构性不匹配。
Comments 30 pages. Under review at Nature Communications. This version is reformatted with a different section structure; content is unchanged
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
EO-Agents: 用于地球观测假设生成的三智能体LLM流水线
机构 * ADNET Systems(ADNET系统)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出基于NASA地球观测知识图谱的三智能体LLM流水线,通过图神经网络排序数据集对,生成并评估结构化研究假设,在1475个数据集上产生160个跨领域假设。
Comments Accepted at the ICML 2026 AI for Science Workshop
Pre-Flight: 评估大型语言模型航空运营知识的基准
机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) ; Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。
Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)
通过可验证的文字编程指导用户验证LLM生成的代码
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出可验证文字编程框架,通过无歧义的自然语言文档作为中间层,结合细粒度不匹配检测和验证模块,帮助用户有效验证LLM生成代码,将pass@1从28.7%-73.2%提升至65.4%-93.5%。
Comments 12 pages
史诗组织 vs. 需求对齐的 Gherkin:基于 LLM 的验收标准生成的实证评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究比较史诗组织与需求对齐的 LLM 生成 Gherkin 验收标准,发现史诗组织在正确性、可执行性和完整性上更优,语义覆盖率相当。
Comments Accepted for publication at the International Conference on Software Engineering of Emerging Technologies (SEET 2026)
当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现
机构 * Independent Researcher(独立研究员) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。
LLM人格的双重性质:聚合倾向与框架依赖的几何结构
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。
GroundEval:有状态智能体评估中LLM评判的确定性替代方案
机构 * Independent Researcher(独立研究员)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出GroundEval框架,通过记录智能体搜索、获取、引用和访问的证据轨迹,以确定性方式评估其回答,解决LLM评判无法检测的证据路径失效问题。
Comments Streamlined entry point into framework
LLM 代理能力评估的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; North China Electric Power University(华北电力大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。
使用大语言模型对Linux/bash考试进行自动评分:一种四层认知分类方法
机构 * Universidade de Vigo, Department of Computer Science, ESEI-Higher School of Computer Engineering(维戈大学计算机科学系ESEI高等计算机工程学院) ; IFCAE-Institute for Research in Physics, Computing and Aerospace Science(IFCAE物理、计算与航空航天科学研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估四种前沿大语言模型(GPT、Claude Opus、Gemini、GLM)在Linux/bash命令评分中的表现,采用四层认知分类法,发现Gemini 3.0 Pro配合评分标准提示达到最高人机一致性(ICC=0.888),且问题复杂度是评分难度的可靠预测因子。
多轮LLM编程对话中的回归累积
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
RuleChef:将LLM任务知识扎根于可人工编辑的规则
机构 * KR Labs(KR实验室) ; TU Wien(维也纳工业大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出RuleChef框架,利用大语言模型为NLP任务生成可执行规则,并通过示例和人工反馈迭代优化,最终得到快速、确定且可检查的规则系统。
Comments 8 pages
结构化数据的进化特征工程
机构 * University of Michigan(密歇根大学) ; Google Research(谷歌研究院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 提出基于LLM进化的特征工程框架EFE,通过Python程序表示变换,利用数据集上下文和验证集性能反馈优化,在时间序列和表格预测任务中提升准确性和可解释性。
Comments 9 page main content, 41 pages in total
EduArt:评估大型语言模型艺术史知识的教育级基准
机构 * University of Bologna(博洛尼亚大学) ; Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti)) ; University of Copenhagen(哥本哈根大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 提出EduArt基准,包含871道人工出题的艺术史题目,评估多模态大模型在不同格式和语言下的知识掌握与推理能力,发现格式显著影响表现,多选题高估模型能力。
自信地扩展:校准LLM的置信度以实现自适应测试时扩展
机构 * Shanghai Jiao Tong University(上海交通大学) ; Southeast University(东南大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。