Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?
机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。
PCAP-LM:一种用于TLS批量流量分析的LLM原生文本表示
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 该研究针对LLM分析TLS流量时的上下文窗口溢出问题,提出PCAP-LM表示,实现812倍压缩,在取证问答任务中准确率达99.3%,但存在TCP重传24%漏检等局限。
Comments 6 pages
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
MMHBench:用于长视频心理健康理解的多视角基准测试集
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。
从零开始多智能体编码中作为一等公民的协作模式的实证研究
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究构建多智能体编码基准MSEval,发现组织拓扑与模型能力对速度-成本-质量权衡影响相当,结构化流水线表现最优,为多智能体软件开发评估提供严格标准。
手语问答:手语理解的新任务、基准与基线模型
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究提出手语问答新任务,构建基于PHOENIX14T与CSL-Daily的SignQA基准,设计带特定模块的基线模型,实验显示其在各问题类别上优于代表性视觉-语言模型。
通过功能、证据和验证评估智能体生物信息学
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
探索物理问题中的结构:AI智能体能否发现统计力学映射?
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究以StatMechBench-v0为基准,评估基于LLM的“提出-验证-修正”智能体发现统计力学映射的能力,揭示其推理局限并提出验证栈的设计方向。
Comments Accepted to the AID-Wild workshop at CAIS 2026
RAGuard:一种针对检索增强生成系统数据中毒的分层防御框架
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对RAG系统的语料库中毒攻击,提出分层防御框架RAGuard,含对抗微调检索器与ZKIP两层,可将攻击成功率降至0,且保持检索性能,相关资源已开源。
Comments Accepted to NeurIPS ResponsibleFM 2025, AAAI FrontierIR 2026
ClinLens:面向纵向多模态临床数据科学的长周期编码智能体
机构 * Shandong University(山东大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。
MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。
梅西耶:用于跨基准智能体评估的高分辨率语料库
机构 * Andromede AI(仙女座人工智能公司)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。
MARS:用于重复订单食品配送推荐的多智能体重排
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对重复订单食品配送推荐,提出MARS模块化多智能体重排框架,分两阶段推荐,结合多种信号与推理。通过实验评估,贡献包括给出集成框架、证明预训练主干结合轻量级检索有竞争力、建立可重现评估设置。
DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧
机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) ; School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Automation, Southeast University(东南大学自动化学院) ; Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。
RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试
机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) ; Hefei University of Technology(合肥工业大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; United Arab Emirates University(阿联酋大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。
ERUnderstand:在结构化实体关系图上评估视觉语言模型
机构 * Temple University(天普大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。
用于大语言模型代理中污点限制的代理权限策略代数
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。
Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables
成功并非不言自明:在智能体评估中审核成功溯源
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究智能体评估中成功溯源问题,通过AcquaBench的匹配值替换和聚类分析审核,在不同场景测试,发现成功与正确值相关,行为依赖可能超出预期,模型比较有分数差距变化,建议基准报告成功及信息状态支持情况。
Comments 17 pages, 3 figures, including supplementary material. Code: https://github.com/luojingkun22/acquabench
Zing:大语言模型的社交智能
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。
确信错误:前沿大语言模型规则评估中的异常链崩溃
机构 * Aethis
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。
Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark
SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试
机构 * Shaqiu Community(沙丘社区)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。
Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench
视觉语言模型中的图表欺骗:从漏洞到缓解
机构 * York University(约克大学) ; University of Alberta(阿尔伯塔大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。
面向维度建模课程的教学驱动型教师助手
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对维度建模课程,提出教学驱动型教师助手,无需商业大语言模型预算或GPU设施。架构含确定性模块处理多任务,大语言模型作语言执行器。评估学生问题发现标准检索不足,确定性管道精度高但覆盖有限,为教学策略提供新思路。
Journal ref International Conference on Computer Supported Education, May 2026, Benidorm/Spain, France. pp.177-189
MedLoCoMo:用于大语言模型的长上下文多会话医学对话基准
机构 * Northwestern University(西北大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多入院医学对话临床推理方面的不足,构建MedLoCoMo基准,通过特定方法生成问答项目,含100个患者时间线,发现跨入院推理比局部证据使用难,提供代码和基准供使用与复现。
技能自我博弈:通过协同进化技能拓展大语言模型能力边界
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。
企业人工智能代理的动态能力范围界定:一个合成数据集和三源权限架构
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究企业人工智能代理动态能力范围界定问题,提出三源权限架构,包括基于角色的上限等,贡献含600个企业任务提示的合成数据集,经验证可推动策略优化,还发布相关内容支持对动态范围界定机制的评估。
Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
用于移情响应生成的动态常识协调
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究移情响应生成问题,提出含三个互补模块的动态常识协调框架DCC,能整合常识表示、过滤低相关性关系及动态检索记忆,实验表明其可提升情绪分类准确率、响应多样性等,生成更好的响应。