Spec-Driven Hardware Evolution via Executable Contract Refinement and Proof-Guided RTL Update
基于规约驱动的硬件演化:通过可执行契约精化与证明引导的RTL更新
专题命中 推理与问题求解 :LLM(abstract,abstract_cn)
AI总结 该研究提出以契约为核心的规约驱动硬件演化方法,将硬件演化分为四阶段,经评估可推动遗留RTL向新版本功能收敛,为硬件版本迭代提供新方案。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
基于规约驱动的硬件演化:通过可执行契约精化与证明引导的RTL更新
专题命中 推理与问题求解 :LLM(abstract,abstract_cn)
AI总结 该研究提出以契约为核心的规约驱动硬件演化方法,将硬件演化分为四阶段,经评估可推动遗留RTL向新版本功能收敛,为硬件版本迭代提供新方案。
AI时代的基础数学——残基、旅程与生态
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 该文探讨AI时代数学的残基(可计数的定理等)与产物(人类理解的旅程)的区别,指出AI暴露了残基与产物的混淆,提出需关注核查AI主张、资助滋养共享理解的旅程等制度问题。
Comments 17 pages, 2 figures, 2 tables. Companion paper to Parmy Olson's "Math's AI Crisis Has a Lesson For the Rest of Us" (Bloomberg, Aug. 13, 2026)
面向结构化数据搜索的引导式表格检索
专题命中 推理与问题求解 :LLM(abstract,abstract_cn)
AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。
N体问题:从单人物体中心视频进行并行执行
机构 * University of Bristol(布里斯托尔大学) ; The University of Tokyo(东京大学)
专题命中 推理与问题求解 :language model(abstract);prompting(abstract)
AI总结 提出N体问题,从单人物体中心视频预测N人并行执行任务,通过结构化提示策略引导视觉语言模型推理3D环境、物体使用和时间依赖,在EPIC-Kitchens和HD-EPIC数据集上显著提升动作覆盖率并降低冲突。
Comments accepted at ECCV Workshop, project webpage: https://zhifanzhu.github.io/ego-nbody
OmniScientist:一种全模态全学科的AI科学家
机构 * National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学)
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。
Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/
GEM:一种连接推理与检索的生成式嵌入模型
机构 * University of Glasgow(格拉斯哥大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 针对传统检索器表层匹配导致的需求解读差距问题,提出生成式嵌入模型GEM,将推理与检索统一,在相关任务上性能优于基线,还可通过提示扩展测试时计算提升效果。
基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Soochow University(苏州大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。
Comments 16 pages, 5 figures
逻辑常识问答:逻辑常识推理的基准测试
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LOGICAL-COMMONSENSEQA基准,通过逻辑运算符评估常识推理,发现模型在否定类问题上表现下降,揭示了推理局限性。
NaviDC-OCR:面向数字文档与相机拍摄文档的解析导航
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 针对现有文档解析方法的两大挑战,本文提出NaviDC-OCR框架,通过形变感知学习、自适应采样及内容-结构解耦学习策略,在多基准测试中取得最优性能并获ICDAR 2026相关挑战第一。
基于扩散历史预测消费技术拥有情况
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 该研究利用人类及Anthropic Claude Opus 4.7、OpenAI GPT-5.5两款语言模型对消费技术的属性评分,通过符号约束惩罚回归预测技术拥有率,其效果优于上市年限基准模型,还对2025-2026年新品做了2027年拥有率预测。
Comments 31 pages, 4 figures, supplementary material included (Tables S1-S6, Figure S1), data and code at https://osf.io/dr5ct
面向全归纳图神经网络的结构交互图上的神经消息传递
专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG
AI总结 该研究提出SIGIL框架,通过结构交互图和关系消息传递网络实现图特征的统一表示,可用于全归纳链接预测,还能统一多种图基础模型设计范式。
Comments 7 pages, 1 figure in the main body. 12 pages, 5 figures in appendix. Submitted to AAAI 2027 (main track) and currently under review
QUIETT:查询无关的表格转换以实现稳健的推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL
AI总结 QuIeTT通过查询无关的表格转换框架,提升表格推理的可靠性和效率,实验显示在多个基准测试中表现优异。
Pandora:利用代码驱动的知识迁移实现统一结构化知识推理
机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及交叉应用重点实验室(东南大学)) ; China Mobile Research(中国移动研究院) ; Monash University(莫纳什大学)
专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL
AI总结 本文提出Pandora框架,采用Python的Pandas API构建统一知识表示,结合代码驱动的知识迁移,在六个基准测试中优于现有统一推理框架。
Comments Accepted in IEEE TKDE (2026)
错误修复中的语义漂移:行为信号如何从报告传播到测试和补丁
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究错误修复中行为信号跨工件传播的量化问题,核心方法是引入Desc2Fix框架,通过结构化行为锚等实现语义对齐,主要贡献是证明行为对齐可测且非相似性可比,能为测试和补丁相关工作提供可重现信号,助力多项错误修复任务。
Spa3R:用于3D视觉推理的预测空间场建模
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics ; D-Robotics Intern at D-Robotics(D-Robotics 实习生)
专题命中 推理与问题求解 :language model(abstract)
AI总结 Spa3R通过自监督学习从多视角图像中提取统一的空间表示,提升3D视觉推理能力,实现与VLMs的结合,达到3D VQA任务的高准确率。
面向大语言模型复杂图推理的统一多维度基准
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。
Comments Under review
一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧
机构 * University of Ljubljana(卢布尔雅那大学) ; Faculty of Computer and Information Science(计算机与信息科学学院) ; Faculty of Theology(神学院) ; Faculty of Arts(艺术学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。
Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026
当AI成为你的牧师:大型语言模型的神学分诊与牧灵指导基准测试
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究推出FMG-Bench基准测试,评估LLM在基督教神学分诊与牧灵指导场景的表现,发现结构化框架可提升模型表现与鲁棒性,且该基准仅为测量工具。
Comments Full paper. Code and dataset are available at https://github.com/FideAI/fmg-bench and https://huggingface.co/datasets/FideAI/fmg-bench
哪种大语言模型是你理想的陪伴者?基于成人依恋理论评估大语言模型的情感陪伴能力
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本研究基于成人依恋理论构建情感陪伴基准ECBench,评估32个LLM的依恋倾向,探究其在多轮交互中的表现及可调整性,为情感陪伴类LLM的选择提供理论与工具支持。
大型语言模型中的数字能力:基本局限与改进路径
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);pretraining(abstract)
AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。
大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试
机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) ; IDEAS Research Institute(IDEAS研究院) ; AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) ; Poznań University of Medical Sciences(波兹南医科大学) ; Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) ; WSB Merito University(WSB梅里托大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL
AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。
MOSAIC:揭示大型语言模型的道德、社会和个体维度
机构 * University of Southern California(南加州大学) ; University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) ; Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。
LigBench:面向基于大语言模型的研究创意生成的统一且符合人类偏好的基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institution(上海创新研究院)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对现有LLM研究创意生成评估零散、缺乏统一标准的问题,提出LigBench基准及PAIR-IQ数据集,实验表明LigBench评估稳定可解释且与专家判断一致性高,PAIR-IQ训练的模型排名准确性和鲁棒性更强
Comments 17 pages
评估者是实验的一部分:测量开放式大语言模型(LLM)的一致性
机构 * Illinois Institute of Technology(伊利诺伊理工大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 该研究提出实验方案测量开放式LLM一致性,发现错误同行输入会降低修订质量,评估者非中立,锚定校准必要,指出翻转率不足以完整衡量开放式一致性。
大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变
机构 * Meta Superintelligence Labs(元超级智能实验室)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。
Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle
大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of Data Science, Fudan University(复旦大学数据科学学院) ; Ant Group(蚂蚁集团) ; School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。
大语言模型在文化禁忌安全方面的“知识-行为差距”
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) ; Huawei(华为)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。
先验意识记忆:一种区分记忆与泛化在大语言模型中的高效度量标准
机构 * Cornell University(康奈尔大学) ; Boston University(波士顿大学) ; NVIDIA(英伟达)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出Prior-Aware Memorization,一种基于模型先验的轻量级度量标准,用于区分大语言模型中的真实记忆与统计上常见序列,揭示低频率不足以证明记忆,强调需考虑模型先验以评估数据泄露风险。
Comments COLM 2026 Camera Ready
大语言模型推荐系统是否知道自己在产生幻觉?针对目录保真度的置信度校准审计
专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 该研究审计了四个零样本LLM推荐系统的幻觉率与置信度校准,发现其系统性置信不足,提出conformal弃权阈值效果有限,建议审计需同时报告校准与OOD率并采用锚定目录的提示。
通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择
机构 * Meta AI
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。