IDRBench: Understanding the Capability of Large Language Models on Interdisciplinary Research
IDRBench: 理解大型语言模型在跨学科研究中的能力
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文研究了大型语言模型在跨学科研究中的能力,提出IDRBench框架,通过三个任务评估不同模型的跨学科知识整合能力,并为未来研究建立基准。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
IDRBench: 理解大型语言模型在跨学科研究中的能力
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文研究了大型语言模型在跨学科研究中的能力,提出IDRBench框架,通过三个任务评估不同模型的跨学科知识整合能力,并为未来研究建立基准。
StoryVideoQA: 通过大规模、多类型和自动生成的数据集扩展深度视频理解
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) ; Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出StoryVideoQA数据集和PlotTree方法,通过多智能体协作框架自动生成大规模深度视频理解问答对,并利用层次化情节结构提升复杂故事线推理能力。
Comments Accepted by IJCV 2026
Journal ref International Journal of Computer Vision (2026)
SWE-InfraBench:评估语言模型在云基础设施代码上的表现
专题命中 推理评测 :reasoning(abstract)
AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。
Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle
BareBones: 视觉语言模型中零样本几何理解的基准测试
机构 * University of Central Florida(佛罗里达大学中央分校) ; University of Calgary(卡尔加里大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出BareBones基准,通过去除RGB纹理仅保留轮廓,测试26个视觉语言模型在零样本几何形状理解上的表现,发现模型存在严重的纹理偏置悬崖。
Comments Accepted at CVPR (13th FGVC Workshop) 2026
全球跨模态地理定位:一个百万级数据集和一个物理一致性学习框架
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) ; First Surveying and Mapping Institute of Hunan Province(湖南省第一测绘院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出CORE数据集和PLANET框架,用于解决全球跨模态地理定位问题,通过大规模数据和物理一致性学习提升定位的鲁棒性和全球适用性。
压缩-蒸馏:面向高效知识蒸馏的推理轨迹压缩
机构 * Université catholique de Louvain(列日天主教大学) ; Sophont Inc(Sophont公司)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文提出在知识蒸馏前对推理轨迹进行事后压缩,以降低训练成本并缩短推理输出,实验表明压缩在准确率与效率间存在权衡。
OneReason 技术报告
机构 * OneRec Team(OneRec团队)
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 针对生成式推荐模型中推理能力难以激活的问题,提出 OneReason 方法,通过增强感知和认知能力实现有效推理。
Comments Work in progress
扩散语言模型的自增强检索
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google Research(谷歌研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SARDI框架,利用扩散语言模型去噪过程中丢弃的低置信度标记作为前瞻信号指导检索,无需训练且与检索器无关,在多跳问答基准上以高达8倍吞吐量超越现有方法。
Comments ICML 2026
仅索引一次:具有共享路由的跨层稀疏注意力
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出跨层稀疏注意力(CLSA),通过共享KV缓存和路由索引,在保持token稀疏注意力精度的同时减少路由开销,显著提升长上下文LLM的解码效率。
IR3DE:面向大型语言模型的线性路由器
机构 * Gensyn
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出基于岭回归的线性路由器IR3DE,以低成本快速为每个提示选择最合适的领域专家大语言模型,在推理任务中超越基线方法,并支持动态添加或移除专家模型。
Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference
框架构建、判断、引导:一种可评估的能力模型,用于教授学生与生成式AI进行推理
机构 * Holon Institute of Technology(霍洛恩技术学院) ; Afeka College of Engineering(阿菲卡工程学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出CoRe-3能力模型,将有效使用AI分解为框架构建、判断和引导三种可评估技能,并通过模拟实验验证其区分效度。
Comments 18 pages, 4 pages
MARDoc:面向多模态长文档问答的记忆感知精炼智能体框架
机构 * Tianjin University(天津大学) ; Qifu Technology(启福科技) ; Beihang University(北航) ; Jiangnan University(江南大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出MARDoc框架,通过解耦为探索、精炼和反思三个智能体,并利用结构化记忆替代完整交互历史,减少上下文噪声,提升多模态长文档问答性能。
UNIVID:用于视频审核的统一视觉语言模型
机构 * Bytedance(字节跳动)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。
Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track
少即是MoE:修剪领域专家语言模型中的专家
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UCSD(加州大学圣地亚哥分校) ; MIT(麻省理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对MoE模型部署时参数过多的问题,提出基于Fisher重要性的中间维度修剪方法Fisher-MoE,在50%压缩比下保持模型能力,减少约45%权重内存并提升21%推理吞吐量。
Macro: 通过偏好对齐优化提升多语言反事实解释
机构 * Technische Universität Berlin(柏林技术大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; University of Duisburg-Essen(杜伊斯堡- Essen大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Saarland Informatics Campus(萨尔兰州信息学校区) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) ; Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Macro框架,通过直接偏好优化改进多语言反事实解释,提升有效性的同时保持最小性,避免翻译基线的严重最小性问题,并在多个指标上优于监督微调方法。
Comments In submission
从因果发现到神经时间序列中的动态因果推断
机构 * Lucy Family Institute for Data & Society(数据与社会卢西家族研究所) ; University of Notre Dame(诺克斯达大学) ; Political Science University of Notre Dame(政治学诺克斯达大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出动态因果网络自回归(DCNAR)两阶段框架,通过神经自回归因果发现学习稀疏有向因果网络,并将其作为结构先验用于时变神经网络自回归,实现无需预设网络结构的动态因果推断。
Comments 11 pages, 2 figures
从分布外检测到幻觉检测:一个几何视角
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。
Comments ICML 2026 main conference paper
基于反事实链和因果图的LLM可解释性
机构 * Faculty of Data and Decision Sciences, Technion I IBM Research(数据与决策科学学院,技术离子IBM研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 提出一种四阶段方法,利用因果图建模LLM推理过程,通过MCMC启发的反事实增强发现类判别性概念并生成可解释图,用于疾病诊断、情感分析等任务。
Q-GNN: 具有类型感知的查询条件图神经网络用于知识图谱补全
机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 提出Q-GNN,通过融合查询实体的结构上下文和语义类型信息,增强图神经网络在知识图谱补全中的推理能力。
教学指导在生成式AI辅助学习中的作用:来自建筑工程教育的实证证据
机构 * Dept. of Civil, Environmental, and Geospatial Engineering, Michigan Technological Univ.(土木、环境与地理空间工程系,密歇根技术大学) ; Dept. of Civil and Construction Engineering, Western Michigan Univ.(土木与建设工程系,西部密歇根大学) ; Dept. of Psychology and Human Factors, Michigan Technological Univ.(心理学与人因工程系,密歇根技术大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本研究通过引入基于生成学习理论的五步提示框架,在建筑工程教育中对比无提示AI辅助、有提示AI辅助和幻灯片学习三种条件,发现提示框架显著提升了需要解释和推理的任务表现(开放式评分提高约2-3分,p<0.01),表明AI辅助学习的有效性取决于交互结构。
利用大语言模型进行安全硬件设计及相关问题:机遇与挑战
机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) ; NYU Tandon School of Engineering(纽约大学塔能工程学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.LG
AI总结 本文探讨了大语言模型在电子设计自动化和硬件安全领域的应用,分析了其在生成RTL代码、自动生成测试平台以及弥合高层次规格与硅芯片之间语义差距方面的潜力,同时指出了其引入的严重安全漏洞,并总结了当前研究的最新进展和未来研究方向。
Comments Accepted for 2026 IEEE Computer Society Annual Symposium on VLSI (ISVLSI)
大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战
机构 * University of Alberta(阿尔伯塔大学) ; University of Tokyo(东京大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。
无线通信的基础模型:从物理层智能到网络自治
专题命中 其他推理 :reasoning(abstract)
AI总结 本文综述了基础模型在无线通信中的应用,从适配预训练模型、构建无线原生模型到智能体模型,推动物理层处理和资源管理向网络自治演进。
超越WER:面向环境临床记录员的配对声学压力测试
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Co., Ltd.(iFLYTEK公司)
专题命中 其他推理 :reasoning(abstract)
AI总结 提出配对声学压力测试方法,通过注入噪声并冻结下游模型,揭示噪声对临床推理的安全影响,发现轻微声学扰动可逆转临床意义而不显著增加词错误率,并展示轻量级缓解策略。
Comments Accepted to INTERSPEECH 2026
面向拓扑的层剪枝用于大型视觉-语言模型
专题命中 其他推理 :reasoning(abstract)
AI总结 本文提出了一种面向拓扑的层剪枝框架,用于大型视觉-语言模型,通过利用拓扑持续同调量化层间拓扑一致性,实现自适应剪枝以保留关键表示转换。
Comments This manuscript has been withdrawn by the authors. It reproduced the methodology of Gardinazzi et al., arXiv:2410.11042, without citation, and utilized code and data from the associated repository (github.com/RitAreaSciencePark/ZigZagLLMs) without disclosure or violate the MIT License. A revised future version with full attribution may be prepared. For any feedback, please contact Pengcheng Zheng