arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2334 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 578 篇

2602.06154 2026-06-17 cs.LG cs.CL 版本更新 62%

MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models

MoSE: 混合可瘦身专家实现高效自适应语言模型

Nurbek Tastan, Stefanos Laskaridis, Karthik Nandakumar, Samuel Horvath

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed bin Zayed人工智能大学(MBZUAI)) Michigan State University (MSU), USA(密歇根州立大学(MSU)) Amazon Science, UK(亚马逊科学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出MoSE架构,每个专家具有可变宽度的嵌套结构,支持在推理时连续调节精度-计算权衡,通过多宽度训练和轻量级测试时训练实现高效自适应。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05692 2026-06-16 cs.LG cs.AI 版本更新 62%

Benchmarking Counterfactual Prediction in Epidemic Time Series with Time-Varying Interventions

具有时变干预的流行病时间序列中的反事实预测基准测试

Wenhao Mu, Facundo Yan, Anik Mumssen, Marisa Eisenberg, Alexander Rodríguez

机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) University of Michigan Epidemiology & Complex Systems(密歇根大学流行病学与复杂系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 为解决缺乏可观测反事实结果的真实基准问题,基于校准的基于智能体的模型生成大规模流行病时间序列反事实预测基准,支持静态/时变治疗和单/多策略干预,评估多种因果推断方法。

Comments To appear in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23666 2026-06-16 cs.CL cs.LG 版本更新 62%

LoLA: Low-Rank Linear Attention With Sparse Caching

LoLA: 低秩线性注意力与稀疏缓存

Luke McDermott, Robert W. Heath, Rahul Parhi

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出LoLA,一种无需训练的线性注意力增强方法,通过三种记忆系统(局部滑动窗口、稀疏全局缓存和循环隐状态)提升关联回忆,在pass-key检索任务上将准确率从0.6%提升至97.4%,且缓存大小比Llama-3.1 8B小4.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09379 2026-06-12 cs.AI cs.CL 版本更新 62%

LingxiDiagBench: A Multi-Agent Framework for Benchmarking LLMs in Chinese Psychiatric Consultation and Diagnosis

LingxiDiagBench: 用于基准测试大语言模型在中文精神科咨询与诊断中的多智能体框架

Shihao Xu, Tiancheng Zhou, Jiatong Ma, Yanli Ding, Yiming Yan, Ming Xiao, Guoyi Li, Haiyang Geng, Yunyun Han, Jianhua Chen, Yafeng Deng

机构 * Tianqiao and Chrissy Chen Institute(天桥和克里斯西·陈研究所) EverMind AI Inc.(EverMind AI公司) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出LingxiDiagBench多智能体框架,包含16K电子病历对齐的合成咨询对话数据集,评估LLM在静态诊断和动态咨询中的表现,发现其对抑郁-焦虑共病识别和12类鉴别诊断准确率低,动态咨询常不如静态评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22594 2026-06-12 cs.CL cs.AI 版本更新 62%

Language Model Circuits Are Sparse in the Neuron Basis

语言模型电路在神经元基上是稀疏的

Aryaman Arora, Zhengxuan Wu, Jacob Steinhardt, Sarah Schwettmann

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文实证发现MLP神经元与稀疏自编码器一样是稀疏特征基,并基于此开发了端到端梯度归因流水线,在多项任务中揭示了因果有效的神经元电路。

Comments ICML Spotlight, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13591 2026-06-12 cs.AI cs.CL 版本更新 62%

DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

Maojun Sun, Yifei Xie, Yue Wu, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27914 2026-06-10 cs.CL cs.AI 版本更新 62%

Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm

让结果说话:LLM行为基准测试的复制优先范式

Yuming, Huang, Yao Liu, Pengjie Ding, Lei Wang, Junchen Wan

机构 * Cylingo team(Cylingo团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19276 2026-06-09 cs.CL cs.LG 版本更新 62%

OpenCompass: A Universal Evaluation Platform for Large Language Models

OpenCompass:大型语言模型的通用评估平台

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Zhiwei Fei, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Zhuozhi Xiong, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

机构 * OpenCompass Team(OpenCompass团队) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出OpenCompass,一个模块化、高兼容性、灵活且高并发的通用LLM评估平台,支持多种任务场景和主流基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 62%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07317 2026-06-09 cs.CL cs.LG 版本更新 62%

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RLVE: 利用自适应可验证环境扩展语言模型的强化学习

Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出RLVE方法,通过程序化生成问题并提供可验证奖励的可验证环境,自适应调整难度以扩展语言模型的强化学习,在400个环境中联合训练使六个推理基准平均提升3.37%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05761 2026-06-08 cs.AI cs.CL 版本更新 62%

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Xiamen University(厦门大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SubtleMemory基准,通过构建关系控制的潜在语义伪影并嵌入用户-智能体交互历史,评估长时程AI智能体在后续查询中恢复分布式关系结构的能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 62%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 61%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 57%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-19 cs.CV cs.CL 版本更新 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Huang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23119 2026-08-19 cs.CL 版本更新 57%

Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM

Dripper:一种轻量级的HTML主内容提取框架

Mengjie Liu, Jiahui Peng, Wenchang Ning, Pei Chu, Jiantao Qiu, Ren Ma, He Zhu, Rui Min, Lindong Lu, Linfeng Hou, Kaiwen Liu, Yuan Qu, Zhenxiang Li, Chao Xu, Zhongying Tu, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Dripper通过轻量级框架实现高效HTML主内容提取,兼顾效率与准确性,开源模型促进高质量数据集构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 57%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 57%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新 57%

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 57%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新 57%

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 57%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 57%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 57%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00048 2026-08-14 cs.CY cs.AI 版本更新 57%

MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models

MOSAIC:揭示大型语言模型的道德、社会和个体维度

Erica Coppolillo, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR) Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MOSAIC首次提出评估大型语言模型道德、社会和个体维度的综合基准测试,通过九个问卷和四个游戏全面考察伦理推理能力,揭示MFT的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11729 2026-08-14 cs.CV cs.LG 版本更新 57%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17449 2026-08-14 cs.CL 版本更新 57%

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

SLAyiNG:一个经社群验证的多元酷儿俚语数据集

Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对酷儿语言处理偏差问题,本文提出首个经社群验证的英语酷儿俚语数据集Slaying,揭示语言模型对酷儿社群无表征偏差但存在语言偏差等发现,可提升酷儿用户NLP体验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10584 2026-08-13 cs.AI cs.DL 版本更新 57%

HexEval: An Evidence-Driven Hexagonal Framework for Multidimensional Scholar Assessment

HexEval:一种用于多维学者评估的证据驱动六边形框架

Xiaokang Qu, Yiting Lin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出HexEval框架,将学者评估构建为证据驱动的推理问题,通过内在与外部两个互补证据层评估,实现可解释可审计的AI辅助学者评估,同时指出公开学术数据的局限性。

Comments remove copyright information

详情

展开后加载摘要…

URL PDF HTML 收藏