arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-07 至 2026-07-07 共收录 271 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 67 篇

2607.02032 2026-07-07 cs.AI cs.CL 新提交 62%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24827 2026-07-07 cs.LG cs.AI 版本更新 62%

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量

Bojie Li

机构 * Pine AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02923 2026-07-07 cs.CL cs.AI 版本更新 62%

Council Mode: A Heterogeneous Multi-Agent Consensus Framework for Reducing LLM Hallucination and Bias

理事会模式:一种异质多智能体共识框架,用于减少大语言模型的幻觉和偏见

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究员) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出理事会模式,通过多智能体共识框架减少LLM的幻觉和偏见,实验显示在HaluEval和TruthfulQA上 hallucination率降低35.9%,质量得分提升10.2个百分点,且在偏见方面表现更优。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04387 2026-07-07 cs.AI cs.CL cs.GT 版本更新 62%

The Language of Bargaining: Linguistic Effects in LLM Negotiations

谈判语言:大语言模型谈判中的语言效应

Stuti Sinha, Himanshu Kumar, Aryan Raju Mandapati, Rakshit Sakhuja, Dhruv Kumar

机构 * BITS Pilani(BITS 普利尼)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟,在保持游戏规则等不变的情况下,系统分离英语和四种印度语言框架在不同游戏中的语言效应,发现语言选择对结果影响大,且因任务而异,强调仅用英语评估LLM谈判有局限。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 57%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04537 2026-07-07 cs.SE cs.AI 新提交 57%

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃

Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度德里国家理工学院) IIT Kanpur(印度坎浦尔理工学院) Microsoft Research India(微软印度研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 57%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04332 2026-07-07 cs.LG 新提交 57%

On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models

关于强化学习中奖励函数对大语言模型置信度校准的有效性

Chee Heng Tan, Zhuoyi Lin, Mehul Motani, Wee Sun Lee

机构 * School of Computing National University of Singapore(新加坡国立大学计算机学院) Institute of Advanced Intelligence and Computing(高级智能与计算研究所) Agency for Science, Technology and Research(科技研究局) Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究大语言模型用强化学习训练以提升推理准确性和表达置信度时,奖励函数的设计问题。提出不可破解置信奖励方案概念并定义相关奖励方案谱,指出实际数据集中存在的问题及最佳校准奖励方案因数据集和应用而异。

Comments 50 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 57%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03233 2026-07-07 cs.CR cs.AI cs.IR cs.SI 新提交 57%

Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions

用于开源情报和网络调查的智能与生成式人工智能:分类法、评估、挑战及未来方向

Eduardo Almeida Palmieri, Mohamed Chahine Ghanem, Dipo Dunsin, Zubair Baig, Ed de Quincey, Kim-Kwang Raymond Choo

机构 * School of Computer Science and Mathematics, Keele University(基尔大学计算机科学与数学学院) Cybersecurity Institute, University of Liverpool(利物浦大学网络安全研究所) Department of Applied Computing IICL, University of Wales Trinity Saint David(威尔士特里尼达大学应用计算系) Deakin Cyber Research and Innovation Hub, Deakin University(德金大学网络安全研究与创新中心) Department of Information Systems and Cyber Security, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校信息系与网络安全系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究指出公开数字信息增长使人工开源情报分析不足,大语言模型等成解决方案但评估框架滞后。通过综述74项研究,明确智能人工智能类别,找出幻觉验证差距,映射研究到情报生命周期并给出研究议程。

Comments 36 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02873 2026-07-07 cs.SE cs.AI cs.CR 新提交 57%

Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI

大语言模型安全工具编排的决定因素与限制:基于HexStrike-AI的研究

Romain Gerard, Assmaa Zeghaider, Yan Guo

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research(苏州研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 以HexStrikeAI为测试平台,通过评估系统、诊断故障并改进,运行多类挑战,发现驱动客户端是固定模型的首要因素,整体解决率提升,剩余故障受推理或环境限制,还讨论了编排器评估及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02689 2026-07-07 cs.CV cs.AI 新提交 57%

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

S-EMBER:用于流式自我中心记忆检索的大规模基准测试

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

机构 * FAIR, Meta(公平研究院,元公司) Reality Labs, Meta(现实实验室,元公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对可穿戴设备连续第一人称记录下AI助手的情景记忆问题,引入S-EMBER基准测试,通过视频及问答对模拟真实交互,发现前沿模型存在定位矛盾,为可穿戴AI代理情景记忆发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 57%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交 57%

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23327 2026-07-07 cs.CV cs.AI 新提交 57%

VideoAgent: All-in-One Framework for Video Understanding and Editing

VideoAgent: 视频理解与编辑的全能框架

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

机构 * South China University of Technology(华南理工大学) The University of Hong Kong(香港大学) Snap Inc(Snap公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出VideoAgent,一种基于多智能体编排的全能框架,通过自动镜头创建和30多个专业编辑智能体,解决现有系统在长视频理解和多样化编辑操作上的局限,在VideoEdit基准上实现87-95%编排成功率并降低60% API成本。

Comments Preprint. Code available at https://github.com/HKUDS/VideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06622 2026-07-07 cs.CL 版本更新 57%

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

UnpredictaBench:评估大语言模型分布随机性的基准

Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出UnpredictaBench基准,通过KS@N指标评估LLM从目标分布(统计分布、随机程序、自然语言场景)采样的能力,发现模型表现差异大且无模型超过40%准确率,表明分布采样能力仍有显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06337 2026-07-07 cs.AI 版本更新 57%

TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management

TokenMizer: 面向长程LLM上下文管理的图结构会话记忆

Shweta Mishra

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出TokenMizer,一种将LLM会话历史建模为类型化知识图的开源代理系统,通过混合提取、三级检查点和8层压缩流水线,在显著减少token开销的同时保留结构化决策信息。

Comments 9 pages, 6 figures. Code and benchmark: https://github.com/Shweta-Mishra-ai/tokenmizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 57%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00392 2026-07-07 cs.SE cs.AI 版本更新 57%

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents

EvolveTool-Bench:评估LLM生成的工具库作为软件 artifact 的质量

Alibek Kaliyev, Artem Maryanskyy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Uber Technologies(优步科技公司)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出EvolveTool-Bench,通过评估LLM生成的工具库在软件工程流程中的质量,揭示任务完成率之外的软件质量风险,强调需将工具库视为首要软件 artifact。

Comments 11 pages, 4 figures; accepted at KDD 2026 Workshop on Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 57%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19698 2026-07-07 cs.AI 版本更新 57%

RLIE: Rule Generation with Logistic Regression, Iterative Refinement, and Evaluation for Large Language Models

RLIE:用于大语言模型的基于逻辑回归、迭代细化和评估的规则生成

Yang Yang, Hua XU, Zhangyi Hu, Yutao Yue

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出RLIE框架,将大语言模型与概率建模结合学习加权规则集,经规则生成、逻辑回归、迭代细化和评估四阶段,评估多种推理策略,明确大语言模型在归纳推理中的潜力与局限,实现更可靠的神经符号推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 57%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22869 2026-07-07 cs.CL 57%

JBE-QA: Japanese Bar Exam QA Dataset for Assessing Legal Domain Knowledge

JBE-QA:日本司法考试问答数据集用于评估法律领域知识

Zhihan Cao, Fumihito Nishino, Hiroaki Yamada, Nguyen Ha Thanh, Yusuke Miyao, Ken Satoh

机构 * Institute of Science Tokyo, Japan(东京科学研究所,日本) ROIS-DS, Center for Juris-informatics, Japan(司法信息中心,日本) National Institute of Informatics, Japan(日本信息机构) University of Tokyo, Japan(东京大学,日本)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出JBE-QA数据集,用于评估大语言模型的法律知识,涵盖民法、刑法和宪法,通过分解问题为独立判断并添加上下文字段,共包含3464个平衡标注问题,评估26种LLM表现,显示具备推理能力的专有模型表现最佳。

Comments Three tables and one figure

Journal ref In Proc. of the 15th Language Resources and Evaluation Conference (LREC 2026) (pp. 5317-5327)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15135 2026-07-07 cs.CL 版本更新 57%

TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

TrendFact:自动事实核查中热点感知的基准

Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Defense Technology(国防科学技术大学) Northeastern University(东北大学) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20692 2026-07-07 cs.SE cs.AI cs.FL 版本更新 57%

Neurosymbolic Characterization for Reliable Access Control Policy Analysis

探索大型语言模型用于访问控制策略合成与摘要

Adarsh Vatsa, Bethel Hall, William Eiers

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM在访问控制策略自动生成中的有效性,发现非推理LLM仅45.8%生成等价策略,推理LLM达93.7%,并提出基于语义的请求摘要方法辅助策略分析。

Comments Accepted to ISSRE 2026. Major revision and retitling of arXiv:2510.20692v1. Refocuses the paper on reliable neurosymbolic access-control policy analysis; updates the PolicySummarizer method, multi-cloud evaluation, and user-study results. 13 pages, 6 figures. Corrected arXiv title metadata to match the accepted ISSRE version. No substantive content changes from the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06643 2026-07-07 cs.SE cs.CL 版本更新 57%

Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models

你的基准仍然有用吗?代码语言模型的动态基准测试

Batu Guan, Xiao Wu, Yuanyuan Yuan, Shaohua Li

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究模型评估中如何在模型训练可能已见过基准的情况下保持其有用性,提出动态基准测试框架,通过语义保留突变变换输入构建新基准,评估发现模型性能变差、排名变化及能抵抗数据污染问题。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 50%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 50%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 推理评测 :planning(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04255 2026-07-07 eess.SY cs.SY 新提交 50%

Towards Effcient Low Altitude Sensing: A Dual Heterogeneous Graph Learning Method for UAV Task Allocation

迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法

Guangyu Lei, Tianhao Liang, Bingyan Xie, Tingting Zhang

专题命中 推理评测 :planning(abstract)

AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03720 2026-07-07 cs.HC 新提交 50%

Between Knowledge and Care: A Mixed-Methods Evaluation of Generative AI for T2DM Self-Management from Patient and Physician Perspectives

知识与关怀之间:从患者和医生角度对用于2型糖尿病自我管理的生成式人工智能的混合方法评估

Ruiqi Chen, Yibo Meng, Huidi Lu, Xiaolan Ding

专题命中 推理评测 :reasoning(abstract)

AI总结 该混合方法研究从患者和医生角度评估用于2型糖尿病自我管理的生成式人工智能。通过分析患者查询、医生评分及访谈,发现模型优缺点,得出两个分析概念,为四个设计方向提供依据。

Comments arXiv admin note: text overlap with arXiv:2510.10048

详情

展开后加载摘要…

URL PDF HTML 收藏