arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2608.06202 2026-08-07 cs.HC cs.AI 新提交 81%

What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)

当前AI基准测试未测量的内容:模态、搜索、引用及其对安全评估的启示

Ro Encarnación, Tina Behzad, Emma Lurie, Danaé Metaxa

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现AI基准测试未涵盖模态、搜索等关键因素,以ChatGPT为例对比两种模态及搜索条件,发现这些因素会影响模型准确率、一致性等,主张AI安全评估需纳入这些维度。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 81%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05391 2026-08-07 cs.AI cs.MA 新提交 81%

Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination

面向开放式护理计划协调的自适应竞技场式可争议专家论证网络

Truong Thanh Hung Nguyen, Hoang-Loc Cao, Phuc Ho, Phuc Truong Loc Nguyen, René Richard, Hung Cao

机构 * University of New Brunswick(新不伦瑞克大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。

Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05359 2026-08-07 cs.AI 新提交 81%

CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction

CASCADE:一种用于经患者数据验证的下游扰动预测的智能体调控网络框架

Jose A. Bird

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出CASCADE智能体调控网络框架,基于ARACNe网络预测基因扰动下游转录效应,通过TCGA、METABRIC数据验证其MYC基因预测方向的准确性,还评估LLM智能体映射自然语言请求至MCP工具调用的表现,发现其在模糊查询时存在错误选择扰动类型的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05179 2026-08-07 cs.CY cs.AI 新提交 81%

Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap

自主研究智能体:AI科学家与验证差距的综述

Tianyu Ding, Aditya Nannapaneni, Bingfan Liu, Ling Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本综述聚焦AI/ML研究中AI科学家系统的主张验证差距,分析125项研究后纳入35项,发现多数系统发布代码但缺乏验证产物,贡献了语料库等成果,指出核心瓶颈转向主张的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04783 2026-08-07 cs.SE cs.AI 版本更新 81%

RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

RepoProbe:基于清单的架构感知代码仓库理解基准测试

Yuexi Yang, Alyssa Wu, Ji Luo, Richeng Xuan, Zhichao Hu, Yuhong Liu, Zhen Qin

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出RepoProbe基准,采用基于清单的验证协议,发现SOTA LLMs存在编辑偏差,且高清晰度与技术正确性间有差距,提升了代码仓库理解评估的可靠性。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Replication package: https://github.com/Tencent-Hunyuan/RepoProbe

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04514 2026-08-07 cs.CL 版本更新 81%

RESPClinBench: Benchmarking Multimodal Clinical Decision-Making and Longitudinal Disease Management in Respiratory Specialty Care

RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试

Mouxiao Bian, Zhi Chen, Ruiyao Chen, Lu Lu, Hengrui Liang, Chaoyi Huang, Yiluo Lin, Jingru Ding, Yun Zhong, Yueming Su, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Macau University of Science and Technology(澳门科技大学) First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院) Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究开发了呼吸专科多模态临床决策与纵向疾病管理基准RESPClinBench,在两个数据集上评估7种大模型,识别模型在肺结节评估和COPD管理的局限,为模型选择提供临床依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20959 2026-08-07 cs.LG cs.CL 版本更新 81%

Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models

正确知识,错误答案:开放权重语言模型中时间事实冲突的测试时引导

Elias Hossain, Sourav Saha, Tasfia Nuzhat Ornee, Sanjeda Sara Jennifer, Umesh Chandra Biswas, Shubhashis Roy Dipta, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) Mississippi State University(密西西比州立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对开放权重语言模型中参数化时间冲突问题,提出无需重训练或外部检索的三阶段测试时干预方法TAS,通过单层激活修补实现0.72-0.85的答案翻转率,并保持非冲突查询85-99%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06200 2026-08-07 physics.ed-ph 新提交 80%

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展

Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。

Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06361 2026-08-07 cs.AI 新提交 79%

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

低频陷阱:视频语言模型在简单事件记录上的失败

Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang

专题命中 评测与基准 :language model(title);prompting(abstract);分类 cs.AI

AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14695 2026-08-07 cs.LG cs.CL 版本更新 79%

Persona-Pruner: Sculpting Lightweight Models for Role-Playing

Persona-Pruner: 为角色扮演雕琢轻量级模型

Jinsu Kim, Jihoon Tack, Noah Lee, Jongheon Jeong

机构 * Department of Artificial Intelligence, Korea University, Seoul, South Korea(韩国大学人工智能系) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Persona-Pruner框架,通过从单个描述中隔离特定角色的子网络来剪枝语言模型,在保持角色扮演性能的同时大幅降低计算成本,性能下降比最强基线减少93.8%。

Comments 25 pages; ICML 2026; Code is available at https://github.com/jsu-kim/Persona-Pruner

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05389 2026-08-07 cs.CV 新提交 78%

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

基于视觉语言基础模型的文本引导多序列胶质瘤亚区分割细化

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

机构 * Emory University School of Medicine(埃默里大学医学院) The University of Chicago(芝加哥大学) Winship Cancer Institute(温希普癌症研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究开发基于VoxTell的轻量级框架,用3D视觉语言基础模型实现文本引导的胶质瘤亚区分割细化,在BraTS-GLI及跨数据集测试中提升了分割的DSC指标,支持作为临床医生在环工具的进一步评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04549 2026-08-07 cs.CL cs.AI cs.LG 版本更新 78%

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

EuroExec:前沿语言模型在欧洲行政决策任务上未能达到专家判断水平

Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

机构 * Sovrano AI(索夫拉诺人工智能公司)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建含413项欧洲行政任务的EuroExec基准,评估6款前沿LLMs,发现其解决率仅56.9%,远低于专家水平,凸显前沿LLMs在这类任务上的不足及人工评估的必要性。

Comments 17 pages, 9 figures, 12 tables, submitted to EACL 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 77%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06362 2026-08-07 cs.GT cs.AI cs.CL cs.LG cs.MA 新提交 75%

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法

Boning Li, Yu Chen, Longbo Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11936 2026-08-07 cs.CL cs.AI cs.CV cs.LG 75%

A Survey of Deep Learning for Geometry Problem Solving

深度学习在几何问题求解中的应用综述

Jianzhe Ma, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了深度学习在几何问题求解中的应用,涵盖相关任务、方法、评估指标及未来方向,旨在提供实践参考以推动该领域发展。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06111 2026-08-07 cs.CL cs.AI 新提交 73%

Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers

超越序列顺序:面向Transformer的句法感知位置嵌入

Haris Riaz, Hyungji Kim, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出句法感知位置嵌入SiPE,将句法先验注入Transformer,使模型在SyntaxGym、GLUE基准分别提升10.3%、8.2%,困惑度降9.0%,在句法监督与推理成本间建立新帕累托前沿。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06027 2026-08-07 cs.CL cs.AI cs.HC 新提交 73%

FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India

FormBharo:为印度农村设计和评估用于对话式表单填写的语音助手

Aman Dalmia, Sanskriti Midha, Jigar Doshi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对印度农村无法读写的人群开发了语音助手FormBharo,结合LLMs与规则控制完成表单填写,发布了相关基准数据集,通过端到端评估确定最优模型配置以平衡准确性、成本与延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05163 2026-08-07 cs.CL cs.LG 新提交 73%

Where Privacy Risk Lives in English-Source Multilingual RAG: A Stage-Decomposed Audit Across Five Query Languages

英语源多语言检索增强生成(RAG)系统的隐私风险所在:五种查询语言下的阶段分解审计

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对英语源多语言RAG系统,通过含五种查询语言的两阶段防御审计发现,非英语语言仍存在残留PII泄露,附加黄金文档可阻断多数残留单元,后续计划开展独立MT与非Qwen判别器的复现工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 73%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14111 2026-08-07 cs.AI cs.DC cs.LG 73%

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

CUDA-L1: 通过对比强化学习提升CUDA优化

Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

机构 * DeepReinforce Team(深强化团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 CUDA-L1通过对比强化学习提升CUDA优化,实现显著加速并展示出优化策略的可移植性和有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05505 2026-08-07 cs.CV 新提交 71%

DynaPix: Can Vision-Language Models Identify the Exact Future?

DynaPix:视觉语言模型能否识别准确的未来?

Thong Nguyen, Vinh-Hien Do, Quynh Vo, Cong-Duy Nguyen, See-Kiong Ng

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title)

AI总结 研究构建基准DynaPix,发现视觉语言模型能较好将预测与事件关联,但难以锚定时间,经模拟器真实记录训练可改善多数问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06370 2026-08-07 cs.CL 新提交 70%

The Bitter Lesson of Tool Calling

工具调用的惨痛教训

Ishan Patel, Sahil Sen, Elias Lumer, Vamse Kumar Subbiah

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本研究在BFCL v4上对比14种模型的程序化工具调用与JSON工具调用,发现程序化工具调用在多数场景下性能更优且鲁棒性更强,是可行的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06346 2026-08-07 cs.AI 新提交 70%

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

TRAJDEBUG:追踪错误生命周期以识别长视野智能体轨迹中的关键失败

Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li

机构 * Tsinghua University(清华大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对长视野智能体轨迹调试的级联错误与关键错误定位难题,提出TrajDebug框架,构建含486条轨迹的TrajErrBench基准,实验显示其性能优于现有基线,可提供改进智能体的可操作反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06331 2026-08-07 cs.DB cs.AI 新提交 70%

Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data

Tytan:从关系数据交互式神经符号构建分析语义模式

Donna Hooshmand, Shubham Shahi, Cameron Barrie, Abhratanu Dutta, Marko Sterbentz, Harper Pack, Kristian J. Hammond

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TYTAN是从关系数据自动构建分析语义模式的交互式神经符号系统,在多数据库评估中实现了100%覆盖率、检索正确性及高语义角色一致性,盲测表现优异。

Comments 20 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05573 2026-08-07 cs.AI 新提交 70%

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现

Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18056 2026-08-07 cs.CL q-bio.GN 版本更新 70%

An Early Warning of Emerging Biosecurity Risks in Frontier LLMs

前沿大语言模型中新兴生物安全风险的早期预警

Zhida He, Xia Hu, Baichen Le, Chunxiao Li, Jiajia Li, Lijun Li, Chaochao Lu, Jing Shao, Youbang Sun, Hua Tang, Xiang Wang, Xiao Wang, Xiaoyu Wen, Tong Wu, Jia Xu, Peng Yu, Shu Yu, Jie Zhang, Qiaosheng Zhang, Yi Zhang, Xing-Ming Zhao, Tianhang Zheng, Ziyuan Zhou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。

Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06420 2026-08-07 cs.CV cs.AI 交叉投稿 70%

HoloCount: A Holistic Visual Counting Benchmark for MLLMs

HoloCount:用于多模态大语言模型的整体视觉计数基准

Jinhong Deng, Limeng Qiao, Guanglu Wan

机构 * Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型定量精度瓶颈及现有计数基准局限,引入HoloCount基准,从语义、分析计数和鲁棒性测试三方面评估模型,经对20多个模型详尽评估,揭示其性能差距,为多模态系统发展提供路线图。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 70%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏