arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2608.07490 2026-08-11 cs.HC cs.AI 新提交 85%

Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents

经验敏感型游戏学习:人类与语言智能体的行为研究

Yingying Guo, Zhuoxuan Ju, Ruibo Ming, Ruicheng Feng, Jinjin Gu

专题命中 评测与基准 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建经验敏感型游戏学习框架,通过交互式游戏及相关指标分析人类与自进化语言智能体的游戏决策行为,发现人类会稳定转向全局策略,而自进化智能体的行为转变仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新 85%

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 85%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08822 2026-08-11 cs.AI cs.CL 新提交 85%

Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models

利用大语言模型自动生成经复杂度验证的决策场景

Abdalla Doleh, Toni Somers, Ratna Babu Chinnam

机构 * Wayne State University(韦恩州立大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究针对手动生成决策场景的缺陷,开发了基于大语言模型的自动化流水线,生成并验证了4238个多领域场景,证实其具备良好心理测量学特性,可用于AI系统认知评估。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 85%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23999 2026-08-11 cs.CR 版本更新 85%

ContainmentBench: Trace-Based Evaluation of Post-Exposure Containment in Tool-Using LLM Agents

ContainmentBench:基于跟踪的工具使用大型语言模型代理注入后遏制评估

Wenhao Lan, Shan Li, Meiqi Wu, Xinhua Lai, Junbin Yang, Haihua Shen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对工具使用的大型语言模型代理注入后遏制评估问题,引入ContainmentBench基准,分别测量端点策略合规性等。通过对Qwen2.5 - 7B - Instruct研究发现,终端策略标签不充分,评估应分别报告多方面证据,还给出不同策略的工作流程完成率等结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 84%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG;language model(comments)

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08830 2026-08-11 cs.AI 新提交 84%

PROSLEX: A Novel Dataset for Expert-Annotated Legal Statute Prediction for Indian Judiciary

PROSLEX:印度司法领域专家标注的法律条文预测新型数据集

Subinay Adhikary, Upal Bhattacharya, Vivek Kumar Singh, Anurag Sharma, Shubham Kumar Nigam, Suvasis Das, Shouvik Kumar Guha, Koustav Rudra, Kripabandhu Ghosh

机构 * IISER Kolkata(印度科学教育与研究学院加尔各答分校) Utrecht University(乌得勒支大学) IIT Kharagpur(印度理工学院克勒格布尔分校) University of Birmingham Dubai(伯明翰大学迪拜分校) WBNUJS(西孟加拉邦国家法律大学)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文针对法律条文预测研究中缺乏可解释性的问题,构建印度司法领域专家标注的PROSLEX数据集,评估多种提示策略,为可解释法律AI提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07862 2026-08-11 cs.CL 新提交 84%

SurakshaEval: An Indic Safety Benchmark for Multilingual LLMs

SurakshaEval:面向多语言大语言模型的印度语安全基准

Debopriyo Banerjee, Kapil Rajesh Kavitha, Angana Borah, Xudong Han, Yuxia Wang, Parameswari Krishnamurthy, Utkarsh Agarwal, Atharva Kulkarni, Swaran Lata, Ayush Munot, Dhruv Sahnan, Aaryamonvikram Singh, Preslav Nakov, Monojit Choudhury

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM安全评估数据集忽视印度语言文化安全风险的问题,本文推出SurakshaEval基准,测试发现多语言LLM在印度语场景下安全表现不足,凸显了适配区域数据的安全评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08722 2026-08-11 cs.LG cs.AI 新提交 84%

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

无攻击者的博弈:选择压力下大语言模型驱动搜索中的基准指纹识别

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文研究发现,在带反馈的进化循环中,前沿LLM提出的GPU内核会对评估配置进行指纹识别,导致30%的分布内胜出案例无法迁移,进而给出失败分类与测量设计指导。

Comments Published as a conference paper at AI Measurement Science Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16941 2026-08-11 cs.LG cs.AI 版本更新 84%

FoMoH: A clinically meaningful foundation model evaluation for structured electronic health records

FoMoH:针对结构化电子健康记录的具有临床意义的基础模型评估

Vincent Jeanselme, Zilin Jing, Aparajita Kashyap, Chao Pang, Florent Pollet, Young Sang Choi, Xinzhuo Jiang, Yuta Kobayashi, Yanwei Li, Sara Matijevic, Karthik Natarajan, Shalmali Joshi

机构 * Department of Biomedical Informatics Columbia University(生物医学信息学系 哥伦比亚大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究构建含14项临床预测任务的基准,评估6种EHR基础模型,发现其在标注数据有限时区分性能更优、群体公平性更好,但低患病率场景表现差、跨机构可迁移性不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00549 2026-08-11 cs.CL cs.AI 84%

Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages

Hyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng, Nicole Hee-Yeon Kim, Taewon Yun, Hang Su, Jason Cai, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院) AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 34 pages, 6 figures

Journal ref ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 83%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 83%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08227 2026-08-11 cs.CL cs.HC 新提交 83%

Focus particles and scalar inferences across humans and language models

人类与语言模型的焦点小品词及标量推理

Catherine M. Brousse, Nelu D. Radpour

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究测试人类与大型语言模型能否从含焦点小品词的句子构建稳定标量表征,发现二者相似输出或源于不同底层机制。

Comments 3 pages, 1 figure, presented at 9th annual Conference on Cognitive Computational Neuroscience

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07631 2026-08-11 cs.SD cs.AI cs.MM 新提交 83%

PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue

PACE:面向基于大语言模型的全双工语音对话的播放对齐上下文引擎

Shibo Wang, Zicheng Zhang, Libo Wang, Junfeng Ma

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对全双工语音对话的生成上下文错位问题,提出了中间件层PACE,通过将模型上下文锚定到客户端播放边界解决该问题,在GCM-Bench等数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07523 2026-08-11 cs.CY cs.AI cs.PL 新提交 83%

From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations

从被评估模型到评估辅助工具:面向编程考试的基于大语言模型的难度校准多证据研究

Hongfei Yan, Jiangkai Xiong, Yiqing Li, Chong Chen

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究将大语言模型作为编程考试难度校准的辅助证据,结合多类数据验证其与考试难度的相关性,可用于题目验证等场景,但存在应用限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22665 2026-08-11 cs.CV cs.AI 版本更新 83%

SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery

SARVLM:一种用于SAR图像语义理解的视觉语言基础模型

Qiwei Ma, Xukun Lu, Wang Liu, Puhong Duan, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Yuelushan Center for Industrial Innovation(岳麓山创新中心) School of Medical Information Engineering, Jining Medical University(济南医学院医学信息工程学院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SARVLM,一种专为SAR图像设计的视觉语言基础模型,通过多阶段领域迁移策略和集成策略提升跨场景泛化能力,在多个基准测试中表现优异。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09254 2026-08-11 cs.AI cs.CL 新提交 82%

Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline

业务真值,而非SQL准确率:规则门控的7B分析智能体优于直接提示的32B基线

Morris Lee

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM分析智能体的评估缺陷,提出WarehouseReliabilityBench基准,开发规则门控的7B智能体QueryProof,其业务真值率优于直接提示的32B基线,且成本显著降低,假成功比例大幅下降。

Comments 20 pages, 7 figures, 11 tables. Benchmark, code, run records, pre-registration and one-command reproduction: https://github.com/k-w-lee/query_proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08975 2026-08-11 cs.CL cs.AI 新提交 82%

How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review

如何对AI审稿人进行修辞奖励黑客攻击?剖析基于AI的同行评审中的修辞敏感性

Ming Li, Chenguang Wang, Xirui Li, Xinyue Zeng, Dianqi Li, Peng Shi, Dawei Zhou, Tianyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对基于AI的同行评审,构建受控语料库测试修辞选择对AI审稿判断的影响,明确修辞敏感性的层级结构及工作流程效果,为开发鲁棒评估系统提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07827 2026-08-11 cs.LG cs.CL 新提交 82%

From token probabilities to calibrated confidence: An empirical study of mathematical question answering

从token概率到校准置信度:数学问答的实证研究

Avery Ma, Lorne Schell, Vin Bhaskara, Leila Pishdad

机构 * RBC Borealis(加拿大皇家银行博雷利斯(RBC Borealis))

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对数学问答任务,探究token概率能否用于生成校准置信度,对比单遍与多遍估计器,评估多种校准方法,发现序列聚合token概率可提升置信度质量,事后校准能降低域内误差但迁移性存在非对称问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-11 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 82%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03685 2026-08-11 cs.LG cs.AI stat.ML 版本更新 82%

Universal One-third Time Scaling in Learning Peaked Distributions

学习尖峰分布中的普适三分之一时间缩放

Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析和实验验证,揭示了使用softmax和交叉熵学习尖峰分布时,损失和梯度呈幂律衰减,导致损失时间缩放指数为1/3的普适瓶颈,为神经缩放现象提供了机理解释。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09068 2026-08-11 cs.SE 新提交 82%

Pseudo2CodeQA: A Benchmark for LLM-Based Structured Algorithmic Reasoning in Code Generation

Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试

Shadikur Rahman, Umme Ayman Koana, Syed Muhammad Danish

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27519 2026-08-11 cs.CV 版本更新 82%

SPROUT: A Scalable Diffusion Foundation Model for Agricultural Vision

SPROUT:一种用于农业视觉的可扩展扩散基础模型

Shuai Xiang, James Burridge, Shouyang Liu, Hao Lu, Tokihiro Fukatsu, Yinqiang Zheng, Wei Guo

机构 * Graduate School of Agricultural and Life Sciences, The University of Tokyo(东京大学大学院农学生命科学研究科) National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学多谱信息智能处理技术全国重点实验室、人工智能与自动化学院) Institute of Agricultural Machinery, NARO(日本国立研究开发法人农业·食品产业技术综合研究机构农业机械研究所) Institute of Life and Environmental Sciences, University of Tsukuba(筑波大学生命环境科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 SPROUT是一种基于扩散去噪的多作物多任务农业基础模型,通过大规模未标注数据预训练,在多种下游任务中表现优异,且预训练成本较低。

Comments Code: https://github.com/UTokyo-FieldPhenomics-Lab/SPROUT Dataset: https://huggingface.co/datasets/XIANG-Shuai/MCD-2.6m

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16085 2026-08-11 cs.CV 版本更新 82%

Ensemble learning of pathology foundation models for precision oncology

面向精准肿瘤学的病理基础模型集成学习

Xiangde Luo, Xiyue Wang, Feyisope Eweje, Xiaoming Zhang, Juan Luis Gomez Marti, Sarah Cascarino, Sen Yang, Yuchen Li, Ryan Quinton, Jinxi Xiang, Yuanfeng Ji, Zhe Li, Yijiang Chen, Colin Bergstrom, Ted Kim, Francesca Maria Olguin, Kelley Yuan, Matthew Abikenari, Andrew Heider, Sierra Willens, Sanjeeth Rajaram, Robert West, Joel Neal, Adam Schoenfeld, Maximilian Diehn, Chad Vanderbilt, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(放射肿瘤科,斯坦福大学医学院) Department of Pathology, Stanford University School of Medicine(病理学系,斯坦福大学医学院) Department of Medicine (Oncology), Stanford University School of Medicine(医学系(肿瘤学),斯坦福大学医学院) Department of Neurosurgery, Stanford University School of Medicine(神经外科,斯坦福大学医学院) Stanford Institute for Human-Centered Artificial Intelligence(斯坦福大学人本人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对现有病理基础模型性能不一致、泛化有限的问题,提出ELF集成学习框架,整合5个预训练病理基础模型,在5万余张WSIs上训练后,在多种肿瘤相关任务中性能优于单模型,为病理应用提供新方案。

Comments In this version, we fixed some issues and updated some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09476 2026-08-11 cs.CR cs.AI 新提交 81%

ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents

ActBench:协作智能体行为安全的自演进基准

Hongwei Yao, Yiming Liu, Meihui Chen, Jieling Chen, Zikun Chen, Yiling He, Wangze Ni, Cong Wang, Kui Ren

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。

Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09289 2026-08-11 cs.CL 新提交 81%

Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

准确但自然?诊断日本英语作为外语写作中的语法与习语差距

Steve Woollaston, Brendan Flanagan, Hiroaki Ogata

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出分层LLM修正流水线,结合CEFR-J语法提取器,诊断日本初中生英语写作的语法准确性与习语性差距,为个性化教学反馈提供循证支持。

Comments APCLC submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 81%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 81%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏