arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2608.07497 2026-08-11 cs.HC cs.CL 新提交 81%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20739 2026-08-11 cs.CR cs.LG cs.SE 版本更新 81%

Learning to Triage Vulnerability Reports from Program Analysis: An Empirical Study in Node.js

学习对程序分析生成的漏洞报告进行分类:针对Node.js的实证研究

Ronghao Ni, Aidan Z. H. Yang, Min-Chien Hsu, Nuno Sabino, Limin Jia, Ruben Martins, Darion Cassel, Kevin Cheang

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对Node.js,基于程序分析工具数据训练机器学习模型,实现漏洞报告优先级排序,最优模型在召回90%可利用报告时可排除75%良性报告,具备实用潜力。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). The version of record is available at https://doi.org/10.1145/3832783.3837503

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16481 2026-08-11 cs.LG 版本更新 81%

Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms

评估智能体系统对抗恶意诱导危害的鲁棒性

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08989 2026-08-11 cs.CL cs.AI 新提交 81%

How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology

基础模型在婴儿信号上的迁移能力如何?基于统一需求本体的跨数据集迁移审计

Wu Hangyu

专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对婴儿哭声语料库的标签不兼容等问题,通过多级审计探究基础模型的跨数据集迁移能力,提出实用方案并发布工具将不兼容语料库转为联合训练资源。

Comments 18 pages, 7 figures. Under review at AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 81%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09145 2026-08-11 cs.CV 新提交 80%

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

正确答案,错误依据:面向红外图像多模态大语言模型的感知感知评估与热基础反馈机制

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对红外图像多模态大语言模型仅以答案准确率评估的问题,提出感知感知评估框架与无需训练的热基础反馈机制,可提升解释热基础度,为可信红外场景理解模型的开发提供了方向。

Comments This manuscript is currently under peer review. Copyright may subsequently be transferred to the publisher, after which the availability of this version may be subject to the publisher's policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07018 2026-08-11 cs.HC 版本更新 80%

Designing Youth Social Media through Problem Space Attunement

青少年社交媒体设计中的问题空间调适

JaeWon Kim

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文通过三种问题空间失调(概念性、定义性、评价性)分析青少年社交媒体设计中的权力失衡,并提出虚构探究工作坊、Discord异步社区和LLM代理模拟沙盒等干预方法,以建立以青少年为中心的关系支持型社交媒体设计准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09853 2026-08-11 cs.RO cs.CV cs.LG 新提交 79%

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

RynnValue:基于时间距离扩展机器人价值基础模型

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

机构 * DAMO Academy, Alibaba Group(达摩院(阿里巴巴集团)) Hupan Lab(湖畔实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出开源机器人价值基础模型 RynnValue,以时间距离为监督目标,在多维度超越现有方法,可提升机器人策略的真实世界任务成功率并实现零样本泛化。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08654 2026-08-11 cs.AI 新提交 79%

The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task

脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较

Marc Alier Forment, María José Casañ Guerrero, Francisco José García-Peñalvo, Juanan Pereira

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。

Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08244 2026-08-11 cs.AI 新提交 79%

FemWear: A Specialized Wearable Foundation Model for Women's Health

FemWear:面向女性健康的专用可穿戴设备基础模型

Yifan Wang, Chenzhong Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07617 2026-08-11 cs.AI 新提交 79%

TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair

TeXFix-Bench:面向基于大语言模型的文档源代码修复的经验驱动多格式基准

Prajwal S. Venkateshmurthy

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究构建了基于经验故障分类法的多格式文档修复基准TeXFix-Bench,通过实验发现仅编译成功率会高估修复质量,Typst修复难度高于LaTeX和Markdown,并发布了相关分类法与工具。

Comments 9 pages, 4 figures, 9 tables. Artifacts: https://doi.org/10.5281/zenodo.21831797

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02587 2026-08-11 cs.SE cs.LG 版本更新 79%

The Moving Target: A Longitudinal Audit of Trust-Benchmark Score Drift Across Open-Source Chat LLM Release Lines

移动目标:对开源聊天语言模型十二个检查点的可信度漂移进行纵向审计

Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南方 Methodist 大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 通过对四个开源版本系列在多提示模板下的信任基准测试,发现相邻版本间存在显著漂移,结论是发布线的信任分数应重新测量,而非沿用,应作为检查点相关的日期化工件报告。

Comments 6 pages, 1 figure; accepted at IEEE ICMLA 2026; title, presentation, and formatting revised from v1; empirical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19069 2026-08-11 cs.CV 版本更新 78%

Delineate Anything v2: A Global Foundation Model for Field Delineation

描绘一切 v2:用于田地描绘的全球基础模型

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Charlotte Julia Li-Xing Wang, Zoltan Szantoi

机构 * European Space Agency(欧洲航天局) Space Research Institute NASU-SSAU(乌克兰国家科学院-乌克兰国家空间局空间研究所) University of Maryland(马里兰大学) National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”(乌克兰国立技术大学“ Igor Sikorsky基辅理工学院”)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对大规模农业田地边界描绘难题,提出全球可扩展基础模型描绘一切 v2,构建 FBIS - 73M 数据集,引入特定数据处理管道,建立评估基准,该模型超越现有技术,速度适合大规模部署,相关资源公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新 78%

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08813 2026-08-11 cs.RO 版本更新 78%

Calib3R: Hand-Eye Calibration and 3D Metric-Scaled Scene Reconstruction with 3D Foundation Models

Calib3R:基于三维基础模型的手眼标定与三维度量尺度场景重建

Davide Allegro, Matteo Terreran, Stefano Ghidoni

机构 * Department of Information Engineering (DEI) at the University of Padova(帕多瓦大学信息工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 Calib3R是一种基于3D基础模型的无标定板方法,通过统一优化联合完成手眼标定与度量尺度三维重建,仅用不到10张图像即可实现精确标定,性能优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08869 2026-08-11 cs.CL 新提交 77%

Position Bias in Ordinal Classification: A Systematic Evaluation

序数分类中的位置偏差:系统评估

Yu Wang, Jeffrey Zhou, Menglin Liu, Ge Shi

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究系统评估了序数分类中大型语言模型的位置偏差,发现其普遍存在且现有校正方法效果有限,提出需结合预测性能与稳定性选择序数分类系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 77%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 77%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 77%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12265 2026-08-11 cs.CL 77%

Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation

Junjie Chen, Weihang Su, Zhumin Chu, Haitao Li, Yujia Zhou, Dingbo Yuan, Xudong Wang, Jun Zhou, Yiqun Liu, Min Zhang, Shaoping Ma, Qingyao Ai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09412 2026-08-11 cs.AI 新提交 74%

KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models

KVDiagnosis:长上下文语言模型中KV缓存压缩的诊断基准

Chen Qiu, Ziwu Liu, Chao Fei, Guozhong Li, Panos Kalnis

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出KVDiagnosis,即长上下文语言模型KV缓存压缩的诊断基准,通过分类方法、设计评估流程、建立记录格式,在Qwen3-8B上验证其可有效区分压缩成败,代码与数据公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09187 2026-08-11 cs.CL 新提交 74%

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

故障感知的长文本翻译:可恢复大语言模型翻译系统的设计与实现

Yanlin Yu

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 针对长文本翻译API返回不可用结果的问题,设计实现了带恢复协议的可恢复大语言模型翻译系统,该系统通过延迟发布、验证输出等方式保障翻译可用性,经测试符合多项规则要求。

Comments 9 pages, 2 figures. A sanitized reference implementation is included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06609 2026-08-11 cs.AI 版本更新 74%

Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques

自动化项目评估:利用大语言模型生成的评语预测项目的接受与拒绝

Hotaka Maeda, Yikai Lu

机构 * Smarter Balanced, University of California-Santa Cruz(加州大学圣克鲁兹分校 Smarter Balanced) University of Minnesota-Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究利用大规模标准化测试的项目数据,通过融合DeBERTa分类器与Qwen3生成的项目评语,构建AIE模型预测项目接受/拒绝,可减轻人工评审负担,但对公平性相关项目的识别仍需人工评审。

Comments 19 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 74%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 73%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 73%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 73%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07542 2026-08-11 cs.AI cs.LG cs.MA cs.RO 新提交 73%

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

不会发生漂移的AI科学家:四足机器人导航研究循环中的偏好、结构与可证伪发现

Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一款基于自研究范式的AI科学家,通过新增实验卡片、专门子智能体和偏好神谕kkanbu的组件,解决自主研究循环漂移问题,在四足机器人导航实验中验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 73%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07530 2026-08-11 cs.AI cs.CL cs.DB 新提交 73%

NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

NL2SHACL-Bench:面向自然语言到SHACL翻译的基准套件

Yuchen Zhou, Niels Bobet, Maribel Acosta

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NL2SHACL-Bench基准套件,评估了四个最先进大语言模型的NL2SHACL翻译能力,发现当前模型能生成语法有效SHACL,但复杂逻辑与结构模式的语义等价约束生成仍有不足,该基准可衡量领域进展。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏