arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 349 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2506.03259 2026-08-07 cs.CL 版本更新 89%

Zero-Shot Multi-Disease Labeling of Chest, Abdomen, and Pelvis CT Reports Using Open-Weight Large Language Models: The Effect of Labeling Conventions

评估大型语言模型在跨器官系统CT放射报告零样本疾病标注中的效果

Michael E. Garcia-Alcoser, Mobina Ghojoghnejad, Fakrul Islam Tushar, David Kim, Kyle J. Lafata, Geoffrey D. Rubin, Joseph Y. Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型在CT报告零样本疾病标注中的效果,发现轻量级LLMs在多器官系统标注中表现优于规则方法,但需注意二元标签的局限性。

Comments 19 pages, 6 figures, 4 tables. Under review in Radiology: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22256 2026-08-07 cs.SE cs.AI 版本更新 89%

Agentic Software Issue Resolution with Large Language Models: A Survey

基于大语言模型的代理软件问题解决:综述

Zhonghao Jiang, David Lo, Zhongxin Liu

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大语言模型的代理软件问题解决的最新研究,探讨了其方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06287 2026-08-07 cs.SE 新提交 89%

Automatic Translation of Unstructured Requirements into Linear Temporal Logic through Large Language Models

基于大语言模型将非结构化需求自动翻译为线性时序逻辑

Alexandra Newcomb, Omar Ochoa

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05199 2026-08-07 cs.CR cs.AI 新提交 89%

Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents

基于模块化大语言模型(LLM)的安全智能体的事后轨迹风险验证

Zhenpeng Li

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文针对模块化LLM安全智能体的轨迹风险验证问题,提出生成树替代方案,在两阶段入侵检测实验中实现92.7%±2.4%的平均轨迹覆盖率,量化了联合访问缺失的成本。

Comments 18 pages, 11 tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新 88%

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20351 2026-08-07 cs.CL cs.AI 版本更新 88%

When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets

评估大型语言模型中公共表格数据集的潜在知识

Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学) tellmewAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估表格数据集污染的框架,通过生成控制查询和比较评估,发现四个数据集中存在污染,影响下游任务性能可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05741 2026-08-07 cs.CL cs.AI 新提交 88%

Once a Response, Always a Response: Detecting LLM-generated Text via Latent Prompt Restoration

一次响应,始终是响应:通过潜在提示恢复检测大语言模型生成的文本

Hongrui Bao, Yubing Ren, Yanan Cao, Jinhan You, Fang Fang, Shi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有零样本LLM生成文本检测器未考虑LLM训练过程的问题,提出无训练检测器EchoPrompt,通过潜在提示恢复实现零样本检测,在零样本检测器中达SOTA性能且稳健性强。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05155 2026-08-07 cs.CL cs.AI 新提交 88%

Beyond Sentiment: Comparing Traditional NLP and LLM-Based Multi-Dimensional Analysis for Political News Evaluation

超越情感:对比传统NLP与基于大语言模型的多维分析在政治新闻评估中的应用

Maryam Fooladi, Federico Bottino

机构 * Kakashi Ventures Accelerator (KVA)(卡卡西风险投资加速器(KVA)) Newjee(新吉)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文对比传统NLP的RoBERTa情感分析与基于LLM的多维框架分析,发现前者存在“中性坍缩”局限,后者可捕捉政治话语多维特征,更适配SSH研究需求。

Comments Accepted at PoliticalNLP 2026, the 3rd Workshop on Natural Language Processing for Political Sciences, co-located with LREC 2026. 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05561 2026-08-07 cs.SE 新提交 88%

Exploring Dependence, Overreliance, and Addiction Related Behaviors Associated with Large Language Model Use Among Software Engineers

探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为

Ronnie de Souza Santos, Italo Santos, Matheus de Moraes Leça, Cleyton Magalhaes, Mairieli Wessel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04824 2026-08-07 cs.CV 88%

SOVABench: A Vehicle Surveillance Action Retrieval Benchmark for Multimodal Large Language Models

SOVABench:多模态大语言模型的车辆监控动作检索基准

Oriol Rabasseda, Zenjie Li, Kamal Nasrollahi, Sergio Escalera

机构 * Milestone Systems A/S(Milestone Systems公司) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg Universitet(奥胡斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 SOVABench为多模态大语言模型提供车辆监控动作检索基准,通过定义两种评估协议评估跨动作区分和时间方向理解,展示了模型在复杂监控任务中的性能。

Comments This work has been accepted at Real World Surveillance: Applications and Challenges, 6th (in WACV Workshops)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05889 2026-08-07 cs.DL cs.AI cs.CL cs.CY 新提交 87%

The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025

长破折号嵌入国会:大语言模型时代初期(2021-2025)美国国会新闻稿中长破折号频率的全人口水平上升

Przemysław Czuma

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究分析2021-2025年美国国会新闻稿,发现无空格长破折号频率在2025年翻倍,证实LLM辅助写作的扩散,长破折号可作为全人口水平的相关标记。

Comments Preregistered study (OSF: 10.17605/OSF.IO/U5NEY); deviations from the registered plan, including a formal validation-gate breach, are disclosed in Section 4.6. Companion study: arXiv:2606.29540. 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14967 2026-08-07 cs.SE cs.AI cs.LG 版本更新 87%

MermaidSeqBench: An Evaluation Benchmark for NL-to-Mermaid Sequence Diagram Generation

MermaidSeqBench: 一种用于自然语言到Mermaid序列图生成的评估基准

Basel Shbita, Farhan Ahmed, Chad DeLuca

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MermaidSeqBench,通过混合方法构建132个样本,评估LLM生成Mermaid序列图的能力,揭示模型间显著能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15536 2026-08-07 cs.HC 版本更新 87%

'OpenBloom': A Stigma-Sensitive LLM Design Probe for Navigating Reproductive Well-being Conversations with Young Adults

「OpenBloom」:一种面向生殖健康的污名敏感型大语言模型设计探针

Yang Hong, Ashley Hua, Adya Daruka, Sharifa Sultana

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出OpenBloom,利用大语言模型将生殖健康文章转为问题提示,通过34名参与者的136次交互研究,探讨AI生成问题如何与社会污名、情境敏感性和反思性互动,并讨论女性主义HCI、可争议性和价值敏感AI框架的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22748 2026-08-07 econ.GN q-fin.EC 版本更新 87%

Nine Raters, One Index: Carrying LLM Disagreement into Labour-Market Estimates

英国就业对生成式人工智能的暴露程度如何?开发和应用一个基于任务的指数

Golo Henseke, Rhys Davies, Alan Felstead, Duncan Gallie, Francis Green, Ying Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文开发了生成式人工智能易感指数(GAISI),通过任务层面的数据衡量英国就业对大语言模型的暴露程度,发现多数岗位有一定程度的AI暴露,但仅有少数岗位高度暴露,且AI暴露对工资溢价的影响有所下降。

Comments 47 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06312 2026-08-07 cs.CL 新提交 86%

Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

面向规则密集型国家标准文档评审的大语言模型基准测试与增强

Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin, Haitao Wang, Xinyu Cao, Tianyong Hao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 86%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05960 2026-08-07 cs.CV cs.AI 新提交 85%

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) UKE Hamburg(汉堡大学医院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11522 2026-08-07 cs.SD cs.LG cs.MM eess.AS 85%

Leveraging LLM Embeddings for Cross Dataset Label Alignment and Zero Shot Music Emotion Prediction

Renhang Liu, Abhinaba Roy, Dorien Herremans

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Journal ref Proc. of Conference on AI Music Creativity (AIMC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05850 2026-08-07 cs.CL cs.AI 新提交 84%

MameLoshnLM: Yiddish Language Model and Evaluation Benchmark

MameLoshnLM:意第绪语语言模型与评估基准

Uri Katz, Omer Goldman, Tomasz Limisiewicz, Reut Tsarfaty, Noah A. Smith

机构 * Bar-Ilan University(巴伊兰大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出首个专为意第绪语构建的开源8B参数语言模型MameLoshnLM,通过自研语料库与基准优化Llama 3.1 8B,其表现优于同规模开源基线,为意第绪语NLP及低资源语言模型开发提供了基础与模板。

Comments Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06108 2026-08-07 cs.AI 新提交 84%

Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents

评估大语言模型的投资逻辑:面向个性化金融智能体的真实世界基准

Yuanhong Jiang, Jingjie Zou, Zhenghong Lin, Xusheng Yu, Qiqi Huang, Shuai Jia, Shijie Dai

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出原生过程基准InvestLogicBench,含151位真实投资者的201247项决策,评估发现金融LLMs逻辑合理性高但事件接地性低,指出需以P→E→R→D→O轨迹评估个性化决策智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16666 2026-08-07 cs.CL 版本更新 84%

Robust Native Language Identification through Agentic Decomposition

基于智能体分解的鲁棒原生语言识别

Ahmet Yavuz Uluslu, Tannon Kew, Tilia Ellendorff, Gerold Schneider, Rico Sennrich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文针对LLM原生语言识别易依赖表面线索的问题,提出受法医语言学启发的智能体分解流程,通过专用智能体积累分类证据、协调智能体综合预测,在基准数据集上提升了NLI的鲁棒性与性能一致性。

Comments Accepted at EMNLP* 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 8398-8414

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06301 2026-08-07 cs.AI cs.CL cs.LG 新提交 83%

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

HarnessOpt-Bench:评估大型语言模型的 harness 优化能力

Varun Ursekar, Apaar Shanker, Yash Maurya, Shehab Yasser, Vijay S. Kalmath, Veronica Chatrath, Yuan Xue

机构 * Scale AI

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05993 2026-08-07 cs.CL 新提交 83%

Clinical Communication Processing with Models Trained on LLM-Generated Synthetic Data: A Structured Survey and Novel Application Case Studies

基于大语言模型生成的合成数据训练模型的临床通信处理:结构化综述与新型应用案例研究

Alexander Apartsin, Yehudit Aperstein

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述用大语言模型生成的合成数据训练临床NLP系统的研究,结合13项无真实标注数据的案例,发现合成通信可支撑相关系统,微调编码器模型具竞争力,需真实数据迁移等完善。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06366 2026-08-07 cs.AI cs.LG 新提交 82%

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

追踪核心:一种用于心力衰竭特征工程的证据关联管道

Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo

机构 * Nimblemind(宁敏德(音译)) Singapore University of Technology and Design(新加坡科技设计大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Florida International University(佛罗里达国际大学) University of California Los Angeles(加利福尼亚大学洛杉矶分校) Rutgers University Newark(罗格斯大学纽瓦克分校) Rutgers Institute for Health Health Care Policy and Aging Research(罗格斯大学健康、医疗保健政策与老龄化研究所) Robert Wood Johnson Medical School(罗伯特·伍德·约翰逊医学院) Rutgers Health(罗格斯医疗)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对心力衰竭EHR特征工程瓶颈,开发了nMAS管道,经500条虚拟记录验证,可提升HFrEF和HFpEF表型分析的AUROC,为自动化可审核特征工程提供了可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06329 2026-08-07 cs.CL cs.AI 新提交 82%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05228 2026-08-07 cs.AI cs.CL 新提交 82%

TriQua: Reconciling Granularity and Context in Factuality Evaluation

TriQua:在事实性评估中协调粒度与上下文

Jin Liu, Steffen Thoma, Achim Rettinger

机构 * FZI Research Center for Information Technology(FZI信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Trier University(特里尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 TriQua框架解决LLM事实性评估的粒度与上下文权衡问题,提出自适应事实建模方式及TriQuaScore,在事实验证任务中表现优于现有框架且与人工评分高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05266 2026-08-07 cs.AI cond-mat.mtrl-sci cs.LG 新提交 82%

Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks

智能体自动驾驶显微镜基准测试支持性能验证,但不一定能泛化到未见任务

Nathan S Johnson, Ian Abshire

机构 * Carl Zeiss Research Microscopy Solutions(卡尔蔡司研究显微镜解决方案)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究开发基准框架评估显微镜智能体架构等因素的性能,发现其虽可用于验证比较,但现有基准无法预测智能体在未见显微镜任务上的表现。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00025 2026-08-07 q-bio.NC cs.CL cs.HC cs.LG eess.AS 版本更新 82%

MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis

MoDAl: 基于去相关的自监督神经模态发现用于语音神经假体

Yuanhao Chen, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MoDAl框架,通过对比学习和对齐损失与去相关损失之间的协同作用,从多脑区发现互补神经模态,在Brain-to-Text Benchmark '24上将词错误率从26.3%降至21.6%。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05519 2026-08-07 cs.AI cs.CL cs.LG 新提交 82%

EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents

EcoAgent-Bench:评估预算约束下大语言模型智能体的经济决策能力

Jie Wu, Ming Gong, Feixiang Cheng, Qinqin Zhao

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EcoAgent-Bench基准,评估大语言模型智能体在预算约束下的经济决策能力,发现现有智能体在该任务上表现不佳,发布了相关研究资源。

Comments 8 pages, 3 figures, 4 tables. Benchmark, dataset (304 budget-conditioned agent tasks), and evaluation harness; artifacts to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02647 2026-08-07 cs.SE 版本更新 82%

From Guessing to Seeing: Enhancing LLM-Based Program Repair via Trace-Guided Multi-strategy Debate

通过多智能体辩论引导的运行时执行轨迹指导的自动程序修复

Jiaqing Wu, Tong Wu, Manqing Zhang, Yunwei Dong, Bo Shen

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出TraceRepair框架,利用运行时事实作为共享约束进行补丁验证,通过多智能体协作提高修复效率和泛化能力,实验显示其在修复缺陷和处理新 bug 数据集上表现优异。

Comments 13 pages, 4 figures, 10 tables. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏