arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 298 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 44 篇

2608.19075 2026-08-20 cs.CV cs.AI cs.CL 新提交 81%

ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models

重新权衡证据:校准令牌级有序视觉证据以减轻大型视觉语言模型的幻觉

Jihae Jeong, Junha Choi, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学(POSTECH))

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ReWEIGH是一种无需训练的解码干预方法,通过聚合视觉位置的令牌排名并施加有界惩罚,在多个7B至32B规模的LVLM上减少了最多21.3%的幻觉对象提及,且延迟增加极少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 81%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18524 2026-08-20 cs.CL cs.AI cs.LG cs.MA 新提交 80%

DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

DART-SD:面向多轮工具调用智能体自蒸馏的钻石拓扑感知检索与微调

Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song

机构 * ByteDance(字节跳动) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对多轮工具调用智能体训练中的拓扑崩溃问题,提出DART-SD框架,通过建模拓扑、检索恢复参考与渐进自蒸馏提升策略多样性,性能优于传统全轨迹基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28147 2026-08-20 cs.CR 版本更新 80%

Agent Harness Distillation: Inference-Time Harness Extraction and Exploitation in Autonomous Multi-Agent Systems

智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用

Yu Cui, Wuli Yang, Yirui Shi, Junhao Xia, Hui Jiang, Lei Gao, Chenfu Bao

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-20 cs.CV cs.LG 版本更新 79%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17117 2026-08-20 cs.CL cs.AI cs.IT math.IT 79%

From Tokens to Thoughts: How LLMs and Humans Trade Compression for Meaning

从标记到思考:LLMs和人类如何在压缩与意义之间进行权衡

Chen Shani, Liron Soffer, Dan Jurafsky, Yann LeCun, Ravid Shwartz-Ziv

机构 * Stanford University(斯坦福大学) Tel Aviv University(特拉维夫大学) New York University(纽约大学) Meta - FAIR

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过信息瓶颈框架比较人类与LLMs的概念结构,发现LLMs在压缩效率上优于人类,但牺牲了语义丰富性,揭示了人工与自然智能的本质差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12875 2026-08-20 cs.MA cs.SE 版本更新 78%

MetaInfer: A Knowledge Only LLM Inference Engine Generator SKILL Toolbox

MetaInfer:一个仅基于知识的大语言模型推理引擎生成器SKILL工具包

Zhenwen Miao, Honglin Wang, Mingheng Mi, Pu Wang, Chen Hu, Hai Zhang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 研究针对大语言模型推理框架代码复杂、维护成本高的问题,提出MetaInfer方法,通过用户指定运行时约束,利用大语言模型驱动多智能体协作系统结合契约知识库自动生成定制推理框架,并从多视角评估,实现从显式知识生成可运行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18294 2026-08-20 stat.ME cs.AI cs.CL cs.LG stat.ML 新提交 75%

Debiased Inference for AI-Generated Data without Gold-Standard Labels: Identification via Multiple Imperfect Measurements

无黄金标准标签的AI生成数据的去偏推断:通过多个不完美测量进行识别

Naoki Egami, Sooahn Shin

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无黄金标准标签的AI生成数据的下游分析偏差问题,提出DMM框架,结合多个不完美AI测量实现有效推断,经模拟验证其有效性与效率提升作用,还开发了条件独立性假设的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18114 2026-08-20 cs.CL cs.AI cs.LG eess.SP q-bio.NC 新提交 75%

Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings

从非侵入式脑记录中准确解码自然句子

Mingfang Zhang, Jarod Lévy, Cedric Rommel, Jérémy Rapin, Corentin Bel, Julie Bonnaire, Daniel Nieto, Pierre Bourdillon, Svetlana Pinet, Stéphane d'Ascoli, Thomas Moreau, Jean-Rémi King

机构 * Meta AI École Normale Supérieure(高等师范学院) Université PSL(巴黎文理大学) CNRS(法国国家科学研究中心) Hospital Foundation Adolphe de Rothschild(阿道夫·德·罗斯柴尔德医院基金会) Univ. Lille(里尔大学) Basque Center on Cognition, Brain and Language(巴斯克认知、大脑与语言中心) Paris Cité University(巴黎城市大学) Inria(法国国家信息与自动化研究所) Université Paris-Saclay(巴黎萨克雷大学) INSERM(法国国家健康与医学研究院) CEA(法国原子能和替代能源委员会)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出Brain2Qwerty v2模型,利用MEG记录解码自然句子,平均WER为39%,准确率随数据量提升,通过AI技术缩小非侵入式与颅内脑机接口的性能差距。

Comments Mingfang Zhang and Jarod Lévy contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19115 2026-08-20 cs.LG cs.MM 新提交 74%

Pretraining Reusable Inference Across Views with Synthetic Task Priors

利用合成任务先验预训练跨视图的可复用推理

Jielong Lu, Zhihao Wu, Jiajun Yu, Zhaoliang Chen, Haishuai Wang

机构 * Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文提出SIMPLE模型,将多视图推理预训练为可复用过程,在多视图与多组学基准上,其冻结变体具竞争力,轻量级适配器校准性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-20 cs.AI cs.LG 新提交 73%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-20 cs.LG cs.AI cs.HC 版本更新 73%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18656 2026-08-20 cs.LG cs.PF 新提交 70%

FlashAttention for Scalable Vector Architectures

面向可扩展向量架构的FlashAttention

Sonia Rani Gupta, Nikela Papadopoulou, Miquel Pericàs

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出面向可扩展向量架构的FlashAttention-V,将其集成到ggml并在多模型与平台上评估,该方法在预填充、解码阶段均实现显著加速,但Q8_0量化线性层的结构性瓶颈制约了长向量可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18182 2026-08-20 cs.CL 新提交 70%

Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack

基于PyTorch原生栈在服务器CPU上实现小型NLP模型的高效INT8推理

Weiwen Xia, Yuxin Cui, E Cao

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究将SmoothQuant集成到TorchAO,优化PyTorch原生栈在服务器CPU上的INT8推理,使小型NLP模型获最高5.8倍吞吐量加速且精度损失可忽略,已上游到PyTorch和TorchAO便于部署。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15018 2026-08-20 cs.AI 版本更新 70%

S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices

S2-MoE:在边缘设备上实现混合专家模型的高效自推测解码

Haochen Huang, Shengxuan Qiu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 S2-MoE是面向边缘设备MoE推理的高效自推测解码框架,通过路由感知自适应扩展、复用感知门控等设计,使MoE推理在边缘设备上最高获5.3倍加速,平均约2.0倍。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-20 cs.LG cs.DC 版本更新 70%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19098 2026-08-20 cs.LG cs.AI cs.CL 新提交 67%

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

Open-MOPD:诊断与修复多教师在线蒸馏中的能力不平衡

Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR与字节跳动种子SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对多教师在线蒸馏(M-OPD)的能力不平衡问题,提出 Open-MOPD 框架,通过三种机制将提升空间恢复率从 35.6% 提升至 83.4%,并开源了相关方案与评估套件。

Comments Project page: https://bytedtsinghua-sia.github.io/Open-MOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18261 2026-08-20 cs.AI cs.LG 新提交 62%

Cacheable by Design? Training Mixture-of-Experts Routers for Locality Against the Edge Memory-Bandwidth Wall: A Pre-Registered Negative Result with a Systems Measurement Study

可设计为可缓存的?针对边缘内存带宽瓶颈训练混合专家模型路由器:一项带系统测量研究的预注册负面结果

Shriniwas Ramesh Suram

机构 * University of Cumberlands(坎伯兰大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘部署MoE模型的内存带宽瓶颈,通过系统测量与预注册实验发现,训练路由器提升缓存性的方案无法满足预注册的困惑度阈值,仅结合无训练重路由可实现高效缺失减少。

Comments Pre-registered negative result plus a systems measurement study. Code, router-telemetry tool (llama-moe-trace), traces, data manifests, and the frozen pre-registration: https://github.com/Shriniwas410/cacheable-by-design

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18386 2026-08-20 cs.CV cs.AI 新提交 57%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18470 2026-08-20 cs.RO 新提交 50%

DevGRU: Depth-guided Visual Navigation using a Collision-aware Recurrent Model

DevGRU:基于碰撞感知循环模型的深度引导视觉导航

Kyung Min Han, Eunsom Kim, Young J. Kim

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对现有视觉导航模型易在复杂室内环境碰撞的问题,提出DevGRU导航系统,结合动作与碰撞预测器提升导航性能,在9种场景实验中优于多种基线模型,且模型规模小、推理速度快

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18465 2026-08-20 cs.HC cs.ET cs.IR 新提交 50%

Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual

减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成

Seongjun Ha, Md Rashedul Islam, Gaurav Nanda, Damon Lercel

专题命中 效率与部署 :language model(abstract)

AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18322 2026-08-20 cs.IR 新提交 50%

Multimedia Asset Personalization via Multimodal Embeddings at Netflix

Netflix 中通过多模态嵌入实现多媒体资产个性化

Emma Yanyang Kong, Aditya Deshpande, Bowei Yan, Asad Abbasi, Santiago Castro, Avneesh Saluja, David Fagnan, Ashish Rastogi

专题命中 效率与部署 :foundation model(abstract)

AI总结 Netflix 采用多模态嵌入技术,通过双塔模型结合 CLIP 嵌入、三模态基础模型 MediaFM 及离线代理任务,优化了美术图像和视频预览的个性化推荐,提升了冷启动性能与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31029 2026-08-20 cs.CV 版本更新 50%

PEEK: Picking Essential frames via Efficient Knowledge distillation

PEEK: 通过高效知识蒸馏提取关键帧

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

机构 * Télécom SudParis — SAMOVAR(Telecom SudParis — SAMOVAR) Institut Polytechnique de Paris(巴黎政治学院) Moments Lab

专题命中 效率与部署 :language model(abstract)

AI总结 提出PEEK方法,通过知识蒸馏将教师模型的帧相关性排名迁移至轻量级时序模型,实现高效动态帧采样,在低帧预算下显著提升视频字幕生成性能。

Comments Accepted at BMVC 2026. Supplementary material at https://www.killian-steunou.com/peek/static/pdfs/peek_supplementary.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05479 2026-08-20 cs.NE physics.ins-det 版本更新 50%

Quantization Effects of Artificial Neural Networks for Embedded Edge-Computing Applications

人工神经网络量化效果用于边缘计算应用

Alperen Aksoy, Ilja Bekman, Vesselin Dimitrov, Qader Dorosti, Chimezie Eguzo, Sarah Fleitmann, Fabian Hader, Andre Zambanini, Stefan van Waasen

专题命中 效率与部署 :post-training(abstract)

AI总结 本文研究了量化神经网络在资源受限的科学应用中的使用,包括半导体量子比特的自动校准和科学粒子探测器。通过评估PTQ、QAT和超低比特二值神经网络(BNNs)在延迟和资源使用方面的权衡,发现PTQ在U型CNN架构中可将内存使用减少四倍,同时保持或略微提高分割精度。对于非可微的定制BNNs训练,提出了一种基于遗传算法的硬件受限学习方法,展示了适用于直接转换为VHDL的LUT-based BNN架构。该方法在无需专用DSP或BRAM资源的情况下实现了纳秒级的推理延迟。

Comments deRSE26 proceedings pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 20 篇

2608.18279 2026-08-20 physics.optics cs.LG 新提交 91%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19025 2026-08-20 cs.AI cs.DB 新提交 91%

Self-prompting and cross-model consensus enable reproducible data extraction from scientific literature with large language models

自提示与跨模型共识:利用大语言模型从科学文献中实现可复现的数据提取

Valentin Romanov, Monique Bax, Steven Niederer

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.AI

AI总结 本研究提出结合自提示与跨模型共识的方法,通过四个工作流程优化LLMs从科学文献提取数据的性能,为科学数据规模化整理提供可行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18080 2026-08-20 cs.AI 新提交 90%

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述

Yisong Chen, Yifan Gao, Sijing Yu, Chuqing Zhao, Yang Lu

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。

Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations

Journal ref Journal of Industrial Integration and Management (JIIM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22664 2026-08-20 cs.AI 版本更新 90%

MBABench: Evaluating LLM Agents on End-to-End Spreadsheet Tasks in Finance

WorkstreamBench: 评估LLM代理在金融领域的端到端电子表格任务

Thomson Yen, Julian Poeltl, Harshith Srinivas Gear, Yilin Meng, Joshua Fan, Adam Shen, Yili Liu, Ali Bauyrzhan, Patrick Shea, Siri Du, Haoyang Liu, Daniel Guetta, Hongseok Namkoong

机构 * Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营部门) ESB Business School, Reutlingen University(图宾根大学ESB商学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出WorkstreamBench,用于评估LLM代理在金融领域复杂端到端电子表格任务中的能力,重点在于财务建模和情景分析等关键流程,通过三个维度(准确性、公式、格式)的细粒度标准来衡量解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18260 2026-08-20 cs.AI cs.CL cs.CR cs.IR cs.LG 新提交 88%

Redakto - The Incognito Tab for LLMs

Redakto——面向大语言模型的隐身标签

Saurav Kumar Saha, Tom Röhr, Felix Bießmann

机构 * Berlin University of Applied Sciences(柏林应用科学大学) Einstein Center Digital Future(爱因斯坦数字未来中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Redakto是一款开源匿名化工具,可通过网页应用、REST API等供用户使用,能移除文本中PII,其匿名化后的文本效用与原文相当,可助力LLM使用时的隐私保护。

Comments Accepted at WIPE-OUT 2026, 2nd Workshop on Machine Unlearning and Privacy Preservation at ECML-PKDD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16921 2026-08-20 cs.IR cs.CR cs.LG cs.MA 版本更新 86%

MITRE-SAGE: A Multi-Agent Cybersecurity Question-Answering Model

MITRE-SAGE:一种多智能体网络安全问答模型

Ali Habibzadeh, Farid Feyzi, Reza Ebrahimi Atani

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对网络安全领域LLM的不足,研究提出多智能体框架MITRE-SAGE,结合MITRE-QA基准验证其在多项网络安全问答任务中优于基线方法,轻量级配置表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏