arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-03 至 2026-07-03 共收录 29 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 29 篇

2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 79%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02465 2026-07-03 cs.AR 新提交 78%

Probabilistic Memory for Trustworthy Edge Intelligence

面向可信边缘智能的概率存储器

Likai Pei, Jiahao Zheng, Xueji Zhao, Emilie Ye, Jianbo Liu, Hanqing Tao, Ming-Yen Lee, Ruiyang Qin, Yiyu Shi, Shimeng Yu, X. Sharon Hu, Ningyuan Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出概率存储器(p-MEM),通过存储分布参数并直接在原生内存带宽下采样,解决了高斯随机数生成与计算之间的吞吐量差距,在贝叶斯神经网络中实现指令数、延迟和能耗的大幅降低。

Comments This paper has been accepted for publication in the proceedings of the ACM/IEEE Design Automation Conference (DAC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01667 2026-07-03 cs.CV 新提交 78%

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

增强视听视频字幕的时间与跨模态对齐

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) Meituan(美团)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 75%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 67%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07267 2026-07-03 cs.AI cs.CL cs.LG 版本更新 67%

BRIDGE: Predicting Human Task Completion Time From Model Performance

BRIDGE: 从模型性能预测人类任务完成时间

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院) Periodic Labs(Periodic实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01973 2026-07-03 cs.CV cs.AI cs.LG 新提交 62%

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

机构 * University of Tuebingen(图宾根大学) Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01901 2026-07-03 cs.LG cs.AI cs.MM 新提交 62%

SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs

SABER: 一种基于多尺度超图的语义对齐脑网络分析框架

Yidan Xu, Xiangmin Han, Rundong Xue, Huihui Ye

机构 * Hangzhou Dianzi University(杭州电子科技大学) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出SABER框架,通过多尺度超图建模功能子网络与高阶依赖,并引入决策级语义对齐机制,将大语言模型语义直接融入预测,在ABIDE和ADHD-200数据集上取得最优性能,尤其在小样本场景下。

Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01829 2026-07-03 cs.AI cs.CL 新提交 62%

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

Pre-Flight: 评估大型语言模型航空运营知识的基准

Alex Brooker, Tim Hughes

机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。

Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01951 2026-07-03 physics.soc-ph cs.AI cs.CL 新提交 62%

Robust for the Wrong Reasons: The Representational Geometry of LLM Robustness to Science Skepticism

鲁棒性源于错误原因:LLM对科学怀疑论鲁棒性的表征几何

Minjong Cheon

机构 * Department of Computer Science and Engineering, Sejong University(信息科学与工程系,世宗大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过行为测量、线性探针和激活修补,研究三个指令调优模型在气候、疫苗和进化三个科学共识领域对怀疑论的反应,发现模型表现出三种不同策略而非谄媚退缩,且鲁棒性不跨领域转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04484 2026-07-03 cs.CL cs.AI 版本更新 62%

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

LLMs中的心理引导:有效性与可信度评估

Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。

Comments Accepted at ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 62%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02496 2026-07-03 cs.RO cs.LG 新提交 57%

Controllable Sim Agents with Behavior Latents

具有行为潜变量的可控模拟智能体

Juanwu Lu, Junyu Zhu, Ziran Wang

机构 * Purdue University(普渡大学) University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。

Comments 23 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02494 2026-07-03 cs.CV cs.CL 新提交 57%

Towards Robustness against Typographic Attack with Training-free Concept Localization

基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。

Comments 15 pages main text, provisionally accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02466 2026-07-03 cs.RO cs.AI 新提交 57%

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

先学移动再学做事:面向VLA的任务无关预训练

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。

Comments Accepted to ICML 2026, 21 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02230 2026-07-03 cs.CV cs.AI 新提交 57%

Efficient Waste Sorting for Circular Economy: A Confidence-guided comparison between One-Vs-All and One-Vs-Rest Classification Strategies with Human-in-the-Loop for Automated Waste Sorting

面向循环经济的高效废物分类:基于置信度的人机协同自动废物分类中一对多与一对一分类策略比较

Mohammed Fahad Ali, Dominique Briechle, Marit Briechle-Mathiszig, Tobias Geger, Andreas Rausch

机构 * Institute for Software and Systems Engineering(软件与系统工程研究所) Clausthal University of Technology(克莱斯特哈根技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对德国不同城市废物分类方案差异问题,比较OvA和OvR分类策略,通过置信度阈值筛选不确定样本进行人工复核,平衡误分类与人工标注成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01936 2026-07-03 cs.MA cs.AI 新提交 57%

CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery

CausalSteward: 一种用于因果发现的智能分治-合并副驾驶

Nicholas Tagliapietra, Gian Lorenzo Marchioni, Moritz Willig, Juergen Luettin, Lavdim Halilaj, Kristian Kersting

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出CausalSteward多智能体框架,通过分治策略将高维变量迭代划分并分别分析,融合先验知识与数据驱动方法,解决因果可识别性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01522 2026-07-03 eess.SY cs.AI cs.CE cs.SY 新提交 57%

Robust and Explainable 3D Mode Shape Recognition Using Region-Aware Graph Neural Networks

鲁棒且可解释的3D模态形状识别:基于区域感知图神经网络

Tong Duy Son, Marc Brughmans, Andrey Hense, Kohta Sugiura, Sebastian Ciceo, Paolo di Carlo, Theo Geluk

机构 * Siemens Digital Industries Software(西门子数字工业软件) KU Leuven(根特大学) Department of Mechanical Engineering(机械工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出规范工程图表示与区域感知图学习框架,将异构有限元模型和实验测量转化为通用图,通过图注意力学习和区域感知池化实现跨车辆架构的鲁棒3D模态形状识别,并提供物理解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01388 2026-07-03 cs.CL 新提交 57%

RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation

RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01278 2026-07-03 cs.LG 新提交 57%

Multilayer Q-Matrix-Embedded Neural Network for Cognitive Diagnosis (M-QCDNet): Structure-Aware Deep Learning Architecture for Psychometric Interpretability

多层Q矩阵嵌入的认知诊断神经网络(M-QCDNet):面向心理测量可解释性的结构感知深度学习架构

Yiyao Yang

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出M-QCDNet,将Q矩阵作为结构先验嵌入神经网络,通过带L2惩罚的损失函数平衡预测性能与结构对齐,实现可解释的认知诊断。

Comments 15 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 57%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22487 2026-07-03 cs.CL 版本更新 57%

Polite on the Surface, Broken in Practice: A Curated Dataset for Fixing Generation and Register Failures in Low-Resource Bangla Text Generation

表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集

Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi

机构 * United International University(国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03178 2026-07-03 cs.LG cs.RO 57%

RADE: Learning Risk-Adjustable Driving Environment via Multi-Agent Conditional Diffusion

RADE:通过多智能体条件扩散学习风险可调整的驾驶环境

Jiawei Wang, Xintao Yan, Yao Mu, Haowei Sun, Zhong Cao, Henry X. Liu

机构 * Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) University of Michigan Transportation Research Institute(密歇根大学交通研究研究院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 RADE通过多智能体条件扩散模型生成真实且可控风险的驾驶场景,直接从数据学习风险条件行为,提升自动驾驶安全评估的现实性和可扩展性。

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交 50%

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02325 2026-07-03 cs.HC 新提交 50%

Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models

无人格的人格?大语言模型中大五人格测试的心理测量学批判

Kim Zierahn, Cristina Cachero, Anna Korhonen, Nuria Oliver

专题命中 安全评测 :alignment(abstract)

AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01383 2026-07-03 cs.CV 新提交 50%

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

MIBE:面向个性化图像生成的多主体交互基准与评估器

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Southern California(南加州大学) DeerLab LLC(DeerLab有限责任公司) Carnegie Mellon University(卡内基梅隆大学) Clemson University(克莱姆森大学) Google(谷歌) San Jose State University(圣何塞州立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(abstract)

AI总结 提出MIBE框架,包含多主体交互基准(MIB)和评估器(MIE),通过解耦数据体制和双头排序诊断目标,解决多主体个性化图像生成中主体遗漏、外观失配和交互错误问题,在黄金集上达到0.922成对准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 50%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 50%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 安全评测 :alignment(abstract)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏