arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-03 至 2026-08-03 共收录 71 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 25 篇

2607.29445 2026-08-03 cs.CV cs.AI 新提交 57%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 57%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 57%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 57%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 57%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 57%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28629 2026-08-03 cs.AI 新提交 57%

OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems

智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统

Konstantinos I. Roumeliotis, Ranjan Sapkota

机构 * University of the Peloponnese(伯罗奔尼撒大学) Cornell University(康奈尔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19063 2026-08-03 cs.AI 版本更新 57%

Quality Action Assurance: Multimodal Verification of Examiner Claims in VR OSCEs

质量行动保证:虚拟现实客观结构化临床考试中考官声明的多模态验证

Harry Rogers, Sally Shiels, Ashley Tomlinson, James Thomas, James Aylward, Nathan Gauge, Helen Higham, Alison Noble

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对VR儿科OSCEs中考官评分受主观因素影响问题,提出多模态框架QAA,结合约束时间动作对齐模型与大语言模型,通过对比动作与真实事件序列验证考官声明,提升了评估的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13683 2026-08-03 cs.CL 版本更新 57%

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

通过门控语义质量多样性实现自我进化智能体的驾驭

Xiaotian Luo, Dizhan Xue, Fengxingyu Wang, Chuanrui Hu, Yafeng Deng

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型智能体驾驭因素提升性能的问题,提出自我进化智能体驾驭框架,将提出与评估更改分开,通过门控存档避免过度拟合,在多领域测试中取得较好泛化效果,证明诊断与评估循环的有效性。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01103 2026-08-03 cs.CL 版本更新 57%

Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking

临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性

William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian Löns, Ronald Böck, Sebastian Fudickar

机构 * University of Luebeck(吕贝克大学) University of Tübingen(图宾根大学) University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) University Hospital Würzburg(维尔茨堡大学医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Genie Enterprise Deutschland GmbH

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17262 2026-08-03 cs.CL stat.ME 57%

Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study

对大型语言模型中社会期望反应进行量化与缓解:一种匹配可欲性的等级强制选择心理测量研究

Kensuke Okada, Yui Furukawa, Kyosuke Bunji

机构 * The University of Tokyo(东京大学) Kobe University(Kobe大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出了一种心理测量框架,用于量化和缓解LLM问卷评估中的社会期望反应偏差,通过匹配可欲性来减少偏差并保持目标特征的恢复。

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers, pp. 40148-40166

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12088 2026-08-03 cs.SE 版本更新 50%

Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation

结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡

Honghao Tan, Haibo Wang, Shin Hwei Tan

专题命中 安全评测 :safety(abstract)

AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。

Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11381 2026-08-03 q-bio.PE cs.MS 版本更新 50%

MEmilio -- A high performance Modular EpideMIcs simuLatIOn software for multi-scale and comparative simulations of infectious disease dynamics

MEmilio -- 高性能模块化流行病模拟软件用于多尺度和比较模拟的传染病动态

Julia Bicker, Carlotta Gerstein, David Kerkmann, Sascha Korf, René Schmieding, Anna Wendler, Henrik Zunker, Daniel Abele, Maximilian Betz, Khoa Nguyen, Lena Plötzke, Kilian Volmer, Agatha Schmidt, Nils Waßmuth, Patrick Lenz, Daniel Richter, Hannah Tritzschak, Ralf Hannemann-Tamas, Julian Litz, Paul Johannssen, Marielena Borges, Annika Jungklaus, Manuel Heger, Annalena Lange, Elisabeth Kluth, Kathrin Rack, Vincent Wieland, Jonas Arruda, Sebastian Binder, Margrit Klitz, Martin Siggel, Manuel Dahmen, Achim Basermann, Michael Meyer-Hermann, Jan Hasenauer, Martin J. Kühn

专题命中 安全评测 :trustworthy(abstract)

AI总结 MEmilio 是一个高性能模块化流行病模拟软件,通过统一架构整合多种流行病学模型,提升传染病动态模拟的效率与准确性。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2607.28934 2026-08-03 cs.CL cs.AI cs.CY 新提交 67%

FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation

FairFund-Bench:评估大语言模型资源分配中的分配偏差

Martin Lukk

机构 * University of Toronto(多伦多大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 FairFund-Bench基准通过调整审计格式等特征,发现LLM资源分配的偏差受审计类型影响,且因果框架效应强于人口统计效应,可用于评估LLM的分配偏差。

Comments 19 pages, 7 figures. Code and data: https://github.com/martinlukk/fairfund-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29071 2026-08-03 cs.LG cs.AI 新提交 62%

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

采用异构压缩客户端的联邦基础模型微调

Shengkun Zhu, Jinshan Zeng, Zhihua Allen-Zhao, Mayi Xu, Quanqing Xu, Wei Ren, Qiang Yang, Yang Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) OceanBase, Ant Group(蚂蚁集团OceanBase) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, China University of Geosciences(中国地质大学计算机学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23396 2026-08-03 stat.ML cs.LG 57%

AICO: Feature Significance Tests for Supervised Learning

AICO:监督学习中的特征重要性检验

Kay Giesecke, Enguerrand Horel, Chartsiri Jirachotkulthorn

机构 * Stanford University, Department of Management Science and Engineering and Institute for Computational and Mathematical Engineering(斯坦福大学管理科学与工程系和计算与数学工程研究所) Upstart, Inc.(Upstart公司) Stanford University, Institute for Computational and Mathematical Engineering(斯坦福大学计算与数学工程研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG

AI总结 AICO提出一种高效统计方法,通过屏蔽特征信息来测试特征对预测性能的贡献,为大规模模型提供无分布假设的可解释性工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10680 2026-08-03 cs.HC cs.AI 57%

A Platform-Agnostic Multimodal Digital Human Modelling Framework: Neurophysiological Sensing in Game-Based Interaction

一种平台无关的多模态数字人类建模框架:基于游戏交互的神经生理传感

Daniel J. Buxton, Mufti Mahmud, Jordan J. Bird, Thomas Hughes-Roberts, David J. Brown

机构 * Nottingham Trent University(诺丁汉特伦大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种平台无关的多模态数字人类建模框架,通过统一的神经生理传感和游戏交互环境,支持AI驱动的可重复、可扩展的交互研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06945 2026-08-03 cs.LG cond-mat.dis-nn physics.data-an quant-ph 版本更新 57%

Fisher Information, Training and Bias in Fourier Regression Models

傅里叶回归模型中的费舍尔信息、训练与偏差

Lorenzo Pastori, Veronika Eyring, Mierk Schwabe

机构 * Deutsches Zentrum für Luft- und Raumfahrt (DLR), Institut für Physik der Atmosphäre(德国航空航天中心(DLR)大气物理研究所) Institute of Environmental Physics (IUP), University of Bremen(环境物理学研究所(IUP),不莱梅大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 该研究利用量子神经网络与傅里叶模型的等价性,推导傅里叶模型的费舍尔信息矩阵,分析有效维度与任务偏差对模型训练和性能的影响,还引入傅里叶模型的张量网络表示,为机器学习研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29610 2026-08-03 cs.SE 新提交 50%

Educating the Agentic Engineer: Curricula, Collaboration, and Continuous Learning in the AI Era

培养智能体工程师:AI时代的课程、协作与持续学习

Mamdouh Alenezi

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 针对AI时代软件与系统工程的转型需求,本文提出ACCEL框架,构建智能体工程师的教育架构,明确核心能力与实施路径,识别风险并主张开展系统性教育变革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29279 2026-08-03 cs.SD 新提交 50%

ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition

ParaASR:面向快速长上下文基于大语言模型的语音识别的多令牌预测

Qingjian Lin, Yuxin Li, Haoyang Zhang, Jun Chen, Yechang Huang, Feng Tian, Xie Li, Xiangyu Tony Zhang, Daijiao Liu, Yuxin Zhang, Jinglan Gong, Bo Zhao, Fei Tian, Xuerui Yang, Gang Yu, Xiangyu Zhang, Daxin Jiang

机构 * StepFun(阶跃星辰) NTU(南洋理工大学) PKU(北京大学) UNSW(新南威尔士大学) SJTU(上海交通大学) USTC(中国科学技术大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 ParaASR是一款基于大语言模型的ASR系统,通过多令牌预测技术,在保持低错误率、低延迟的同时,支持32K长上下文及30分钟音频的快速转录,兼顾识别质量、速度与上下文长度。

Comments 14 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 21 篇

2607.26947 2026-08-03 cs.CV cs.AI 版本更新 83%

Progressive Multimodal Alignment for Continual Instruction Tuning

用于持续指令微调的渐进式多模态对齐

Duzhen Zhang, Yahan Yu, Qiaoyi Su, Jiahua Dong, Tielin Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) Kyoto University(京都大学) Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28986 2026-08-03 cs.CV cs.AI cs.CL cs.MA 新提交 81%

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁

Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) MoAdata(MoAdata公司) University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 79%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28980 2026-08-03 cs.LG 新提交 79%

Beyond Feature and Structure Alignment: Learning Transferable Propagation Knowledge for Graph Foundation Models

超越特征与结构对齐:学习图基础模型的可迁移传播知识

Yi Wang, Jitao Zhao, Di Jin, Dongxiao He

机构 * Tianjin University(天津大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 针对现有图基础模型忽略可迁移传播知识单元与传播模式异质性的局限,本文提出ProGFM,通过传播关系原型库学习跨域可迁移传播知识,在多跨域场景下实现更优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28674 2026-08-03 cs.AI cs.CL cs.LG 新提交 67%

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

它认为有多难?分析大型语言模型思维链轨迹中感知步骤的推理能量

Hui Wei, Junda Wu, Sheldon Yu, Sizhe Zhou, Yizhu Jiao, Ming Zhong, Bowen Jin, Tong Yu, Shijia Pan, Jiawei Han, Julian McAuley

机构 * UC Merced(加州大学默塞德分校) UC San Diego(加州大学圣迭戈分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(奥多比研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出SARE框架量化LLM思维链各步骤的推理能量,发现推理能量不均匀、错误轨迹关键节点能量更低,SARE特征性能优于或匹配输出置信度基线,揭示内部几何动态含预测信息。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14142 2026-08-03 cs.CL cs.AI 版本更新 62%

Implicit Reasoning for Large Language Model-based Generative Recommendation

基于大语言模型的生成式推荐的隐式推理

Yinhan He, Liam Collins, Bhuvesh Kumar, Jundong Li, Neil Shah, Donald Loveland

机构 * University of Virginia(弗吉尼亚大学) Snap Inc.(Snap公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型用于生成式推荐时显式推理的三大局限(世界知识表达弱化、语义ID与自然语言嵌入空间不对齐、推理质量敏感),提出轻量级隐式推理范式PauseRec,在性能、训练成本和推理速度上均优于显式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04215 2026-08-03 cs.LG cs.AI 版本更新 62%

Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs

预测后扩散:面向扩散大语言模型的自适应响应长度计算

Michael Rottoli, Subhankar Roy, Stefano Paraboschi

机构 * IEEE

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Predict-then-Diffuse框架,通过自适应响应长度预测器和安全机制,实现计算预算下的高效推理,减少计算成本并保持输出质量。

Comments Accepted for publication in IJCNN 2026 (International Joint Conference on Neural Networks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29402 2026-08-03 cs.IR cs.CL 新提交 57%

Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings

弥合检索增强生成中的问答差距:假设提示嵌入

Domen Vake, Jernej Vičič, Aleksandar Tošić

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究提出假设提示嵌入(HyPE)框架,将假设内容生成移至索引阶段,提升RAG的检索对齐度与效率,在六个数据集上实现检索精度和召回率的显著提升且兼容多种RAG技术

Comments 10 pages, 8 figures, 5 tables. Published in IEEE Access

Journal ref IEEE Access, vol. 13, pp. 129952-129961, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29283 2026-08-03 cs.AR cs.LG 新提交 57%

RTLCurator: Label-Efficient Data Curation for RTL Generation

RTLCurator:用于RTL生成的标签高效数据整理

Siyang Cai, Cangyuan Li, Wenjing Chang, Kun Wang, Haoyu Gao, Yinhe Han, Ying Wang

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 RTLCurator通过对比规范与模拟失败的实现学习兼容性先验,用少量验证配对校准后,平衡对齐度、覆盖度与结构丰富度保留80%语料,在CodeV和RTLCoder上提升RTL生成模型性能,仅需验证10%语料池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28678 2026-08-03 cs.AI cs.CV 新提交 57%

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGE:为长视频理解构建自修正记忆

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

机构 * Zhejiang University(浙江大学) Xidian University(西安电子科技大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ViSAGE是一种多模态智能体记忆框架,通过跨模态绑定、双向记忆精调及多智能体交叉验证解决长视频理解中的实体混淆等问题,较最强基线准确率提升5.9%。

Comments Accept by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏