arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1359 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 457 篇

2604.14163 2026-07-07 cs.CL cs.AI 版本更新 62%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 62%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06607 2026-07-07 cs.MA cs.AI cs.LG 版本更新 62%

Multi-Agent Reinforcement Learning for V2X Resource Allocation: Disentangling MARL Challenges Through Benchmarking

用于车联网资源分配的多智能体强化学习:通过基准测试解开多智能体强化学习挑战

Siyuan Wang, Lei Lei, Pranav Maheshwari, Sam Bellefeuille, Kan Zheng

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) College of Electrical Engineering and Computer Sciences, Ningbo University(宁波大学电气与电子工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将车联网资源分配建模为多智能体干扰博弈层次结构,构建基准学习任务与数据集,评估多种多智能体强化学习算法,揭示不同范式优缺点,为评估算法提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22240 2026-07-07 cs.LG cs.AI 版本更新 62%

EvoXplain: When Machine Learning Models Agree on Predictions but Disagree on Why -- Measuring Mechanistic Multiplicity Across Training Runs

EvoXplain:当机器学习模型在预测上达成一致但在原因上存在分歧时——衡量跨训练运行的机制多样性

Chama Bensmail

机构 * University of Hertfordshire(赫特福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究机器学习模型预测一致但解释不同的问题,引入EvoXplain框架,通过分析训练和模型选择过程中解释样本,判断解释是否唯一确定,揭示平均共识与单一训练模型的关系,将可解释性视为训练管道属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 62%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19636 2026-07-07 cs.LG cs.AI 版本更新 62%

Exploring the Rashomon Set for Concept-Based Models

探索基于概念模型的罗生门集

Shihan Feng, Cheng Zhang, Michael Xi, Ethan Hsu, Lesia Semenova, Chudi Zhong

机构 * UNC Chapel Hill(UNC夏洛特山分校) Rutgers University(罗格斯大学) Duke University(杜克大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究在如概念瓶颈模型的复杂假设空间中探索罗生门集的问题,提出结合并行适配器构建、检查点方案和概念多样性目标的方法,能从单训练过程生成多个准确模型,有更好多样性且省内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04484 2026-07-03 cs.CL cs.AI 版本更新 62%

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

LLMs中的心理引导:有效性与可信度评估

Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。

Comments Accepted at ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 62%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 62%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04500 2026-07-02 cs.AI cs.CL cs.GT cs.MA 版本更新 62%

Large language models replicate and predict human cooperation across experiments in game theory

大型语言模型在博弈论实验中复制并预测人类合作行为

Andrea Cera Palatsi, Samuel Martin-Gutierrez, Ana S. Cardenal, Max Pellert

机构 * Department for Computational Social Sciences and Humanities, Barcelona Supercomputing Center(巴塞罗那超级计算中心计算社会科学与人文学系) Grupo de Sistemas Complejos, Universidad Politécnica de Madrid(马德里理工大学复杂系统研究组) School of Law and Political Science, Universitat Oberta de Catalunya(加泰罗尼亚开放大学法律与政治科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复制大规模博弈实验,发现Llama模型能高保真复现人类合作模式,而Qwen更接近纳什均衡,并揭示了Llama的注意力机制与人类行为对齐的机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12164 2026-07-01 cs.CY cs.CL 版本更新 62%

The Language You Ask In: Language-Conditioned Ideological Divergence in LLM Analysis of Contested Political Documents

提问的语言:语言条件对LLM分析争议性政治文件时的意识形态分歧的影响

Oleg Smirnov

机构 * Microsoft(微软)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究通过俄语和乌克兰语语义等价提示,发现ChatGPT和Claude Opus在分析同一乌克兰公民社会文件时,输出出现系统性意识形态分歧,且分歧程度因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11425 2026-06-25 cs.LG cs.CL 版本更新 62%

Narrative Feature or Structured Feature? A Study of Large Language Models to Identify Cancer Patients at Risk of Heart Failure

叙事特征还是结构化特征?大型语言模型识别癌症患者心力衰竭风险的研究

Ziyi Chen, Mengyuan Zhang, Mustafa Mohammed Ahmed, Yi Guo, Thomas J. George, Jiang Bian, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(健康结局与生物医学信息学系,佛罗里达大学医学院) Division of Cardiovascular Medicine, Department of Medicine, College of Medicine, University of Florida(心血管医学部,医学院,佛罗里达大学) Division of Hematology & Oncology, Department of Medicine, College of Medicine, University of Florida(血液学与肿瘤学部,医学院,佛罗里达大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究利用电子健康记录,比较传统机器学习、T-LSTM和大型语言模型(LLM)在识别癌症患者心力衰竭风险上的表现,LLM(GatorTron-3.9B)通过叙事特征取得最佳F1分数,优于其他模型。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25665 2026-06-23 cs.CL cs.AI cs.DL cs.IR 版本更新 62%

LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation

LLM-ReSum: 一个通过自我评估实现LLM反思性总结的框架

Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding

机构 * dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国) dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-ReSum框架,通过整合LLM评估与生成,提升低质量摘要的事实准确性与覆盖率,引入新的法律文档摘要基准PatentSumEval。

Comments This paper has been accepted as an invited paper for publication in Proceedings of The 12th IEEE International Conference on Big Data Computing Service and Machine Learning Applications. This is the accepted manuscript. The final authenticated version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07528 2026-06-23 cs.CL cs.AI 版本更新 62%

From RAG to Agentic RAG for Faithful Islamic Question Answering

从RAG到智能体RAG:面向可靠的伊斯兰问答

Gagan Bhatia, Hamdy Mubarak, Mustafa Jarrar, George Mikros, Fadi Zaraket, Mahmoud Alhirthani, Mutaz Al-Khatib, Logan Cochrane, Kareem Darwish, Rashid Yahiaoui, Firoj Alam

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。

Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新 62%

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11625 2026-06-23 cs.LG cs.AI cs.CR 版本更新 62%

MedFedPure: A Medical Federated Framework with MAE-based Detection and Diffusion Purification for Inference-Time Attacks

MedFedPure: 基于MAE检测和扩散净化的医疗联邦框架用于推理时攻击防御

Mohammad Karami, Mohammad Reza Nemati, Aidin Kazemi, Ali Mikaeili Barzili, Hamid Azadegan, Behzad Moshiri

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) Max Planck Institute for Brain Research(马克斯·普朗克脑研究所在法兰克福) School of Computer Engineering,University of Science and Technology (IUST)(科学技术大学(IUST)计算机工程学院) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出MedFedPure框架,结合个性化联邦学习、掩码自编码器检测和自适应扩散净化,在推理时防御对抗攻击,在Br35H脑MRI数据集上强攻击下准确率从49.50%提升至87.33%,干净准确率保持97.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14968 2026-06-18 cs.LG cs.AI 版本更新 62%

InstructTime++: Time Series Classification with Multimodal Language Modeling via Implicit Feature Enhancement

InstructTime++: 通过隐式特征增强的多模态语言建模进行时间序列分类

Mingyue Cheng, Xiaoyu Tao, Huajian Zhang, Qi Liu, Zhiding Liu, Yucong Luo, Yiheng Chen, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出将时间序列分类转化为多模态生成任务,通过离散化模块和对齐投影层弥合模态差距,并利用隐式特征建模提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新 62%

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18031 2026-06-18 cs.CV cs.AI cs.LG 版本更新 62%

Simple Domain Generalization Methods are Strong Baselines for Open Domain Generalization

简单域泛化方法是开放域泛化的强基线

Masashi Noguchi, Shinichi Shirakawa

机构 * Graduate School of Environment and Information Sciences(环境与信息科学研究生院) Yokohama National University(Yokohama国立大学) Faculty of Environment(环境学系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文评估现有域泛化方法在开放域泛化中的表现,发现简单方法CORAL和MMD与复杂方法DAML竞争力相当,并通过集成学习和Dirichlet混合数据增强简单扩展后性能接近DAML且计算成本更低。

Comments Accepted at IJCNN 2024. The code used in the experiments is available at https://github.com/shiralab/OpenDG-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11320 2026-06-16 cs.LG cs.AI cs.DC math.OC stat.ML 版本更新 62%

Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints

优化大语言模型推理:带有内存约束的流引导在线调度

Ruicheng Ao, Gan Luo, David Simchi-Levi, Xinshang Wang

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出流引导在线调度方法,通过等待阈值算法和嵌套等待算法,在内存约束下优化大语言模型推理的延迟和容量,减少过载时的延迟。

Comments 79 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11682 2026-06-16 cs.AI cs.LG 版本更新 62%

MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition

MedAI: 评估 TxAgent 在 NeurIPS CURE-Bench 竞赛中的治疗性智能推理

Tim Cofala, Christian Kalfar, Jingge Xiao, Johanna Schrader, Michelle Tang, Wolfgang Nejdl

机构 * L3S Research Center(L3S研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍 TxAgent,一种通过迭代检索增强生成和统一生物医学工具集进行治疗决策的智能AI方法,并在CURE-Bench竞赛中评估其推理质量,通过改进工具检索策略提升性能,荣获开放科学卓越奖。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22888 2026-06-16 cs.AI cs.CL 版本更新 62%

JE-IRT: A Geometric Lens on LLM Abilities through Joint Embedding Item Response Theory

JE-IRT: 通过联合嵌入项目反应理论审视LLM能力的几何视角

Louie Hong Yao, Nicholas Jarvis, Tiffany Zhan, Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * Independent Researcher(独立研究者) University of Cincinnati(辛辛那提大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出JE-IRT几何框架,将LLM和问题嵌入共享空间,通过方向编码语义、范数编码难度,揭示主题专长和分布外行为,支持新模型高效扩展,并发现与人类分类部分对齐的内部结构。

Comments 35 pages, 17 figures, 9 tables, accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-06-15 cs.LG cs.AI 版本更新 62%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05551 2026-06-11 stat.ML cs.AI cs.LG 版本更新 62%

Conformal Risk-Averse Decision Making with Action Conditional Guarantee

具有行动条件保证的共形风险规避决策

Zihan Zhu, Shayan Kiyani, George Pappas, Hamed Hassani

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出行动条件共形预测方法,通过分位数损失最小化算法实现行动条件风险价值优化,在有限样本下提供行动条件安全保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28882 2026-06-11 cs.CL cs.AI cs.SD 版本更新 62%

GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human

GrowLoop: 由人类种子驱动的自进化对话评估

Yihang Lin, Yunze Gao, Zeyang Lin, Dongbo Li, Kun Peng, Yue Liu

机构 * Amap, Alibaba Group(阿里集团阿地图) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对开放域对话中类人性评估的隐性知识、标准分歧和动态演化三大挑战,提出GrowLoop自进化评估系统,通过最小人工种子标注和启发式学习迭代提取评估标准,并利用标准-案例协同进化机制持续适应模型进步和场景变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19225 2026-06-11 cs.CE cs.AI cs.CL cs.IR q-fin.CP 版本更新 62%

FinTradeBench: A Financial Reasoning Benchmark for LLMs

FinTradeBench: 面向LLM的金融推理基准

Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta

机构 * University of Central Florida(佛罗里达中央大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出FinTradeBench基准,通过结合公司基本面与交易信号,评估大语言模型在金融推理中的表现,发现检索增强对数值和时间序列推理帮助有限。

Comments 9 pages main text, 31 pages total (including references and appendix). 5 figures, 16 tables. Preprint under review. Code and data will be made available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28066 2026-06-10 cs.CL cs.AI 版本更新 62%

PromptEmbedder: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting

PromptEmbedder:通过双LLM软提示实现高效且可迁移的文本嵌入

Yu-Che Tsai, Kuan-Yu Chen, Yuan-Hao Chen, Yu-Han Chang, Ching-Yu Tsai, Yu-Hsiang Chuang, Shou-De Lin

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程系) National Taiwan University AI Center of Research Excellence(国立台湾大学人工智能研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出PromptEmbedder双LLM框架,通过可微分的软提示生成将嵌入知识从特定骨干权重中解耦,在保持性能的同时降低40% GPU内存并加速3.7倍训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24668 2026-06-10 cs.AI cs.LG 版本更新 62%

The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications

同意的代价:在代理金融应用中衡量LLM的谄媚行为

Zhenyu Zhao, Aparna Balagopalan, Adi Agrawal, Dilshoda Yergasheva, Waseem Alshikh, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究评估LLM在金融代理任务中的谄媚行为,发现模型对用户反驳仅表现低至中等性能下降,但偏好信息导致多数模型失败,并测试了输入过滤等恢复方法。

Comments Accepted to ICLR 2026 FinAI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02817 2026-06-10 cs.LG cs.AI cs.CV cs.IT math.IT 版本更新 62%

Conditional Vendi Score: Prompt-Aware Diversity Evaluation for Generative AI Models and LLMs

条件 Vendi 分数:生成式 AI 模型和 LLM 的提示感知多样性评估

Mohammad Jalali, Azim Ospanov, Amin Gohari, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Department of Information Engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对文本提示引导的生成模型,提出条件 Vendi 和条件 RKE 分数,通过条件熵分离模型自身多样性,并证明收敛性及在多个任务中恢复真实多样性排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01279 2026-06-09 econ.TH cs.AI cs.CE cs.CL cs.GT 版本更新 62%

Supracompetitive Pricing Under AI Monoculture

人工智能单一群体下的超竞争定价

Shengyu Cao, Ming Hu

机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在共享AI模型下,竞争卖家委托定价时可能产生的超竞争定价问题,通过双寡头模型分析发现,AI模型的鲁棒性和可重复性配置可能导致超竞争定价现象,且市场结果取决于初始定价倾向。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏