Quantifying the Risk-Return Tradeoff in Forecasting
对预测中的风险与收益权衡进行量化
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文通过金融风险调整指标评估预测可靠性,引入Edge Ratio衡量模型独特预测价值,分析宏观经济预测中不同方法的风险收益表现。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
对预测中的风险与收益权衡进行量化
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文通过金融风险调整指标评估预测可靠性,引入Edge Ratio衡量模型独特预测价值,分析宏观经济预测中不同方法的风险收益表现。
DRNet:通过先验引导的动态重参数化实现一站式图像修复
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(信息与通信工程学院,电子科学与技术大学) ; School of Communications and Information Engineering, Chongqing University of Posts and Telecommunication(通信与信息工程学院,重庆邮电大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 DRNet通过先验引导的动态重参数化方法,解决图像修复中计算开销大、任务异质性难优化和编码器效率低的问题,实现多任务高效修复。
Comments Accepted by IEEE TMM
通过噪声不变的声学-语义蒸馏减少基于语言模型的语音增强中的语言幻觉
专题命中 效率与部署 :language model(abstract)
AI总结 本文提出L3-SE框架,通过联合蒸馏声学和语义目标,减少语言模型语音增强中的语言幻觉,提升在低信噪比和回声条件下的语言一致性。
EMFormer:高效的多尺度Transformer用于累积上下文天气预测
机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学计算机科学与工程系) ; Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)
专题命中 效率与部署 :pretraining(abstract)
AI总结 本文提出EMFormer,通过单次卷积提取多尺度特征,结合累积上下文微调和复合损失函数,提升天气预测精度并减少计算开销。
Comments This paper has been accepted by ICML2026
AgentReview: 探索基于LLM代理的同行评审动态
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; William & Mary(威廉与玛丽学院)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出AgentReview框架,通过LLM模拟同行评审过程,揭示评审者偏见导致论文决策37.1%的变异,结合社会学理论提升评审机制设计。
Comments Accepted at EMNLP 2024 Main Track (Oral). https://agentreview.github.io/
Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下
机构 * Rutgers University(罗格斯大学) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。
Comments ACL 2026 Findings
Journal ref ACL 2026 Findings
基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究
机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) ; Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。
基于领域适应语言模型的威胁建模:实证评估与洞察
机构 * Department of Systems(系统部) ; School of Information Technology(信息技术学院)
专题命中 领域大模型 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);small language model(abstract)
AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
专题命中 领域大模型 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures
大语言模型中的解释公平性:对LLMs在不同人口群体中解释决策差异的实证分析
机构 * Independent Researcher(独立研究者)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
AI总结 本文提出解释公平性分类法,分析大语言模型在不同群体中解释决策的差异,发现模型选择与差异幅度密切相关,提出两种提示方法减少解释差异。
Comments 10 pages, 4 figures, 9 tables
MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距
机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。
Comments 29 pages, 14 figures
CLEAR: 揭示噪声和歧义如何降低LLM在医学中的可靠性
机构 * Department of Biomedical Informatics, Vanderbilt University Medical Center(生物医学信息学系,范德比尔特大学医学中心) ; Vanderbilt University(范德比尔特大学) ; Intuit AI Research(Intuit AI研究) ; Department of Electrical and Computer Engineering, Vanderbilt University(电气与计算机工程系,范德比尔特大学) ; Department of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学) ; Department of Biostatistics, Vanderbilt University Medical Center(生物统计学系,范德比尔特大学医学中心)
专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CLEAR框架评估了决策空间呈现、歧义性和不确定性对医学基准LLM推理的影响,揭示了现有评估方法的三大局限:增加合理答案数量会降低模型识别正确答案和避免错误答案的能力,歧义性增加导致模型更不谨慎,且模型规模越大,谦逊缺陷越严重。
DiagnosticIQ: 一个用于基于符号规则的LLM工业维护行动推荐的基准
机构 * IBM ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; Independent Contributor(独立贡献者)
专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出DiagnosticIQ基准,通过6690个专家验证的多选题评估LLM在将符号规则转化为维护步骤中的表现,发现LLM在规则到行动的转换中需要专业知识,且存在对扰动和条件反转的敏感性。
Comments 43 pages, 25 figures
对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体
机构 * Pace University(帕克大学)
专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。
Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026
TSNBench:评估大语言模型在时间敏感网络中能力的基准测试
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出TSNBench,首个评估大语言模型在时间敏感网络中的能力的基准测试,包含939道专家验证的多项选择题和100道开放性问题,揭示LLM在安全关键网络领域的能力不足。
你已被LaTeXpOsEd:利用大语言模型对预印本档案中的信息泄露进行系统分析
机构 * Eötvös Loránd University(埃奥瓦大学) ; University of Oslo(奥斯陆大学) ; Sztaki ; Technology Innovation Institute(技术创新研究所)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文通过分析10万份arXiv提交的1.2TB源数据,揭示了预印本档案中存在大量敏感信息泄露问题,提出LaTeXpOsEd框架结合模式匹配、逻辑过滤和大语言模型检测隐藏披露,揭露了PII泄露、GPS标记文件等风险。
LegalCiteBench: 评估法律语言模型中的引文可靠性
机构 * Northeastern University(东北大学) ; Phala
专题命中 领域大模型 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)
AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。
Comments Preprint. 23 pages including references and appendices
基于大语言模型的强化学习用于交互推荐中的长期用户满意度
机构 * University of Technology Sydney, Sydney, Australia(新南威尔士大学悉尼分校) ; University of Shanghai for Science and Technology(上海科学技术大学)
专题命中 领域大模型 :LLM(title,summary_cn);分类 cs.AI
AI总结 本文提出LLM-Enhanced Reinforcement Learning框架,通过结合大语言模型的语义规划能力与强化学习的细粒度适应性,解决推荐系统中内容同质化和过滤气泡问题,提升长期用户满意度。
Journal ref In: Jung, H., Wang, T., Toyoda, M., Kwon, HY., Lee, Jw. (eds) Database Systems for Advanced Applications. DASFAA 2026. Lecture Notes in Computer Science, vol 16535. Springer, Singapore
RFAmpDesigner: 一种自演化多智能体大语言模型框架用于自动射频放大器设计
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出RFAmpDesigner,通过多智能体框架自动化射频放大器设计,利用资源分配中间件将高维参数调优转化为低维资源分配问题,结合检索增强生成技术,解决射频放大器设计中的数据效率低问题。
Comments 14 pages, 11 figures, 4 tables
多模态大语言模型在大规模推荐系统中的通用框架
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一个通用框架,利用多模态大语言模型提升多媒体内容理解,通过三部分架构实现内容解析、特征提取和系统集成,实验证明在推荐系统中提升了AUC和在线指标。
Comments Accepted by SIGIR 2026 short
LLMs能否解决科学问题或只是编写代码?评估量子求解器生成
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出Q-SAGE方法,通过迭代优化评估LLM生成量子求解器的能力,发现迭代改进提升成功率但带来计算开销,模型能力增强后失败模式从执行错误转为数值不准确,揭示LLM在量子软件中的局限。
GONE: 通过邻域扩展分布塑造实现结构知识卸载
机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) ; Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出GONE基准,用于评估LLM在结构知识图谱中的知识卸载能力,引入NEDS框架通过图连接性识别相关邻居,实现精确的遗忘边界划分,展示出在知识编辑和卸载任务中的优越性能。
基于标签的示例选择在少样本学习中生成医疗事件因果因素和预防措施
机构 * Graduate School of Information Science(信息科学研究生院) ; Technology Hokkaido University Hokkaido, Japan(技术 Hokkaido 大学 Hokkaido, Japan) ; National Institute of Information(信息国家研究所) ; Faculty of Information Science(信息科学学院)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出基于标签的少样本学习方法,利用日本医疗事件数据集,通过对比随机采样、相似度选择和标签方法,验证标签选择能提高生成精度和稳定性。
CLEF:用于学习临床语义的EEG基础模型
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) ; Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)
专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。
在操作设计域内运行:基于视觉-语言模型的零样本感知
机构 * Volkswagen Aktiengesellschaft(大众汽车股份有限公司) ; L3S Research Center(莱比锡大学汉诺威研究中心) ; Faculty of Information Technology(信息科技学院) ; MOIA GmbH(MOIA公司) ; Motor AI GmbH(Motor AI公司)
专题命中 领域大模型 :language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本文探讨了视觉-语言模型在无监督条件下对操作设计域的零样本感知能力,通过实验验证了基于链式推理的提示方法在OBD感知中的有效性,并提出了可重用的提示模板。
Comments 8 pages, 4 figures
MIND-Skill: 通过多智能体归纳与演绎保证技能质量
机构 * Nanyang Technological University(南洋理工大学) ; Waseda University(早稻田大学) ; Zhejiang University(浙江大学) ; Southeast University(东南大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出MIND-Skill框架,通过归纳与演绎自动生成可复用的技能,结合三种损失函数保证质量,实验显示其在AppWorld和BFCL-v3上优于现有方法。
GPO-V:通过全局概率优化实现扩散视觉语言模型的突破
机构 * ShanghaiTech University(上海科技大学) ; University of Warwick(沃里克大学) ; SUN YAT-SEN UNIVERSITY(中山大学)
专题命中 领域大模型 :language model(title,abstract);large language model(abstract)
AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。
PathISE: 通过信息路径监督学习知识图谱问答
机构 * The University of Melbourne(墨尔本大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。
通过干扰-校正平滑实现保证的对抗防御
机构 * Xidian University(西安电子科技大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种基于平滑的新型防御方法,通过干扰-校正机制提升大语言模型对劫持攻击的防御能力,理论分析提供了防御成功的紧界和干扰强度要求,实验表明其在安全性和有用性上优于现有方法。
NyayaAI:基于多智能体架构和检索增强生成的AI法律助理
机构 * School of Computer Science UPES, Dehradun, India(计算机科学学院 UPES 德里胡迪恩印度)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出NyayaAI,通过多智能体架构和检索增强生成技术,提升法律信息获取效率,实现法律流程自动化与简化,实验显示其在法律分类、检索和响应准确性上达到70%-74%的精度。
Comments 3 pages, 1 figure