Arrow-Debreu Meets Kyle: Price Discovery Across Derivatives
阿罗-德布雷-凯尔模型:跨衍生品的价格发现
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究了在信息知情者拥有状态概率私有信息并交易状态依赖证券的模型中价格发现。该模型结合了阿罗-德布雷和凯尔的关键要素,当证券为期权时,知情者拥有标的资产收益分布的任意信息并交易期权组合。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
阿罗-德布雷-凯尔模型:跨衍生品的价格发现
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文研究了在信息知情者拥有状态概率私有信息并交易状态依赖证券的模型中价格发现。该模型结合了阿罗-德布雷和凯尔的关键要素,当证券为期权时,知情者拥有标的资产收益分布的任意信息并交易期权组合。
嵌入式与物联网系统开发中的技能型AI代理
机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 本文提出技能型AI代理框架与IoT-SkillsBench基准,通过实测验证,展示结构化专家知识在嵌入式编程中的高效性。
MedSPOT: 一种面向临床GUI的流程感知序列接地基准
机构 * Gaash Research Lab, National Institute of Technology Srinagar, India(加什研究实验室,印度锡里纳杰尔国家理工学院) ; e\& Group, UAE(e&集团,阿联酋) ; Mohammad Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿联酋) ; King Abdullah University of Science and Technology (KAUST), Saudi Arabia(国王 Abdullah 科学技术大学(KAUST),沙特阿拉伯)
专题命中 Agent评测 :workflow(title,abstract)
AI总结 MedSPOT针对临床GUI中需流程驱动的序列推理问题,通过216个任务驱动视频和597个标注关键帧,评估多模态模型在医疗软件中的可靠性与安全性。
Comments Project page: https://rozainmalik.github.io/MedSPOT_web/
你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack
专题命中 Agent评测 :agent(title);agentic(abstract)
AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。
WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?
机构 * Technical University of Munich(慕尼黑技术大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract)
AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。
Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI
评估可解释性代理中的陷阱
机构 * Kempner Institute at Harvard University(哈佛大学 Kempner 机构) ; Northeastern University(东北大学) ; Boston University(波士顿大学) ; MIT(麻省理工学院)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文研究了自动化电路分析中可解释性代理的评估挑战,提出基于模型组件功能互换性的无监督内在评估方法,揭示了复制评估的局限性。
结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。
Comments 13 pages
Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026
FinReflectKG -- EvalBench:基于多维评估的金融知识图谱基准测试
机构 * New York, US(美国纽约) ; Gurugram, India(印度古尔冈)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出FinReflectKG-EvalBench,通过多维评估框架对金融知识图谱提取进行基准测试,证明基于反思的提取方法在全面性、精度和相关性上表现最佳,同时验证LLM作为评判者在成本效率和结构化错误分析中的可靠性。
电力市场力量与去中心化电力交易平台设计
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文研究平台设计如何影响去中心化电力交易中的战略行为,通过动态博弈模型分析了prosumers在平台中的行为机制,发现平台设计对市场力量和存储利用有显著影响。
面向燃烧科学的全栈领域增强:构建与优化
机构 * Peking University(北京大学) ; AI for Science Institute, Beijing(AI for Science研究院,北京)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。
超智能体
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; University of Edinburgh(爱丁堡大学) ; New York University(纽约大学) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) ; FAIR at Meta(Meta 的 FAIR 部门) ; Meta Superintelligence Labs(Meta 超智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出超智能体,通过整合任务智能体和元智能体,实现自我改进。DGM-H在多个领域表现出色,持续改进搜索方法。
Comments Code at https://github.com/facebookresearch/Hyperagents
自适应Polyak步长与级别-值调整的分布式优化
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出DPS-LA算法,通过每个节点解决高效的线性可行性问题,避免依赖全局最优值,实现线性加速收敛。
Comments 12 pages, 5 figures
多期纯交换经济中的动态帕累托最优
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了多期纯交换经济中动态帕累托最优分配过程的构造方法,基于时间一致动态风险度量,提出递归构建方法并推导了共变量改进定理。
Comments 42 pages, 5 figures
在损失厌恶的乘法习惯形成偏好下最优消费
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了损失厌恶的乘法习惯形成偏好及其对应的无限时间 horizon 内最优投资与消费策略。通过考虑S型效用函数的凹包络及其关联的对偶价值函数,分析了凹化问题的HJB方程,并通过相关非线性自由边界问题获得反馈形式的最优消费与投资策略。
Comments 43 pages, 10 figures