arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-07-21 至 2026-07-21 共收录 4
2607.16229 2026-07-21 stat.AP cs.LG q-fin.CP q-fin.PM 新提交

FinBench: Time-Gated Calibration and Uncertainty Benchmarking for Agentic Financial Forecasting

FinBench:用于智能金融预测的时间门控校准与不确定性基准测试

Rishab Ghosh, Vinay Devarakonda

机构 * UT Austin(得克萨斯大学)

AI总结 介绍用于金融预测的FinBench基准,它通过时间门控避免前瞻偏差,用适当评分规则评估。任务要求模型输出正回报概率和预测区间,用多种分数评估,通过小型试点运行展示校准敏感指标能区分不同预测行为。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11933 2026-07-21 cs.LG

Fairness-Aware Multi-Group Target Detection in Online Discussion

具有公平性的多群体目标检测在线讨论中

Soumyajit Gupta, Maria De-Arteaga, Matthew Lease

机构 * Dept. of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Data, Analytics, Technology, and Artificial Intelligence, ESADE(ESADE大学数据、分析、技术和人工智能系) The Information School, The University of Texas at Austin(德克萨斯大学奥斯汀分校信息学院)

AI总结 本文研究了在线讨论中目标群体检测的公平性影响,提出了一种公平性意识的多群体目标检测方法,减少了群体间的偏见并提升了预测性能。

Journal ref 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT)

详情

展开后加载摘要…

URL PDF HTML 收藏