arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-11 至 2026-03-11 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2603.08987 2026-03-11 cs.LG 74%

MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment

MAPLE:从统计共识到过程导向对齐的医学推理提升

Kailong Fan, Anqi Pu, Yichen Wu, Wanhua Li, Yicong Li, Hanspeter Pfister, Huafeng Liu, Xiang Li, Quanzheng Li, Ning Guo

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Harvard Medical School(哈佛医学院)

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 MAPLE通过整合医学过程奖励模型与TTRL,提升医学推理的准确性和可靠性,实现从统计共识到过程导向对齐的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09312 2026-03-11 cs.CV 67%

IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

IntroSVG: 通过反思生成器-批评者框架从渲染反馈中学习以实现文本到SVG生成

Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao

机构 * Fudan University(复旦大学) TeleAI Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 IntroSVG通过反思生成器-批评者框架,结合监督微调和直接偏好优化,实现文本到SVG生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08853 2026-03-11 econ.GN q-fin.EC 50%

LLM-Agent Interactions on Markets with Information Asymmetries

在信息不对称市场中的人工智能代理互动

Alexander Erlei, Lukas Meub

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏