准备数据与 Env
收集真实数据,生成 synthetic data,再验证成可学习、可练习的材料。
卡在哪里
数据很多,有效信号很少;任务还要可验证。
谁来解决
- 数据管线Data & Environment
- 合成策略Model & Learning
- rollout 平台AI Systems
- 可信验证Evals & Safety
收集真实数据,生成 synthetic data,再验证成可学习、可练习的材料。
数据很多,有效信号很少;任务还要可验证。
用 Pre-training 从大量数据中学出通用的语言、代码等基础能力。
预算有限,训练昂贵;规模越大越难稳定。
Base model 是这里更精确的产物名:尚未完成面向助手行为的 Post-training。它可以是 Pre-training 后的 checkpoint,也可以已经包含 Mid-training / long-context extension 的成果。
Foundation Model 是更宽泛的模型类别:在广泛数据上训练、可适配多种下游任务,不是特定训练阶段的名称。Stanford CRFM 定义
架构、数据配比、计算预算、精度、并行和稳定性要一起考虑;小实验收益未必能直接外推到大规模。课程来源
在已有 checkpoint 上继续训练,补强领域、代码或长 Context 等能力。
新能力要补上,旧能力不能丢;数据配比难取舍。
这是按需采用的 continued-training 阶段,与 Pre-training / Post-training 的边界并不统一;long-context extension 也可以单列。没有单独安排时,可以从 Pre-training 直接进入 Post-training。
Ai2 的公开 Olmo 3 model flow 明列 Pretraining → Midtraining → Long context → Olmo 3 Base → Post-training 分支;因此最终发布的 Base model 也可能已经过能力扩展。Ai2 一手流程
JD 展示协作职责:Training / Scaling 岗支持能力实验和规模化训练;Health 跨阶段研究岗正文明确含 midtraining 和能力评测。不把这些职位虚构成专职 Mid-training 岗。证据与定义
各团队优化专项能力,再把这些进步整合进同一个可发布模型。
局部变强,整体可能退步;RL big run 难稳定。
合版负责人连接 Model & Learning、AI Systems 与 Evals & Safety,对整体取舍负责;不是与五类工作流平行的第六种岗位类别。
用户确认 RFT 指 Rejection Sampling Fine-Tuning:生成候选、筛选后监督微调。distillation、merging 或联合 RL 是条件性路线,不是固定顺序。
用户提到的 OPD 全称尚未核实;若指 on-policy distillation,具体用法仍需确认。MTP 相关 distillation 取决于模型架构,不是普遍必经步骤。
大规模 RL 前,要准备好数据、reward、Env、Evals 与训练系统。公开 JD 证明跨团队整合和最终 RL 运行职责,但不证明特定合版算法。岗位证据 · 一线经验边界
用 Context、Tools 和 runtime,把模型的判断接到真实行动。
多步会偏航,Tools 会失败,权限不能失控。
模型生成调用;runtime 解析、授权并执行,再将结果补入 Context。企业知识可以通过检索进入 Context,不必训练进参数。
MCP 标准化 Tools / 数据的连接,不代替 runtime、权限、隔离或 Evals。Hugging Face 官方课程
把任务循环放进用户的工作流,让它每天都能稳定地服务。
效果、延迟、成本、可靠性,必须同时过关。
使用开放权重:模型选型 → 必要适配 → 自建 Serving。使用 API:直接从 Context、Tools 和 runtime 接入。
不需要每家公司都做 Pre-training,但业务目标、数据治理、Evals 和最终结果责任仍要自己承担。这里是概念分工,不是 OpenAI 内部架构。
确认工作是否完成,并把可信的成功、失败和用户反馈带回下一轮。
测试通过 ≠ 需求完成;Evals 也可能偏或漏。
能力不足 → 改数据 / 模型;信息或执行错误 → 改 Context / Tools / runtime;太慢或不稳定 → 改 Serving / Infra。每次改动都要重新验证。
公开 JD 说明 checkpoint Evals、回归发现及数据闭环职责,不代表人才数量或招聘缺口统计。岗位证据
在 Env 中做事
成功、失败、用户纠正
授权、筛选、验证
corpus / Env / 独立 Evals
模型或 runtime 更新
更多 log 不保证更好的数据。只有经过授权、隐私处理与质量验证的样本才能进入学习流程;必要时构造的合成样本也要验证。
反馈可以改进模型,也可以只改 Context、Tools 或 runtime。每次使用不一定更新参数;错误 reward、偏置与数据污染可能放大问题。
以上是基于课程和岗位职责的综合解释,不是某家公司的自动训练实现。证据
工作不是批量生成文本,而是找到值得教给模型的信号。
Data & Environment 做数据管线;Model & Learning 设计生成策略;Evals & Safety 检查可信度;AI Systems 支撑规模化运行。
常见目标是让小模型以更低成本完成任务,不是简单裁小一个大模型。
Model & Learning 迁移能力;Data & Environment 管教师数据;AI Systems 验证部署收益,Evals & Safety 检查损失与风险。
外部教师须获准使用。Distillation 不必大到小,也不保证保留全部能力。DeepSeek-R1 实例 ↗
模型可以帮忙提方案,但“它说自己更好了”不算证据。
研究团队提出与筛选候选;Evals & Safety 提供可信判断;AI Systems 与 Agent & Productization 让实验可运行、可追踪。
更新候选库或工具不等于重训模型;不据此宣称持续、自主的 Recursive Self-Improvement。AlphaEvolve 实例 ↗
局部成功经验的价值:说清适用条件,复现改进,再判断下一步怎么试。
这些是经验形成的门槛,不是人才缺口统计。不是人人都要大算力,也不是一次成功就能复制到所有团队。
不跑偏,记得住,失败后能恢复。
换任务、换项目、合版后仍然有效。
面对不可信输入,守住权限边界。
衡量每件成功任务的成本,而非每个 token。
相关 Reader 材料含 34 个视频、3,725 个段落,本次主要查阅章节概要与部分段落,不声称逐段精读。研究笔记
人才类别直接沿用 2026-09-11 岗位库 的五个 Workstream:Data & Environment、Model & Learning、Evals & Safety、Agent & Productization、AI Systems。页面中的类别名称可进入你整理的岗位列表。
样本主要来自 OpenAI、Anthropic、DeepSeek,不代表整个 AI 人才市场。企业应用与行业解决方案的岗位覆盖有限,本文只说明可迁移的职责分工。
每条链接保留存档中的主分类,不按标题关键词重新归类。一个岗位可有跨阶段、跨职责工作;工作流是本项目的整理口径,不是企业官方组织图。示例可能聚焦某个领域或安全场景,不代表其覆盖整个工作流。
例如 Synthetic RL 归 Model & Learning;RL Training Infra 归 AI Systems;Model Evaluations 的存档主分类是 Data & Environment,本页用于说明评测管线交付。页面不保证职位当前仍开放,也不从职位数推断招聘人数。
流程来源于公开实例;Mid-training 的命名与边界不统一,也不要求每个项目独立设置这一站。
书面课程与 Reader 中仅一段 HF 介绍视频分开使用。
专项团队分别优化能力,再整合;RL big run 需要充分准备。RFT 按用户确认指 Rejection Sampling Fine-Tuning。
OPD 全称未确认,merging、MTP distillation 为条件性例子。合版是工作职责,不假定存在统一岗位名。
工作流分工为本报告归纳;这些实例不证明无条件的能力增长。
参考 Bubble 的分阶段叙事、暖色底与大幅功能示意;结合 Hallmark 的信息取舍原则。插图为本报告原创 SVG,没有复制面包素材,也未安装第三方 skill。
这是讲解图,不是 OpenAI 内部架构或训练手册。阶段相互迭代,Evals 与安全贯穿全程;Expert 默认指领域专业人员,不是 MoE expert。
项目词表 · Data Flywheel。文件使用本地字体,无外部脚本、字体下载或追踪请求。