AI Talent 工作地图

AI Talent 都在做什么?

一个 AI 产品背后,有哪些队伍?

按交付物看五类队伍,浏览 OpenAI / Anthropic / DeepSeek 岗位样本 ↗

这些队伍,每天具体在做什么?

DataPreMidPostAgent产品结果每一步都要检查:做对了吗?比上一版差了吗?安全吗?
01

准备数据与 Env

收集真实数据,生成 synthetic data,再验证成可学习、可练习的材料。

真实网页代码与生成的 synthetic data 经过筛选和验证,形成训练 corpus 与任务 Env 网页 代码 Synthetic模型生成 corpus 任务 Env 筛选 · 去重 · 验证

卡在哪里

数据很多,有效信号很少;任务还要可验证。

谁来解决

补充:什么不能混在一起?

训练 corpus 用于更新参数;Context 用于当前调用;held-out Evals 用于独立验收。用途、授权和数据血缘必须清楚。

Env 与 grader 不只服务训练,也用于检查真实任务是否完成。课程来源 · 岗位证据

02

训练 Base model

用 Pre-training 从大量数据中学出通用的语言、代码等基础能力。

corpus 与 GPU 算力共同进入 Pre-training,产生 Base model corpus GPU 训练配方 + 优化 Base model

卡在哪里

预算有限,训练昂贵;规模越大越难稳定。

谁来解决

补充:Base model 和 Foundation Model 的区别

Base model 是这里更精确的产物名:尚未完成面向助手行为的 Post-training。它可以是 Pre-training 后的 checkpoint,也可以已经包含 Mid-training / long-context extension 的成果。

Foundation Model 是更宽泛的模型类别:在广泛数据上训练、可适配多种下游任务,不是特定训练阶段的名称。Stanford CRFM 定义

架构、数据配比、计算预算、精度、并行和稳定性要一起考虑;小实验收益未必能直接外推到大规模。课程来源

03按需采用

Mid-training:扩展能力

在已有 checkpoint 上继续训练,补强领域、代码或长 Context 等能力。

已有 checkpoint 加入针对性数据和训练设置,通过 Mid-training 得到能力扩展的 Base model checkpoint 针对性数据领域 / 代码 继续训练配比 / Context 长度 Base model 按目标扩展,并检查原有能力

卡在哪里

新能力要补上,旧能力不能丢;数据配比难取舍。

谁来解决

补充:不是所有模型都有独立的 Mid-training

这是按需采用的 continued-training 阶段,与 Pre-training / Post-training 的边界并不统一;long-context extension 也可以单列。没有单独安排时,可以从 Pre-training 直接进入 Post-training。

Ai2 的公开 Olmo 3 model flow 明列 Pretraining → Midtraining → Long context → Olmo 3 Base → Post-training 分支;因此最终发布的 Base model 也可能已经过能力扩展。Ai2 一手流程

JD 展示协作职责:Training / Scaling 岗支持能力实验和规模化训练;Health 跨阶段研究岗正文明确含 midtraining 和能力评测。不把这些职位虚构成专职 Mid-training 岗。证据与定义

04

Post-training 与合版

各团队优化专项能力,再把这些进步整合进同一个可发布模型。

代码、推理、交互和安全四项能力汇合,经整合及验证进入一个候选模型 代码 / Tools 数学 / 推理 指令 / 交互 安全 合版整合 + 回归检查 候选模型

卡在哪里

局部变强,整体可能退步;RL big run 难稳定。

谁来解决

补充:合版职责、RFT、OPD 与 merging

合版负责人连接 Model & Learning、AI Systems 与 Evals & Safety,对整体取舍负责;不是与五类工作流平行的第六种岗位类别。

用户确认 RFT 指 Rejection Sampling Fine-Tuning:生成候选、筛选后监督微调。distillation、merging 或联合 RL 是条件性路线,不是固定顺序。

用户提到的 OPD 全称尚未核实;若指 on-policy distillation,具体用法仍需确认。MTP 相关 distillation 取决于模型架构,不是普遍必经步骤。

大规模 RL 前,要准备好数据、reward、Env、Evals 与训练系统。公开 JD 证明跨团队整合和最终 RL 运行职责,但不证明特定合版算法。岗位证据 · 一线经验边界

05

让 Agent 执行任务

用 Context、Tools 和 runtime,把模型的判断接到真实行动。

Context 进入模型判断,runtime 执行工具,Env 的结果回到下一轮判断 Context 模型判断 Tools / Envruntime 受控执行 观察结果 看代码 → 改代码 → 跑测试 → 再判断

卡在哪里

多步会偏航,Tools 会失败,权限不能失控。

谁来解决

补充:模型、runtime 与 MCP 的边界

模型生成调用;runtime 解析、授权并执行,再将结果补入 Context。企业知识可以通过检索进入 Context,不必训练进参数。

MCP 标准化 Tools / 数据的连接,不代替 runtime、权限、隔离或 Evals。Hugging Face 官方课程

06

交付 Codex 类产品

把任务循环放进用户的工作流,让它每天都能稳定地服务。

Model Serving 与 Agent runtime 汇入产品,再交付给用户 Model Serving Agent runtime IDE / CLI 用户

卡在哪里

效果、延迟、成本、可靠性,必须同时过关。

谁来解决

补充:企业可以从哪里接入?

使用开放权重:模型选型 → 必要适配 → 自建 Serving。使用 API:直接从 Context、Tools 和 runtime 接入。

不需要每家公司都做 Pre-training,但业务目标、数据治理、Evals 和最终结果责任仍要自己承担。这里是概念分工,不是 OpenAI 内部架构。

07

真实结果与反馈

确认工作是否完成,并把可信的成功、失败和用户反馈带回下一轮。

修改提交经过测试与人工审查,形成验收结果和后续反馈 修改 / PR 验收 需求 / 测试风险 / 审查成本 / 时间 反馈

卡在哪里

测试通过 ≠ 需求完成;Evals 也可能偏或漏。

谁来解决

补充:失败不一定要重训

能力不足 → 改数据 / 模型;信息或执行错误 → 改 Context / Tools / runtime;太慢或不稳定 → 改 Serving / Infra。每次改动都要重新验证。

公开 JD 说明 checkpoint Evals、回归发现及数据闭环职责,不代表人才数量或招聘缺口统计。岗位证据

每一步都要验证数据质量训练回归Agent 行为产品价值

模型初步训练好后,这些人还在忙什么?

  1. 真实任务

    在 Env 中做事

  2. log / 反馈

    成功、失败、用户纠正

  3. Expert 验证

    授权、筛选、验证

  4. 数据资产

    corpus / Env / 独立 Evals

  5. 改进与发布

    模型或 runtime 更新

Data Flywheel ↺ 新版本进入真实任务,再产生新反馈
飞轮的边界:不等于自动学习

更多 log 不保证更好的数据。只有经过授权、隐私处理与质量验证的样本才能进入学习流程;必要时构造的合成样本也要验证。

反馈可以改进模型,也可以只改 Context、Tools 或 runtime。每次使用不一定更新参数;错误 reward、偏置与数据污染可能放大问题。

以上是基于课程和岗位职责的综合解释,不是某家公司的自动训练实现。证据

造更好的练习材料 · Synthetic data generation
真实能力缺口引导模型生成候选,验证筛选后成为练习材料 能力缺口 模型生成 验证筛选 练习材料 任务、答案、代码与 trajectory 都可以是候选

工作不是批量生成文本,而是找到值得教给模型的信号。

Data & Environment 做数据管线;Model & Learning 设计生成策略;Evals & Safety 检查可信度;AI Systems 支撑规模化运行。

Self-Instruct 实例与边界 ↗

把能力教给更适合部署的模型 · Distillation
内部或授权外部Teacher提供信号,训练Student,再独立评估是否适合部署 内部 Teacher 外部 Teacher Student学习教师信号 质量 / 成本独立验收

常见目标是让小模型以更低成本完成任务,不是简单裁小一个大模型。

Model & Learning 迁移能力;Data & Environment 管教师数据;AI Systems 验证部署收益,Evals & Safety 检查损失与风险。

外部教师须获准使用。Distillation 不必大到小,也不保证保留全部能力。DeepSeek-R1 实例 ↗

让模型参与下一轮改进 · Model-assisted improvement
模型提出改进候选,Env执行验证,人和系统选择有效方案,再进入下一轮 模型提出改进候选 Env 执行验证与选择 采用有效改进 下一轮;不通过则修订或停止

模型可以帮忙提方案,但“它说自己更好了”不算证据。

研究团队提出与筛选候选;Evals & Safety 提供可信判断;AI Systems 与 Agent & Productization 让实验可运行、可追踪。

更新候选库或工具不等于重训模型;不据此宣称持续、自主的 Recursive Self-Improvement。AlphaEvolve 实例 ↗

为什么 AI Talent 难得?

真实规模

算力、数据、Env 与真实流量,才会暴露小实验看不到的问题

跨层判断

专业深度加相邻领域理解,才能判断该改模型、数据、Evals 还是系统

完整闭环

实验 → 合版 → 回归 → 上线。经验来自协作、失败与取舍,不是只做过 demo。

路线仍在探索

各 Labs 都在尝试。珍贵的是知道何时有效、为何失败,而不只是参与过一次成功。

局部成功经验的价值:说清适用条件,复现改进,再判断下一步怎么试。

这些是经验形成的门槛,不是人才缺口统计。不是人人都要大算力,也不是一次成功就能复制到所有团队。

这些队伍接下来还在攻克什么?

短任务 → 长时工作

不跑偏,记得住,失败后能恢复。

成功一次 → 稳定成功

换任务、换项目、合版后仍然有效。

能够执行 → 放心授权

面对不可信输入,守住权限边界。

技术可行 → 经济可行

衡量每件成功任务的成本,而非每个 token。

来源、技术备注与设计参考

课程框架

相关 Reader 材料含 34 个视频、3,725 个段落,本次主要查阅章节概要与部分段落,不声称逐段精读。研究笔记

岗位库分类与真实 JD

人才类别直接沿用 2026-09-11 岗位库 的五个 Workstream:Data & Environment、Model & Learning、Evals & Safety、Agent & Productization、AI Systems。页面中的类别名称可进入你整理的岗位列表。

样本主要来自 OpenAI、Anthropic、DeepSeek,不代表整个 AI 人才市场。企业应用与行业解决方案的岗位覆盖有限,本文只说明可迁移的职责分工。

每条链接保留存档中的主分类,不按标题关键词重新归类。一个岗位可有跨阶段、跨职责工作;工作流是本项目的整理口径,不是企业官方组织图。示例可能聚焦某个领域或安全场景,不代表其覆盖整个工作流。

例如 Synthetic RL 归 Model & Learning;RL Training Infra 归 AI Systems;Model Evaluations 的存档主分类是 Data & Environment,本页用于说明评测管线交付。页面不保证职位当前仍开放,也不从职位数推断招聘人数。

Mid-training 与 Base model

流程来源于公开实例;Mid-training 的命名与边界不统一,也不要求每个项目独立设置这一站。

合版:用户的一线经验

专项团队分别优化能力,再整合;RL big run 需要充分准备。RFT 按用户确认指 Rejection Sampling Fine-Tuning。

OPD 全称未确认,merging、MTP distillation 为条件性例子。合版是工作职责,不假定存在统一岗位名。

模型参与持续改进

工作流分工为本报告归纳;这些实例不证明无条件的能力增长。

设计参考

参考 Bubble 的分阶段叙事、暖色底与大幅功能示意;结合 Hallmark 的信息取舍原则。插图为本报告原创 SVG,没有复制面包素材,也未安装第三方 skill。

概念边界

这是讲解图,不是 OpenAI 内部架构或训练手册。阶段相互迭代,Evals 与安全贯穿全程;Expert 默认指领域专业人员,不是 MoE expert。

项目词表 · Data Flywheel。文件使用本地字体,无外部脚本、字体下载或追踪请求。