
“
巨头花几十亿美元买的不是一群人,是一套让交付可复制的机制。能力清单解决“人会不会”,交付系统解决“公司赚不赚”。
本文看点
01
复用率决定生死的账本
02
六个可抄的合同条款包
03
十二个指标的红线阈值
MARKET
三笔大钱的另一种读法
2026 年上半年,海外三家巨头几乎同时下注同一件事。
OpenAI 在 5 月官宣成立 OpenAI Deployment Company,初始投资超 40 亿美元,TPG 领投、十九家投资与集成机构参投,并收购 Tomoro 直接带入约 150 名前线部署工程师。Anthropic 联手黑石、Hellman & Friedman、高盛等,以约 15 亿美元承诺资本组建企业 AI 实施公司,7 月以 Ode 品牌正式发布,底盘是被收购的 Fractional AI 及其约百人工程团队。AWS 在 6 月底宣布投入 10 亿美元建设 Forward Deployed Engineering 组织,目标数千人规模,作战方式写得很具体:五到六人小队,四十五天周期,嵌入客户现场。
40 亿
美元 · OpenAI 部署公司
15 亿
美元 · Anthropic 系 Ode
10 亿
美元 · AWS FDE 组织
国内的市场热度同样不缺。按智能超参数《中国大模型中标项目监测与洞察报告(2025)》口径,2025 年全年国内大模型相关中标项目 7539 个,披露金额 295.2 亿元,同比增长约 356%;千万级大单 314 个,亿元级 44 个;科大讯飞以 210 个项目、23.16 亿元继续领跑,央国企占据约六成份额。政策端的推力也在加码:国务院《关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号)设定了 2027 年智能体普及率超七成的目标,2026 年 4 月的国发〔2026〕7 号文首次点名“支持采购大模型、智能体服务”,工信部等八部门的“人工智能+制造”专项则提出到 2027 年推出千个工业智能体、五百个场景。
看起来遍地是钱。但另一组数字必须并列摆出来。
MIT Project NANDA 在 2025 年 7 月发布的《The GenAI Divide: State of AI in Business 2025》里给出一个刺眼结论:约 95% 的企业生成式 AI 试点没有对损益表产生可测量影响,真正产生数百万美元价值的只有 5%——而报告把主因归为方法与学习差距,不是模型不够强。Gartner 2024 年预测“2025 年底前至少 30% 的生成式 AI 项目会在概念验证后被放弃”,2026 年初它自己承认实际比例超过 50%,并预测到 2027 年底超过 40% 的智能体项目会被取消。BCG 2025 年 10 月覆盖 1250 家企业的调研《The Widening AI Value Gap》更直白:仅 5% 实现规模化,60% 几乎没有回报,而落后者与领先者的差别中,七成投入其实发生在技术层之外。
7539
个 · 2025 国内大模型中标项目
295.2
亿元 · 披露金额,同比 +356%
95%
试点 · 对损益无可测量影响
把这两组数字并排看,结论就浮出来了:需求爆炸和交付失败是同一枚硬币的两面。行业里流传的那份“FDE 十二项能力清单”回答的是“人会不会”,它有价值,但只是半张答卷。95% 的失败不是因为工程师个人能力不够,而是因为公司没有一套让能力稳定变现的系统——没有账本,没有编队,没有契约,没有地基,没有闸门,没有飞轮,没有仪表盘。
这篇文章补的就是另外半张:把 FDE 从“能人”变成“系统”的七张图纸,加上甲方侧的对照清单、成熟度模型和 90 天启动路线。每一张图纸都尽量给到可以直接抄走用的东西:公式、条款范式句、阈值、检查项。
MINDSET
先纠三个认知:AI 交付不是软件交付的加强版
认知一:交付物从“确定功能”变成“概率系统”。
传统软件的验收是布尔值:这个按钮点了有没有反应。AI 系统的验收是分布:一百条真实样本里,判对多少条、错在哪一类、错了谁兜底。这不是措辞差异,而是整个项目管理范式的迁移。OpenAI 在 2025 年关于评测的工程文章里把流程拆成三步——Specify(定义什么叫“好”,建黄金样本集)、Measure(在真实环境测,可用模型做裁判但保留人审)、Improve(持续迭代)。这套东西在国内 toB 语境里还有第二重身份:它是回款依据。
认知二:风险从“技术风险”前移到“定义风险”。
MIT 的报告把失败主因指向系统不留存反馈、不适应组织上下文;BCG 指出落后企业中只有 8% 有 C 级高管深度参与,而领先者接近 100%。也就是说,项目死于“没定义清楚”的概率,远高于死于“模型不够聪明”。反映到排期上,一个健康的 AI 交付项目,定义阶段(场景、标准、数据、责任)的投入不应低于总人力的 25%。低于这个数的项目,后期几乎必然用返工把它补回来,而且要付两倍价钱。
认知三:成本曲线决定生死,复用率是唯一杠杆。
软件生意的边际成本递减,人力交付的成本是线性的。AI 项目定制程度高,如果每个项目都从零开始,规模越大亏得越多。Palantir 2025 财年营收约 44 亿美元、同比增长 53%,而人员只增长约 10% 却带来 63% 的营收增长——这个“运营杠杆”就是资产复用的财务表达。埃森哲 FY2025 生成式与智能体相关收入 27 亿美元、订单 59 亿美元,背后是 77000 名 AI 与数据专家、6000 多个项目的沉淀。两家路径不同,逻辑一致:先把方法固化成资产,再用人去放大它,而不是用人去顶替它。
三个认知合起来是一句话:AI 交付是一门定义驱动、评测计价、复用赚钱的生意。下面七张图纸就围绕这句话展开。
ECONOMICS
图纸一:账本——先把这门生意算成一个模型
绝大多数 toB 团队的第一个致命错误,是在没算清账之前就开始扩人。先给一个可以套用的项目毛利模型:
项目毛利 = 合同额 − 交付人天成本 − 算力与许可成本 − 售前与 POC 沉没成本 − 账期资金成本 − 质保运维预留
四个常被忽略的减项,恰恰是国内 toB 的利润黑洞。
第一,POC 沉没成本。免费 POC 已成通行获客话术,但没人把它计入项目成本。一个两人两周的 POC,按人天成本 2500 元计约 5 万元;如果转化率只有 20%,那么每一个签下来的项目实际背着 25 万元的 POC 成本。这个数字必须写进报价模型,否则你的毛利表从第一天就是假的。
第二,账期资金成本。科法斯《2025 中国付款调查》显示,2024 年中国企业平均应收账款周转天数(DSO)从 133 天升至 141 天。上市公司 2024 年报里的分化更明显:软通动力应收周转约 67 天、毛利率 12.46%,中软国际约 133 天、毛利率 22.07%,东华软件约 174 天、毛利率 20.61%,太极股份约 213 天、毛利率 24.08%。账期每多 90 天,按 5% 年化资金成本计,等于毛利率被削掉约 1.2 个百分点——对一个毛利率 20% 出头的项目,这是 6% 的利润被时间吃掉。所以验收标准不是质量文档,是财务工具。
第三,无偿变更。需求蔓延的成本从来不出现在报表上,它藏在延期和加班里。可以做一个简单统计:全年各项目实际交付人天减去合同约定人天,差额即为无偿变更规模。多数团队第一次算出这个数字时会沉默。
第四,模型与硬件的换代成本。私有化项目的模型可能在交付期内换代,国产算力平台也可能变更。这部分若不在合同里约定责任与费用,就会变成免费返工。
接着看复用率的杠杆效应。假设一个 120 万元的私有化项目,人天成本 2500 元:
| 口径 | 从零开发 | 复用率 60% |
|---|---|---|
| 交付人天 | 260 天 | 120 天 |
| 人天成本 | 65 万元 | 30 万元 |
| 算力与许可 | 15 万元 | 15 万元 |
| POC 摊销 | 25 万元 | 25 万元 |
| 账期资金成本 | 约 5 万元 | 约 5 万元 |
| 项目毛利 | 10 万元(8%) | 45 万元(38%) |
同一个合同额,复用率决定了这是一门生意还是一次公益活动。这也解释了为什么中标榜单头部厂商的共同特征是“在细分行业形成可复制方案”——不是因为他们更有理想,是因为账只能这么算。
账本层面的四个核心比率,建议直接写进管理会议议程:单项目交付人天(逐年应下降)、组件复用率(按人天口径统计)、POC 转化率(低于 30% 说明边界失控)、现金转换周期(从投入到回款)。四个数里有两个不知道的团队,本质上是在盲开。
最后是定价结构。把一次性项目费拆成三段能显著改善现金流曲线:诊断费(场景梳理与评测集共建,两到三周,独立收费,同时筛掉不认真的客户)、建设费(按里程碑与评测跑分挂钩)、订阅费(评测集维护、模型换代、知识更新、值班响应,按年收)。第三段是把项目公司改造成产品公司的现金流入口,也是国内团队最常漏掉的一段。
TEAM
图纸二:编队——FDE 不是一个岗位,是一个最小作战单元
把 FDE 当岗位招,招来的往往是“高级人肉运维”。它更应该被理解为一种编队方式。
AWS 公布的作战单元是五到六人、四十五天周期;Palantir 的经典分工是三段:现场写代码的 FDSE、负责找对问题的 Deployment Strategist(大量来自退役军官、临床医生等一线专家),以及总部的平台开发团队。前线经验回流产品,是这套体系的核心闭环。
中国政企语境下的最小作战单元,建议五个角色,其中一个必须来自甲方
| 角色 | 核心职责 | 关键产出 |
|---|---|---|
| 客户主控 | 三层对齐、变更谈判、验收与回款推进 | 需求冲突图、验收条款 |
| 前线工程 | 现场开发、知识结构化、上线陪跑 | 可运行系统、评测集 |
| 平台回流 | 组件抽取、资产入库、跨项目复用 | 通用组件、复用指南 |
| 合规兜底 | 分级、护栏、留痕、审计对接(可兼职) | 合规映射表、回滚预案 |
| 甲方内嵌骨干 | 标注、校准、内部代言、二期推动 | 标注样本、业务口径 |
第五个角色是很多团队的盲区。甲方业务骨干不是“配合方”,是编队成员,其投入比例应写进合同分工单(写明人名与每周投入工时)。项目结束时,这个人能否脱稿讲清系统逻辑、独立处理八成边界情况,直接决定有没有二期。
防止编队退化成人肉运维的三道闸门
第一道是工时分类。驻场工时必须按“建设 / 运维 / 答疑”三类记账,运维与答疑合计超过 40% 且持续两个月,触发预警——要么补自动化,要么补交接培训,要么转成收费运维合同。
第二道是并行客户上限。一名 FDE 同时服务客户数超过两家,回流产出必然归零。建议硬性上限为二。
第三道是回流配额。每人每季度至少向资产库贡献一个通过评审的通用组件。这条不做绩效挂钩,飞轮就永远转不起来。
招聘与转型:从公开薪酬看,美国 FDE 岗位总包大致在 17 万至 34 万美元区间(Palantir 口径),Anthropic、OpenAI 相关岗位底薪多在 20 万至 30 万美元;国内 2026 年上半年的行情,字节相关岗位约 3.5 万至 7 万元月薪(15 薪),阿里云约 2 万至 5 万元(16 薪),蚂蚁数科 B 端方向 4 万至 6 万元,智谱等模型厂的 FDE 负责人给到 6 万至 8 万元,头部云厂商一线总包大致落在 45 万至 90 万元。这是少数在逆势中涨价的岗位族,因为它要求的是复合体。
面试环节不要考八股,考五道现场题最有效:给一份 30 页制度文件,30 分钟内拆出实体、关系与判定规则;给一段模糊的验收条款,改写成可量化版本;给一个“顺便再加个手机端”的场景,现场做变更谈判;给一个已上线但业务不用的系统,列出五个可能原因与排查顺序;给一个刚跑通的项目,说出哪三块可以抽成通用组件。这五题对应的能力最难伪装。
考核口径也要换。不考人天产出,考三件事:项目验收周期、回流资产数量与被复用次数、客户内部代言人是否培养出来。
CONTRACT
图纸三:契约——把不确定性写成条款
在国内做 AI 交付,合同是最被低估的工程工具。以下六个条款包建议做成公司级模板,每条附一句可以直接抄的范式句。
条款包一:评测集验收。把 30 至 50 条双方共同标注的真实样本作为合同附件,明确通过阈值与判定方式。范式句:
「以附件《评测样本集》为唯一验收依据,乙方系统在该样本集上的准确率达到 X%(判定规则见附件第 3 条)即视为满足验收条件,甲方应于确认后 10 个工作日内出具验收报告并触发第 X 期付款。」
条款包二:数据责任 SLA。范式句:
「甲方应于项目启动后 15 个工作日内提供符合附件《数据规格说明》的样本数据,逾期每 1 个工作日,项目工期相应顺延 1 个工作日,且不视为乙方违约。因甲方数据质量不达规格导致的重复处理工作量,按 X 元/人天另行计费。」
条款包三:变更控制。范式句:
「任何超出附件《功能范围清单》的需求,须经双方签署《变更确认单》后实施;变更工作量按《人天单价表》计价,工期相应调整。未签署变更单的口头需求,双方一致确认不构成乙方义务。」
条款包四:POC 边界。四要素写进备忘:单一场景、样本量与脱敏责任、硬周期上限(建议两周,最长四周)、转化条件。范式句:
「本次验证限于附件所列单一场景与功能点,周期 14 个自然日;达到约定指标后 20 个工作日内启动商务流程,未达指标双方止损,各自承担已发生成本。」
条款包五:模型与算力变更。这是国内私有化项目的特有风险。范式句:
「项目实施期内,因甲方变更基础模型或国产化算力平台导致的适配工作,按新增变更处理;乙方承诺在附件所列的 X 个国产平台上提供适配支持。」
条款包六:内容责任与合规边界。明确备案主体、内容审核责任归属、日志留存义务与追责链路。范式句:
「系统输出内容的业务采用由甲方指定人员确认后生效,乙方负责提供审核链路、操作留痕与不少于 6 个月的日志留存能力;面向公众的生成场景,备案与内容安全主体责任由甲方承担,乙方提供技术配合。」
补一个谈判筹码:《保障中小企业款项支付条例》要求大型企业向中小企业支付款项一般不超过 60 天。中小服务商在与大型甲方谈账期时,这是有法律依据的抓手,不用只靠人情。
ARCHITECTURE
图纸四:地基——私有化环境下的五层参考架构
私有化、国产化、数据不出域,在国内政企项目里是默认项。2025 年多个大型集采明文要求全国产加速卡,IDC 数据显示 2025 年国产 AI 芯片出货量占比已达 41%。这意味着你的地基通常长这样:国产算力 + 国产或开源模型 + 隔离网络。
模型能力的差距要客观看。2026 年 8 月的 SuperCLUE 中文榜单上国产模型已包揽前列,OpenCompass 前十中国产占四席;但在幻觉控制与复杂指令遵循上,海外旗舰仍有优势,而国产模型的性价比优势明显。结论不是“国产不行”,而是:可用模型的上限越受限,架构与评测的确定性就要越强。
五层参考架构
知识层——不要把制度汇编整包丢给模型。按实体(设备、工单、合同、患者)、关系(隶属、触发、依赖)、规则(阈值、路由、豁免条款)三要素建模。央国企的制度、规程、案例库天然带章节与条款结构,抽取性价比远高于野生文档,这是国内知识密集型场景的真实优势。
编排层——Anthropic 在《Building Effective Agents》里的核心建议至今没过时:从简到繁,优先用确定的工作流,工具设计比框架选择更重要,关键操作保留人工确认,并设计错误恢复路径。政企项目里,能用固定工作流解决的,不要上多智能体;把不确定性集中在一两个可评测的判断节点上。
评测层——评测集不是测试文档,是交付物。它至少承担四个用途:验收依据、回归测试集、模型换代基准、付款触发器。经验规律是,同一个模型,验收标准从模糊到清晰,表观达标率常能提升二三十个百分点——变的不是模型,是标准。
护栏层——为每个 AI 触达用户的场景选定放行模式:白名单(仅确认安全的问题域自动输出,其余转人工)、黑名单(默认放行、拦截敏感项)、灰度(先白后黑)。在医疗、政务、金融等场景,这不是自由选择,而是合规映射的结果。标准搭配是“AI 初判 + 人签发”:AI 提效,人担责,系统留痕。留痕这件事要讲清楚是保护经办人的机制,推行阻力会小一半。
观测层——日志留存不少于 6 个月(等保三级要求),并把 token 消耗、响应时延、转人工率、异常回溯纳入同一个看板。上线后第一个月的转人工率曲线,是判断项目会不会“技术成功、组织死亡”的最灵敏指标。
三条工程纪律收尾:先工作流后智能体;做上下文工程(按任务裁剪、渐进摘要、防上下文污染);一切关键动作可回滚。
GUARDRAIL
图纸五:闸门——合规映射与事故红黑榜
国内 AI 交付头顶悬着一套刚性规则,这些不是风险提示,是准入条件。
《生成式人工智能服务管理暂行办法》自 2023 年 8 月 15 日施行,具有舆论属性或社会动员能力的服务须做安全评估与算法备案,训练数据须来源合法,涉及个人信息须取得同意,生成内容须依规标识。国家网信办 2026 年 1 月公布的数据显示,截至 2025 年 12 月 31 日,累计 748 款生成式 AI 服务完成备案、435 款完成登记。叠加等保 2.0(三级为政企底线、日志留存不少于 6 个月)、《数据安全法》的重要数据出境评估、《个人信息保护法》的最小必要与敏感信息单独同意,构成了交付方案的硬边界。
合规映射表(按场景选放行模式)
| 场景类型 | 放行模式 | 必备动作 |
|---|---|---|
| 医疗、政务办件、金融适当性 | 白名单 | 专业人员确认后入档、全链留痕、责任人可追溯 |
| 内部辅助(工单、知识问答、报告草稿) | 灰度 | 抽样校准、转人工阈值、错误上报通道 |
| 物流查询、FAQ 等低风险高频 | 黑名单 | 敏感词与越权拦截、异常兜底话术 |
| 面向公众的内容生成 | 白名单 + 审核链 | 备案主体确认、内容标识、日志留存 |
每个上线方案必附四件套:风险分级、兜底策略(出错谁处理、多快响应)、影响半径上限、回滚预案(多快切回人工)。缺一件不上线,没有例外。
再给一份事故红黑榜,都是高频死法,附一句预案
一是照标书交付,上线无人用——预案:进场先做三层访谈(领导要成果、信息中心要可控、一线要省事),把冲突点摆上桌。二是按制度文件设计流程,实际流程完全不同——预案:蹲现场还原实然流程,每个节点标耗时、出错率与系统归属。三是免费 POC 无限膨胀——预案:四要素写进备忘,硬周期上限。四是验收标准模糊,回款拖季度——预案:评测集入合同附件。五是甲方数据迟到、质量差,锅归乙方——预案:数据责任 SLA。六是把定时同步脚本包装成“AI 赋能”,评审被专家戳穿——预案:人机分工三分法,能自动化的别贴 AI 标签。七是让 AI 一条龙包办到底,出事无人签字——预案:AI 初判 + 人签发。八是知识库变文档坟场——预案:实体-关系-规则建模 + 调用路由。九是验证通过直接全量,长尾数据翻车——预案:1% 抽样校准、模板固化、逐步放量。十是交付物业务方看不懂、不敢改——预案:业务骨干必须能用自己的话复述判断逻辑,复述不了就打回。十一是验收即失联,复购归零——预案:季度回访、版本通报、标杆案例共创。十二是每个项目从零开始,越做越亏——预案:回流配额与资产库治理。
FLYWHEEL
图纸六:飞轮——资产分层与复用率治理
复用不是“把代码存起来”。没有治理的资产库,三个月就变成垃圾场。建议按四层来管:
L0 代码片段——个人级,不入库,不统计。
L1 通用组件——跨行业可用:评测框架、护栏与审核链、留痕与审计模块、部署脚本、信创环境适配包。国产化适配包尤其值钱,做一次,之后每个国产化项目都在收利息(不同平台的迁移工作量差异不小,中等规模推理项目的迁移人天在昇腾、寒武纪、海光 DCU 之间可以差出两三倍——这是工程经验值,不是行业基准,具体以实测为准)。
L2 场景包——跨客户可用:设备运维预警、合同条款审查、工单智能分派、制度问答等,含流程骨架、评测集模板、知识路由逻辑。
L3 行业方案——含行业术语体系、合规映射、典型集成清单与报价模型。
入库五条硬标准,缺一条不算完成:可运行(一条命令跑通最小闭环)、有文档(含《复用指南》:哪些通用、哪些需替换、替换工作量估计)、有评测(自带样本集与基线跑分)、有负责人(署名维护)、有版本(含变更记录)。
复用率怎么量?不要数代码行,按人天口径算:本项目实际交付人天中,由既有资产覆盖而节省的估算人天占比。做法是在项目立项时由平台回流角色出一份“资产覆盖预估表”,结项时对账。这个数字第一年能到 30% 就算健康,第二年应该往 50% 以上走。
三阶段路径:项目公司(一次一卖,毛利靠压人力)→ 场景公司(一个场景卖多家,毛利靠复用)→ 产品公司(标准产品 + 交付服务,毛利靠许可与订阅)。参考坐标就是前面提到的运营杠杆:人员增长远慢于收入增长,才叫走通了。
三个“资产库正在死掉”的信号,出现任意一个就要干预:最近一个季度没有新组件入库;有入库但没有任何跨项目引用记录;新项目的立项文档里不出现资产覆盖预估表。
METRICS
图纸七:仪表盘——十二个指标,每个都有红线
管理不了度量不了的东西。下面十二个指标建议做成一页看板,季度复盘逐项过:
| 指标 | 健康值 | 警戒信号 |
|---|---|---|
| POC 转化率 | ≥ 40% | < 25%,边界失控 |
| POC 平均耗时 | ≤ 14 天 | > 30 天,做成免费交付 |
| 定义阶段人力占比 | 20%–30% | < 15%,后期必返工 |
| 无偿变更人天占比 | ≤ 10% | > 20%,契约失效 |
| 验收周期(终验-上线) | ≤ 45 天 | > 90 天,标准不清 |
| 现金转换周期 | ≤ 120 天 | > 180 天,现金流危险 |
| 单项目交付人天 | 逐年下降 | 持平或上升 |
| 组件复用率 | ≥ 30%(首年) | < 15%,飞轮未转 |
| 上线 30 天业务活跃度 | ≥ 目标用户 60% | < 30%,组织性死亡 |
| 甲方骨干自处理边界 case | ≥ 80% | < 50%,无内部代言 |
| 每 FDE 并行客户数 | ≤ 2 | ≥ 3,回流归零 |
| 老客复购与转介绍占新签 | ≥ 30% | < 15%,信任未沉淀 |
看板的意义不在数字漂亮,而在于让“交付得好不好”变成一件可以争论的事实,而不是各说各话的感受。
CLIENT SIDE
甲方侧:怎么当一个能让项目成功的客户
这一节写给企业方,因为交付失败的原因至少一半在采购侧。
吴恩达 2026 年 6 月的公开表态值得认真对待:FDE 有价值但被过度炒作,企业应以内建 AI 工程能力为主、少量外部 FDE 为辅,并警惕供应商锁定,建议合约不宜过长。这个判断放到中国要打个折扣——国内多数政企的 IT 自建能力弱于美国同行,对乙方的结构性依赖更深更久。但方向是对的:外部交付力应该被用来长内部能力,而不是替代内部能力。
场景准入四问(任何一个答不了就先别立项):这件事一年内影响多少人、多少次、省多少小时?错了谁承担、最坏后果是什么?判断依据是否已经写成文字(制度、规程、案例)?谁来定标准、谁来签字?
内部对口机制:为每个项目指定一名业务骨干(非兼职挂名,写明工时)+ 一名信息中心接口人 + 一名分管领导。三缺一,项目延期概率显著上升。
数据准备清单:数据范围与样本量、格式与字典、质量标准、脱敏规则与责任、供数时限、异常样本占比。这份清单在招标阶段就该给出,而不是等乙方来催。
供应商评估十问(比看资质更有效):能否现场演示评测集怎么做?上一个同行业项目的复用率是多少?验收条款愿不愿意写成跑分触发?数据责任 SLA 敢不敢双向对等?国产算力平台适配过哪几个、有无适配包?合规映射怎么做的、备案配合到什么程度?人机分工里谁签字?上线后 30 天的活跃度承诺是多少?项目结束时留给我们哪些文档与培训?如果我们要换模型,工作量与费用怎么算?
甲方最常见的四种自伤:一次性大招标搞“AI 全面赋能”,一年后没有一个能独立验收的东西;把免费 POC 当免费劳动力,优质供应商逐渐不投标;不给数据、不给人,却要求高精度;让不用系统的人来定验收标准。
ROADMAP
成熟度模型与 90 天启动路线
五级成熟度自评(对号入座)
L1 人力外包——按人天卖,无评测、无资产,项目结束什么都不留。L2 项目可控——有需求文档与流程测绘,验收标准部分量化,但仍是一次一卖。L3 标准化交付——评测集、护栏、留痕成为标配,合同六件套齐备,验收周期与回款可预测。L4 资产复用——L1/L2 资产库运转,复用率进入立项文档,单项目人天逐年下降。L5 产品化——标准产品 + 交付服务的双轮,收入增长显著快于人员增长。
多数国内团队处在 L1 到 L2 之间,跨到 L3 靠的是契约与评测,跨到 L4 靠的是治理与考核,跨到 L5 靠的是取舍——敢放弃不可复制的订单。
90 天启动路线(给决定要做这件事的一号位)
第 1–30 天:建标准。选一个真实项目做样板:拉甲方骨干共建 30–50 条评测样本;把六个合同条款包做成公司模板并过法务;把驻场工时改为三类记账;盘点历史项目,抽出第一批三到五个候选通用组件。产出物:评测集一份、合同模板一套、工时台账、候选资产清单。
第 31–60 天:跑闭环。在样板项目上完整跑一遍“定义—建设—评测—放量”:1% 抽样校准、模板固化、逐步放量;同步建立仪表盘前六个指标;把合规映射表与四件套嵌入方案评审流程,评审不过不上线。产出物:一个按新方法交付的项目、一版看板、评审卡点。
第 61–90 天:转飞轮。把样板项目里与客户无关的部分抽成 L1/L2 资产并入库,走完五条入库标准;换一个同行业相邻客户做迁移验证,目标是“换个人、用你的框架和文档,复用七成组件、一周内跑通最小闭环”;把回流配额写进季度考核。产出物:资产库首批条目、一次迁移验证报告、考核办法。
三个月做不完全部,但足以判断这条路走不走得通。判断标准只有一个:第二个项目的交付人天,是否明显低于第一个。
CHECKLIST
一页纸自查表(每周复盘直接用)
| 阶段 | 每周必答的自查问题 |
|---|---|
| 进场 | 三层诉求的冲突点写清了吗?实然流程有耗时与出错率数字吗?切口能否量化回答“为什么先做这个”? |
| 立项 | 评测集双方签字了吗?POC 四要素齐吗?数据责任 SLA 写进合同了吗?变更单机制真的在跑吗? |
| 交付 | 知识拆出实体、关系、规则了吗?每个节点标了执行主体与责任人吗?上线四件套齐了吗? |
| 放量 | 抽样校准做了吗?业务骨干能复述判断逻辑吗?转人工率有人盯吗? |
| 沉淀 | 本项目抽出了几个可入库组件?《复用指南》写了吗?下个项目的资产覆盖预估表出了吗? |
| 账本 | POC 转化率、无偿变更占比、验收周期、复用率——这四个数现在能立刻说出来吗? |
THE END
结语:机器越会写代码,机制越贵
行业里那份十二项能力清单是好东西,它教会一个人怎么在前线站住。但企业需要的不只是站住的人,而是一套让人换了、项目变了、模型换代了,交付质量仍然稳定的系统。
七张图纸可以浓缩成三句话。第一,把验收变成跑分——它同时是质量标准和回款开关,是国内 toB 语境里性价比最高的一项工程改造。第二,把交付变成资产——不复用的交付在中国的账永远算不平,复用率是这门生意唯一的杠杆。第三,把客户变成合作者——甲方骨干进编队、能复述逻辑、愿意在二期为你说话,比任何 PPT 都值钱。
至于那个被反复讨论的问题:AI 编码能力越强,FDE 会不会消失?大概率不会,但它的价值重心会移动——写系统的部分会被机器吃掉越来越多,而听懂中国甲方、把标准写成条款、把项目变成资产、把信任经营成复购,这些“让交付发生”的机制会更贵。
每交付完一个项目,值得问自己一句:这一次,我给下一个项目留下了什么?
END
我是 {{作者名}},{{一句话简介,如:长期观察企业级 AI 落地与 toB 交付}}。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
