平台、伙伴与客户:商业交付怎样接起来
一家研究机构要从病历中取出可供研究的数据,究竟应该让软件公司做什么?把资料搬到一起,只解决了第一层问题。报告里某个词的含义、医生何时改变了记录方式、遗漏的项目能否补取,仍然需要懂这项工作的人判断。
2021 年 4 月 29 日,MD Anderson 癌症中心公布与 Syntropy 的技术合作。客户表示,数百名跨学科协作者已在 Foundry 上开展超过 50 个项目,同时还在通过培训和实施扩大使用。1 三年后,一篇由该中心临床、信息服务等人员参与的研究论文,提供了该机构数据工作的另一份具体记录:并没有把所有报告交给同一个模型,而是根据报告结构分流,再用人工检查纠正抽取。2
合作公告与方法论文回答了不同的问题。前者说明谁已经开始使用,后者使人看见资料怎样成为可用的研究数据。把两种记录接起来,才有可能讨论商业交付的实际劳动。
本章沿 Merck、Syntropy 与 MD Anderson 这条线索,观察平台供应商、实施伙伴和客户怎样接续工作。公开材料没有逐一确认参与者的 FDE 职衔,因此它是一组相似协作机制的证据,不能承担“FDE 已接管整个行业”的结论。它对理解 FDE 的价值,恰恰在于让我们看见:贴近客户的工程师进入的是一个已经有专业人员、有系统,也有判断权的组织。
产品扩大了用途,不代表一种岗位独自完成扩展
Palantir 的上市文件回顾:公司于 2003 年创办,最初为反恐工作开发软件;2008 年发布面向情报客户的 Gotham,2016 年发布面向企业共同数据问题的 Foundry。2019 年,商业与政府客户分别贡献收入的 53% 和 47%。3
这几个时间点能说明公司与产品的扩展,却不能充当 FDE 组织史的开关。Foundry 发布之前是否已有相关商业工作、客户与工程人员怎样共同改进产品、伙伴在哪个阶段承担更多任务,都需要另外的证据。公司收入也不能分解出某一种岗位的贡献。
从特殊用途走向商业市场,并不是把软件名称换掉。原来的工具也许能连接资料,却未必理解新客户为什么要连接它们。另一方面,承认每个客户的区别,也不等于每家都要从头开发一套平台。商业交付最难的部分,往往是把可以复用的技术,与必须由客户重新解释的工作分开。
第3章 Palantir的现场与产品讨论了现场发现如何进入公共产品。本章把目光移到另一条链上:如果供应商不直接承担所有现场工作,谁把客户的问题讲清楚,谁把它变成实施要求,谁又判断问题是否真的需要产品团队改动?
从合作意向到方法记录
2017 年 1 月 12 日,德国达姆施塔特的 Merck KGaA 与 Palantir 宣布合作,起步方向包括药物研发、患者服务和供应链,并计划进一步扩展;双方没有披露财务条款。4 这是合作方向,不能读作三个领域已经取得相同程度的效果。
2018 年 11 月 19 日,双方宣布有意以 Syntropy 为品牌组建合资企业,支持科学数据协作。原件说明,当时签署的是不具约束力的条款书。5 比起“又一家客户使用了软件”,新的变化是参与者的关系:平台能力与行业经验准备通过共同经营的安排,服务第三方研究机构。但这一日并不是已完成设立、全面部署或实现科研突破的证明。
2021 年的 MD Anderson 公告,才给出了客户已经使用的记录。平台建在该中心既有数字基础设施之上,用于整合临床、生物样本和影像等数据,并提供来源追踪与访问控制。1 来源追踪让研究者能回查资料从哪里来、经过什么处理;访问控制决定谁能接触或操作它。
| 记录 | 它能支持的判断 | 下一步仍需什么 |
|---|---|---|
| 2017 年企业合作 | 双方准备在哪些工作上投入 | 实际项目、人员和交付记录 |
| 2018 年组建意向 | 希望以什么经营安排服务更多机构 | 完成安排及客户实施的记录 |
| 2021 年客户采用说明 | 已有人在平台上开展研究工作 | 具体过程、质量和持续使用证据 |
| 2024 年方法论文 | 一项数据建设怎样完成抽取与核验 | 跨机构适用性及患者结局等另行研究 |
表中的最后一列,不是为每个事实附加一道消极限制。它决定下一轮调查该找谁。询问软件公司合作方向,不会得到研究者验证某个字段的方法;询问研究者能否正确取数,也不能自动回答合作是否盈利。不同问题需要不同记录。
报告改变了,抽取规则也必须改变
2024 年发表的直肠癌数据库研究提供了一段可以观察的工程过程。研究团队对格式相对稳定的内容采用规则抽取,对其他内容使用语言处理,并保留人工补取。他们先检查缺失或不准确的原因,迭代调整抽取方法。在最终质量评价中,两名外科医生再将人工取自病历的值与自动抽取值对照,标记差异,用于评价准确性;论文没有说这两名医生随后继续修改抽取流程。这里检查的是取数是否忠实,并非重新判读医学影像。2
这条过程值得停下来细看。算法的选择由输入决定:可以稳定识别的位置,不必先交给更复杂的方法;结构不固定的部分,也不能因为使用了语言处理工具,就免除对照原记录的工作。临床人员在此承担的是判断抽取是否忠实的角色,不能被故事压缩成“最终点了一下确认”。
论文还记录了报告模板变化,并指出成熟的电子病历、标准化报告与有经验的人员构成了工作基础;其他平台也可能完成类似建设。2 这意味着源系统怎样记录事情,会直接改变工程实现。一个规则昨天有效、今天失效,未必是模型退化,也可能是医院改变了写报告的方式。
对供应商而言,这种变化会产生一个很具体的决定:先重新训练一个复杂模型,还是先检查输入格式?如果失败样本集中在模板调整之后,先修正提取位置和字段解释,可能比扩大模型更直接。反过来,如果同一信息在自由文本里有许多表达,继续堆叠脆弱规则又可能只是延迟必要的改变。这里的判断来自失败的分布,而不是团队偏爱哪一种技术。
论文没有公开每次修正的会议纪要,也没有把每段代码对应到某一名 FDE。不能据此补写“某工程师当天说服医生”的现场。不过,已公开的方法足以揭示一种通常被演示掩盖的劳动:工程人员必须知道错误出现在哪种报告里,专业人员必须知道软件究竟提取了什么,双方才能把错误从一个笼统的准确率问题,拆成下一步可以处理的事项。
这也解释了为什么客户原有能力是交付条件。经验丰富的专业人员、稳定报告与已有数据设施,并不是等外部团队到来后才出现的背景。如果另一个机构缺少这些条件,复制平台配置并不等于复制这项研究的可靠性。供应商需要先补齐的,可能是资料整理和工作规范,而不是更多模型功能。
三方协作,要让问题落到能改变它的人手里
公开论文能说明提取与验证方法,不能替我们推定 Syntropy、Palantir 和医院之间的每一条合同责任。下面把这个机制转换为一个明确的教学检查:研究人员发现某份报告在模板变化后没有取到目标字段,三方应怎样接续?
| 遇到的分歧 | 首先要取得的判断 | 教学安排中的下一责任人 |
|---|---|---|
| 新旧字段是否表达同一件临床事项 | 专业人员解释字段含义及可用范围 | 客户的临床与资料负责人 |
| 含义相同,但原规则找不到新位置 | 提供脱离身份信息的可复现输入与预期值 | 实施人员修改映射或提取规则 |
| 配置明确,但平台没有按配置执行 | 区分配置错误与可复现的平台缺陷 | 平台团队处理产品问题 |
| 报告本身没有记录该事项 | 判断是否有合法、可靠的补取途径 | 客户决定补取或保留缺失,不能由软件猜成已知 |
这是一种建议的分工,不是该项目内部流程的复刻。它比“加强沟通”多做了一件事:相似的表面症状被送往不同责任人。客户掌握专业含义,实施方负责把已确认的含义变成可重复执行的处理,平台团队处理公共能力的缺口。
伙伴的价值也由此可以检验。如果它能带着原输入、预期值、当前输出和已排除的原因去找平台团队,就减少了一轮从头猜测。如果它只转发一句“客户说不准确”,反而可能使错误多走一道门。伙伴数量并不能证明协作成熟,问题能否落到有权改变它的人手里才更有说服力。
还有一种容易忽视的好结果:确认现有产品已经够用。现场工程不应以“促成多少新功能”作为唯一成绩。如果把格式变化处理在实施规则里,就能满足需要,那么不修改公共产品可能正是正确选择。只有多个用途反复暴露相同缺口,而且边界能够解释清楚时,才值得把它送入第3章 Palantir的现场与产品讨论的公共产品决策。
采用规模与工作质量,各有自己的证据
开篇的超过 50 个项目,表明客户报告了跨学科采用;它没有给出统一工作量,也没有公开足以独立重算的项目清单。方法论文则让我们看到一项具体建设怎样检查数据质量。两者合起来,比单纯的合作公告更丰富,但仍不能推出所有项目加速、患者结局改善或投入已经收回。
对准备采购的机构来说,下一步因此不必追问一个无所不包的“效果百分比”。如果当前问题是研究数据整理,应先看研究者能否回查提取依据、例外由谁处理、源系统改变后怎样发现。如果目标进一步涉及诊疗决策,则还需要另一类验证;不能把忠实地提取记录,等同于记录已经足以支持医疗决定。
供应商也不必把仍需人工参与解释为产品失败。人工补取可能是对资料边界的合理处理。真正需要警惕的是:人工步骤没有记录,演示却把整个过程描述为自动化;或者平台扩大了使用范围,却没有增加相应的解释与维护能力。
这里出现了 FDE 的一种可能价值,也出现了它的替代方案。若困难主要在陌生任务、客户专业判断与产品能力之间反复转换,前线工程可以缩短这一过程。若字段定义稳定,客户已有技术团队,成熟平台和实施伙伴也能完成工作,就没有理由仅凭岗位名称再增加一层人手。现有材料支持我们比较这些安排,并没有证明其中一种安排在所有机构里占优。
服务伙伴,也在改造自己的工作
到了生成式AI阶段,实施伙伴并没有从这条链上消失。2026年5月14日,Anthropic与PwC扩大合作的公告提出,建立联合能力中心,并计划培训和认证三万名美国专业人员。公告还描述,PwC先在自身财务等工作中使用Claude,再把相关能力带向客户,并设置财务、供应链和交易业务的孵化团队。6 培训是计划,自用是提供方陈述;它们都不能被写成三万人已经具备独立交付能力。
这为“平台自己服务所有客户,还是通过伙伴”增加了第三个观察角度:伙伴能否先把自己的专业工作改到可用,再解释哪些经验适合带出去?内部试用可以较早暴露判断与接口问题,仍不能替外部客户验证其数据、权限和责任。熟悉一种财务工作,也不等于可以替另一家企业决定所有会计口径。
无论是 Merck、Syntropy 与 MD Anderson 的合作,还是 PwC 将自用经验带向客户,都可以沿本章三方表检查:遇到下一次报告、规则或接口变化,谁有权判断,谁负责动手?合作关系应当使答案更明确,而非让问题多转一道门。
到了 AI 时代,模型降低了制作演示的门槛,却不会替任何一方自动承担上述判断。下一章将继续追问:新一轮面向客户的工程投入,究竟在填补什么缺口,又在什么条件下会被更成熟的产品取代?
-
MD Anderson,MD Anderson advances data collaboration through technology agreement with Syntropy,2021-04-29,既有基础设施、initial projects、rollout 段。项目量为客户自述。 ↩ ↩2
-
MD Anderson 等作者,An Automated, High-Throughput Platform to Generate a High-Reliability, Comprehensive Rectal Cancer Database,正式发表 2024 年 5 月,PMC 作者稿公开于 2025-05-30;Methods 的 Data Sources、Data Extraction and Processing、Validation,Discussion 的 Limitation。所据范围为元数据、方法及讨论相关段落;不采用文内不一致的患者计数,不推定患者结局或 FDE 职衔。 ↩ ↩2 ↩3
-
Palantir,Form S-1,2020-08-25,MD&A Overview,印刷页 86;Expansion & Growth,印刷页 88。产品回顾与收入分类不能证明 FDE 人员贡献。 ↩
-
Merck KGaA,Merck KGaA, Darmstadt, Germany, and Palantir Launch New Healthcare Acceleration Partnership,2017-01-12,PDF 第 1—2 页。只取合作方向及未披露财务条款。 ↩
-
Merck KGaA 经 PR Newswire 发布,Syntropy to Unlock the Value of Scientific Data in Fight to End Cancer,2018-11-19,开篇及 About Syntropy。当时为不具约束力的条款书和组建意向。 ↩
-
Anthropic,PwC is deploying Claude to build technology, execute deals, and reinvent enterprise functions for clients,2026-05-14,联合中心、Office of the CFO和培训计划各节,2026-09-27读取。公告的计划、内部使用与匿名客户效果不能混作同一层证据;本章不采用匿名项目提速数字。 ↩