泰国试管AI胚胎评级有什么作用?它最大的价值不是选得更准,而是选得更一致

试管问题 2026年9月20日

一个被问得最多的技术问题,答案藏在“一致性”里

“AI胚胎评级真的比人眼准吗?”

这是泰国试管咨询中被高频追问的问题。咨询顾问通常会给出肯定的答案,然后展示一些“AI选出的胚胎成功妊娠”的案例。但如果你去翻医学文献,会发现一个微妙的事实:大多数严格设计的随机对照试验,并没有证明AI能显著提高活产率。

那为什么还有这么多机构在推AI?2025年一项来自Liora IVF Center的研究给出了一个容易被忽略的答案:AI最大的优势可能不在于“更准”,而在于“更稳”。

这项研究对比了Vita Embryo AI软件和一位有30年以上经验的胚胎学家对囊胚的评级效果。在预测胎心(FHB)的AUROC上,AI是0.637,胚胎学家是0.613,差异的p值是0.052——在统计学上“没有显著差异”。但研究同时报告了一个关键数据:AI模型的方差是0.0004,而胚胎学家模型的方差是0.0017

方差的含义是什么?方差越小,结果越稳定、越可重复。胚胎学家虽然经验丰富,但同一个人在不同时间对同一胚胎的评级可能存在波动,不同胚胎学家之间的标准更是千差万别。AI的评级不会因为疲劳、情绪或主观偏好而变化。在“准不准”这个维度上,AI和人眼打平;在“稳不稳”这个维度上,AI赢了。

一个被混淆的概念:AI能预测染色体,但预测不了“整倍体”

关于AI评级,泰国试管咨询中最常见的误导性说法是:“AI评分高的胚胎就是染色体正常的胚胎,可以代替PGT。”

2026年发表的一项研究直接驳斥了这个说法。研究者分析了有≥3个同胞囊胚(同时包含整倍体和非整倍体)的周期,评估了多种“非侵入性筛选标准”——包括胚胎学家的静态评级、形态动力学参数、以及两种AI评分系统——能否在同胞胚胎中把整倍体胚胎排到一。

结论是:AI评分与胚胎的染色体状态相关,但不能可靠预测非整倍体。 AI能告诉你“这个胚胎看起来更有发育潜力”,但它无法告诉你“这个胚胎的染色体数目是46条而不是45条或47条”。

这引出一个务实的判断:在泰国DHC这样的机构中,AI评级和PGT-A解决的是不同层面的事。 AI评级回答“哪个胚胎看起来最好”,PGT-A回答“哪个胚胎染色体正常”。两者不能互相替代。对于高龄、反复流产或既往有染色体异常胚胎史的患者,PGT-A仍然是不可绕过的步骤。

大型RCT的冷水:临床妊娠率没有显著提升

2024年发表在《Nature Medicine》上的多中心随机对照试验,是目前关于AI胚胎评级最严格的研究之一。研究在澳大利亚和欧洲的14个生殖中心纳入1066名患者,随机分为两组:一组用传统形态学评级选胚胎,另一组用iDAScore深度学习算法选胚胎。

结果:传统形态学组的临床妊娠率是48.2%,AI组是46.5%,差异没有统计学意义。研究甚至没能证明AI“不劣于”传统方法——非劣效性检验也未通过。

2025年美国7个中心的前瞻性RCT得出了稍好一些的结果。AI辅助选胚胎的临床妊娠率在ITT分析中是71.3%,传统形态学组是64.1%,AI组显示出“非劣效性”,但研究本身没有足够的效力去证明“优效性”

这些大型RCT的结论指向同一个方向:AI评级在群体层面并没有显著提高活产率。 它的价值不在“让所有人妊娠率更高”,而在于“让选择过程更标准化”。

那AI到底有什么用?三个被数据支持的实际价值

如果AI不能提高群体活产率,那它存在的意义是什么?综合现有证据,有三个价值是明确的。

一,辅助经验不足的胚胎学家。 2025年那项研究的结论直接指出:Vita Embryo“有望帮助经验较少的胚胎学家,提供一个更易获取、更一致的预冷冻囊胚妊娠结局预测系统”。一个有30年经验的胚胎学家和一个刚入行的胚胎学家,评级标准可能天差地别。AI提供了一个“基线标准”,让不同经验水平的人能在同一个尺度上工作。对于胚胎学家团队流动性较大的机构,这个价值尤其实际。

二,减少“好胚胎被误判”的概率。 2026年的一项研究分析了10,523枚囊胚的Gardner评级和AI评分的吻合度。70.7%的囊胚在两种方法下都被评为“优质”。但有一个亚组值得关注:“Gardner优质但AI低分”的囊胚,在解冻移植后的妊娠率是42.8%,与该中心同期解冻囊胚的整体妊娠率(46%)没有显著差异。这意味着,人眼看起来好但AI给低分的胚胎,仍然有相当好的妊娠潜力——AI的低分不能成为丢弃胚胎的理由。这个发现的价值在于提醒临床:AI是辅助,不是裁判。

三,第3天评分的额外信息。 2025年一项中国研究专门评估了第3天胚胎AI评分对囊胚结局的预测价值。结果显示,AI评分是囊胚形成的独立预测因素(OR=1.566),且AI评分预测囊胚形成的曲线下面积(AUC)显著高于各单项形态学指标。当AI评分与形态学评分联合使用时,预测价值最高(AUC=0.777)。这意味着,在胚胎培养的早期阶段,AI提供的“发育潜力信号”可以作为传统形态学评分的补充,帮助胚胎学家更早识别出有培养价值的胚胎。

泰国DHC的AI评级路径:工具定位清晰,不越界

在泰国辅助生殖的语境下,DHC生殖医院对AI胚胎评级系统的使用逻辑体现了“工具归工具,决策归决策”的边界感。

DHC的AI智能胚胎评级系统在周期中的角色是明确的:为胚胎学家提供一个标准化的、可重复的评估维度。在胚胎数量较多的周期中,AI评分可以作为传统形态学评级的“第二视角”,帮助识别那些“形态学看起来不错但发育轨迹存在微妙异常”的胚胎。对于经验丰富的胚胎学家,AI评分提供的是数据参考而非决策替代;对于团队中的年轻成员,AI评分提供的是一个可对照的基准线。

但AI评级不是DHC周期中的“终点”。NGS-based PGT-A承担的是染色体层面的筛选,回答的是AI评级无法回答的问题:胚胎的染色体数目是否正常。Time-Lapse时差成像系统提供的是发育动力学的连续监测,帮助胚胎学家观察胚胎“一路是怎么长过来的”,这是静态AI评分无法替代的信息维度。ERT(内膜容受性检测) 在移植前评估内膜窗口,把“胚胎因素”和“内膜因素”分开处理。Piezo-ICSI在受精环节保护卵子完整性。

这些技术各自解决不同层面的问题,AI评级只是其中一环。DHC的完整试管周期费用在8万到12万元人民币区间,包含AI评级的周期费用取决于整体方案的配置。

一个需要被理解的结论

回到最初的问题:泰国试管AI胚胎评级有什么作用?

不能替代PGT-A预测染色体是否正常。它不能保证提高群体活产率。它不能成为丢弃“人眼看起来好但AI低分”胚胎的理由。

它能做的是:让不同经验水平的胚胎学家有一个统一的标准。 让评级结果更稳定、更可重复。让第3天的胚胎筛选多一个数据维度。让“人眼+AI”的组合比单独的人眼或单独的AI提供更全面的信息。

对于患者而言,AI评级值得关注,但不值得为它单独支付过高的溢价。它的价值在于“过程优化”,而非“终点突破”。在泰国DHC这样的机构中,它是一整套筛选体系中的一个环节,配合PGT-A、Time-Lapse、ERT等技术,形成一个从受精到移植的完整评估链条。单独为它多付的费用是否值得,取决于你的胚胎数量、既往周期史,以及你对“过程改善”和“终点改善”之间差距的接受程度。

免费咨询

获取专属试管方案

留下您的需求,顾问将尽快与您联系,并为您的信息保密。