96.4% 准确率。0 幻觉。每一条输出都可追溯到 DOI。
发表于 npj Digital Medicine, 2025。对照组:GPT-4 + XEvidence vs. GPT-4 + 非结构化网络来源。
瓶颈不在模型。
每一个做健康相关 AI 的产品,底层都在做同一件事:从 PubMed 检索,抓取指南网站,再叮嘱 LLM「对医学准确性小心一点」。
这种做法在规模化时会塌。
GPT-4 接入结构化临床指南,准确率 96.4%、零幻觉;同一个模型接入非结构化来源,近 30% 的医学引用无法溯源。
同一个模型。不同的底层基础设施。
当 Google 最先进的临床 AI 都还在一份份手工整理指南文档时,说明问题不在能力,而在缺少一个标准化的证据层。
写给没有医学研究组、也要把健康功能上线的团队。
临床 AI 公司
CDSS、诊断智能体、治疗推荐系统。每一条输出背后都需要可验证的证据。自建这条链路要 18 个月和一个 MD 团队。
带 AI 的消费级健康硬件
可穿戴、睡眠监测、连续血糖、HRV 教练。产品一旦说「你的数据表明 X」,这句话的准确性就是你的责任。
健康与健康生活类 App
症状自查、营养补剂推荐、长寿平台。用户期待的是有研究依据的答案,不是通用 LLM 的泛泛之谈。
一个 API,覆盖证据栈的每一层。
01
结构化一手文献
全文临床论文解析为可核验的结论、证据等级、引用链。不是片段,不是摘要。
02
临床指南集成
主流临床指南结构化为机器可读的证据条目。指南发布当天更新,不是按季度。
03
多语种覆盖
通过直接合作获得中文学术数据库的授权。目前唯一规模化包含中文临床研究的英文可访问证据源。
04
DOI 级可追溯输出
每一条结论都链到具体的论文。查不到出处的我们不返回。合规团队免费拿到审计链路。
用它服务的那些研究本身来证明它。
今年两项独立研究分别测量了:同一个 AI 模型,换不同的基础设施层,会发生什么。
接入 XEvidence 级结构化证据
96.4%
准确率,零幻觉
在术前评估上超过了人类医生。
Source: Koh et al., npj Digital Medicine, 2025
使用非结构化来源
~30%
医学引用出现幻觉
同一类模型。底下没有结构化的证据层。
Source: Cossio et al., JMIR, 2024
差距不在模型。差距在模型底下那一层。
团队是这样用 XEvidence 的。
用可核验的文献把 LLM 回答「接地」
在 LLM 调用旁边同时查询我们的 API。返回带引用的结构化结论。用真实引用替换掉幻觉。
上线前校验健康推荐
实时对照结构化证据检查产品输出。无法溯源的结论自动打标。
更快做出以证据为基的功能
跳过「自建医学知识库」这 18 个月的工程量。一周完成集成。
已经在用的团队。
- 用于北京大学临床医学的科研工作流。
- 一家 Johnson & Johnson 业务部门用于常规文献调研。
- 一家快速增长的 EdTech 公司将其列为核心研究基础设施。
- 付费用户覆盖 4 大洲,零市场投放获取。
客户 logo 受 NDA 约束。如需了解请联系我们。