跳转到正文

皮肤检测仪的结果能信到什么程度 — 分数与诊断的距离

“报告单上说我的水分处在偏低区间,所以就来了。”这是诊室里时常听到的话。患者说,对方依据屏幕上的数值和等级告诉他该做什么,可那个数值究竟是与什么比较得出的,却很少出现在解释里。这篇文章不是在说皮肤检测仪没有用,而是在谈该用什么框架来读这些分数

三句话总结

  • 仪器读到的是物理量,屏幕上显示的是把这个物理量按人定的规则换算出来的分数。两者并不是一回事。
  • 能反复给出同一个数值(信度)与这个数值能代表真实皮肤状态(效度)是两个不同的问题,而到目前为止,证据主要积累在前者这一侧。
  • 所以皮肤检测仪与其说是判定某一时点的工具,不如说在相同条件下反复测量、追踪变化时才真正发挥作用。分数不是诊断,而是当天的测量记录。

皮肤检测仪实际上在测什么

仪器所做的事比想象中简单。在固定的照明下拍摄面部,或把探头贴到皮肤上读取物理量:角质层的电容、从皮肤表面蒸发的水分量、反射光的波长分布、表面凹凸投下的阴影。到这里为止是物理测量,这个阶段的仪器工作得相当稳定。

仪器读到的和屏幕上显示的并不相同

这里出现了一个需要区分的地方。仪器读到的是物理量,屏幕上显示的是按人定的规则把这个物理量换算之后的分数。数值总归由仪器读出,但这个数值算不算问题,则要按照某个人事先定下的标准来判断。我们在报告单上看到的,多半是后者。

  • 角质层的电容 — 换算为水分分数。电容本身是物理量,从多少分起算作不足,由规则来定。
  • 从皮肤表面蒸发的水分量 — 换算为与屏障相关的分数。它会随测量当时的室温与湿度一起变动。
  • 反射光的波长分布 — 换算为色素或红斑分数。照明一变,输入的数值也随之改变。
  • 表面凹凸投下的阴影 — 换算为毛孔或皱纹分数。阴影的深浅会因光线角度与面部位置而不同。

分数为何显得格外确定

换算的规则不会出现在报告单上。屏幕上只留下换算完成之后的值,并以两位数字或等级这类干脆利落的形式呈现。同样的意思,听到“看起来稍微偏干一些”和看到“水分 偏低等级”,分量感并不一样,这是很自然的事。数字本来就比判断更像事实。

所以读报告单时,往回退一步会有帮助。这个分数来自哪个物理量,那个物理量会因什么而波动,以及分数的分界线是谁依据哪个人群定下的。后两项多半不会出现在屏幕上,而真正决定解读的,往往正是这两项。

有些信息不会留在表面

测不到的东西也很明确。从什么时候开始的、擦了什么之后开始的、随季节如何变化,这些都不会留在表面。刚洁面还是三小时之后,数值也会不同,而屏幕上并不会标注这个前提。

所以一张报告单的性质,与一张照片颇为相似。它能准确记录那一刻的表面,却记录不了走到那一刻之前的经过。在寻找皮肤问题原因的工作里,后者往往才是关键。

反复测出同一个数值,就等于准确吗

评价测量仪器时,学界会把两件事分开来看。一个是信度,即反复测量同一对象时能否得出相同的数值。另一个是效度,即这个数值是否真的测到了想测的东西。名字相近容易混淆,但这是截然不同的两个问题。

用体温计来打比方

如果某支体温计每次测都显示36.0度,那它的信度是完美的,因为它每次都用同一把尺子给出数值。可是当一位实际体温38度的人也被显示为36.0度时,效度就不存在了。基准本身偏了,于是无法代表真实状态。可重复与准确是两回事。

结构效度这个说法的含义

在效度之中,结构效度是更严格一些的标准,因为它要问的是,测量值能否恰当地代表一个看不见的概念。肤质纹理、弹性、皮肤质量这些词我们日常都在用,但要把它们干脆地定义为某一个物理量并不容易。当想测的对象本身是多个要素的集合时,若要说其中某一项的测量值能代表整体,就需要另外的依据。

例如角质层的电容,测起来非常稳定。但这个数值是否能代表“这个人的皮肤很干”这一临床判断,则是另一个问题。电容反映的是角质层最表层的状态,而患者感受到的干燥,是屏障功能、炎症与神经反应性交织在一起的体验。

验证资料说明了什么

针对皮肤测量仪器的验证资料中,覆盖面最广的是Langeveld等人2022年发表于Skin Research and Technology的系统综述。该研究汇总了测量肤色、弹性与纹理的仪器的信度与效度,结论一句话说得很清楚。综述纳入的仪器中,没有一台能够按结构效度的标准判定为有效。

这句话并不是说仪器不靠谱。反复测量能得出相同数值的依据,已经在多个项目上积累起来;它更接近于说,这些数值能代表临床皮肤状态的依据尚未被满足。所以至少就目前的资料而言,把皮肤检测仪放在反复多次测量、追踪变化的位置上,比放在确定某一时点状态的位置上更合适。

各个项目吻合的程度并不一样

效度并不是对仪器整体给出一个统一评价。按项目来看,结果分歧不小。Cook等人2022年发表于Journal of Dermatological Treatment的验证研究,把基于平板的面部分析软件的判读与皮肤科专科医生的肉眼评估,在14项皮肤特征上进行了对照。整体一致率为69%,而各项目之间的差距相当可观。

项目 与专科医生肉眼评估的一致率 解读
红斑 83.7% 以反射光波长界定,定义较为明确
皱纹 81.6% 与阴影深浅的对应较为直接
整体平均 69% 合并14项特征之后的数值
油脂 53.1% 极易受触感与时间推移影响的项目

这些数值是特定研究中观察到的结果,并不能原样套用到所有仪器和所有人身上。不过其中的方向仍值得一读。

69%这个数字的实际含义

整体一致率69%,意味着大约十个项目里有七个,仪器与专科医生的判断指向同一个方向。反过来说,也意味着接近三分之一出现了分歧。这里重要的不是哪一方是正确答案,而是同一张报告单之中,也混杂着确信程度不同的项目。

所以我们看报告单时,不会把各项目一字排开地平读。红斑这类光学上容易捕捉的项目,参考权重放得高一些;油脂、水分这类受条件影响大的项目,则在与症状对照之后再作判断。即便是同一张报告单,事先明确哪一行该信到什么程度,解读才不会摇摆。

颜色与凹凸相对稳定的原因

反射光的波长分布和阴影的深浅,物理定义清晰,与人眼看到的泛红和沟纹深浅的对应也较为直接。在前面提到的Langeveld综述中,肤色项目的资料也比其他项目积累得更厚,达到11项研究、16种仪器、3,172名参与者的规模。若用途是记录并比较泛红的变化,仪器确有胜过人的记忆之处。

另一端是油脂

油脂是极易受触感与时间推移影响的项目。洁面后30分钟与三小时之后的表面状态并不相同;即便是同一片表面,指尖感受到的油腻与光学读到的反射,所承载的信息也不一样。所以在油脂这类对条件依赖度高的项目上,仪器与临床判断常常不太重合。同一张报告单之中,各项目也要以不同权重来读的原因就在这里。

不同仪器得出的分数难以并排比较

这一次是仪器之间相互对照的资料。同一研究团队2022年发表于Journal of Cosmetic Dermatology的仪器间比较研究中,两套面部分析系统判读的一致率为67.7%。也就是说,大约每三次判读就有一次出现分歧。

这个结果并不是在说哪一台仪器更好。更准确的理解是,对于测什么、按什么标准打分这件事,目前尚无共识。不同仪器测量的物理量本身可能就不同;即便读的是同一个物理量,换算成分数的规则也不一样。

在实际操作中意味着什么

  • 不把不同仪器的分数按时间顺序接在一起 — 拿上次A仪器的数值与这次B仪器的数值相比,读成“我的皮肤是不是变差了”,可能与实际情况不符。
  • 追踪的前提是同一台仪器 — 要读出变化的方向,尺子必须固定。尺子一换,就分不清是变化还是尺子的差异。
  • 比起分数的绝对值,相同条件下的差值更有信息量 — 比起今天是多少分,与三个月前相同条件下的数值相差多少,在临床上更有用。

另外,我们以诊疗记录与经过比较为目的使用拍摄和测量,从别处带来的报告单也会作为参考资料一并查看。只是当仪器不同时,我们不会直接比较分数,而是先询问那份报告单是在什么条件下得出的。

屏幕上的分数是与什么比较的结果

要打出分数,就得有比较的基准。知道这个基准从何而来,对读懂数字帮助很大。

Seo等人2022年发表于Journal of the European Academy of Dermatology and Venereology的横断面研究,以434名韩国人为对象,汇总8种仪器的测量值,提出了一套客观的分类体系。该研究给出的分界点,是把测量值分成三分位数之后的取值

三分位数意味着什么

三分位数表示的是,在这个人群中相对处在什么位置。把全体参与者按数值大小分成三块,再取边界处的数值作为分界点。因此很难认为另有一条固定的正常值或病理数值的界线。

所以水分分数落在偏低区间,含义是在参照人群中位置偏下,而不是需要治疗的状态。实际上同样的水分数值,对某些人来说低到会引发皮炎,对另一些人来说只是略偏干,反而痤疮更少、状态更舒服。数字相同,这个数字对那个人的意义却可能不同。

好、差这类等级标注也是同样的结构

报告单上常常会在数字之外一并标出好、一般、差这类等级。这个等级对应的是前面所说换算的最后一步:把测量值与分界点比较后划分区间,再给这个区间取个名字。所以标注为差并不是病理性的判定,而更接近于落进了分界点以下那个区间的标记

等级读起来比数字更斩钉截铁,误会也因此更容易产生。诊室里也常见某些项目被标注在偏下区间的结果,但仅凭这一个标注并不能决定治疗。处在同一区间,有人有症状、有人没有,而确认这个分野,最终靠的正是诊疗。

细胞层面的皮肤年龄仍处在暂缓判断的阶段

近来也有采集角质细胞、分析蛋白质指标并计算生物学皮肤年龄的服务,通过化妆品流通渠道被介绍出来。它看上去确实比表面照片更进了一步。

只是到目前为止,还没有研究讨论过这种方式的诊断效度。皮肤年龄这个概念本身也尚无公认的定义,选取哪些指标、组合几个,算出的数值就会不同,而组合方式通常并不公开。就现阶段而言,我们把它看作应当暂缓判断的阶段。比起报告单上的年龄数字,以当下有哪些症状为准来咨询更为实际。

同一张脸,结果却不一样的原因

如果说到这里谈的是哪些会出现分歧,接下来该看的就是为什么会分歧。原因不只在于仪器的性能。很多时候,测量条件所占的份量要大得多。

让水分与油脂类数值波动的条件

角质层与水分相关的指标会随以下因素变化。并不是其中哪一项特别反常,而是这类指标本来就会跟着这些因素一起动。

  • 洁面后经过的时间 — 刚洁面与三小时之后的数值,在同一张脸上也会读出差别。
  • 室内温度与湿度 — 从皮肤表面蒸发的水分量会直接受到周围环境影响。
  • 测量前刚涂过的产品 — 涂过保湿霜或防晒霜之后,表面状态本身已经不同。
  • 测量前的静置时间 — 进入室内马上测,和待上一会儿再测,条件并不相同。

明明有痤疮,报告单上却读成干性,也可以放在这个脉络里理解。刚洁面之后测,角质层的电容可能读得偏低;而表面油脂与角质层水分本来就是不同的指标。与其说仪器读错了,不如说更接近测量未能纳入的条件改变了结果解读这样一种情形。

让照片类数值波动的条件

表面拍摄方式也是一样。光线角度与面部位置只要稍有变动,阴影就会改变;阴影一变,毛孔与皱纹的判读也跟着移动。仪器之所以配备固定拍摄位置与照明的机制,原因也在这里。反过来说,没有遵守这套机制拍下的两张照片,很难成为彼此的比较对象。

拿到报告单时值得一并确认的事

在看数值之前先确认条件,解读会扎实得多。下面四项报告单上通常不会写,但记下来在诊疗时告诉我们,读数字时马上就能用上。

  • 大约几点、洁面后过了多久测的
  • 当天有没有涂过什么、测量前是否卸掉了
  • 进入室内之后过了多久才测的
  • 是否与上次测量使用同一台仪器、同一个部位

测哪个部位也是一个变量

Peperkamp等人2019年发表于Skin Research and Technology的信度研究,以49名参与者为对象,验证了某台仪器对皮肤厚度与弹性的测量。在弹性项目上,评估者间组内相关系数从0.23到0.80分布很广,重测组内相关系数则为0.25到0.84。

这两个数值是不同的指标。前者是换人来测时数值能保持多少,后者是在相同条件下再测一次时数值能保持多少,也就是重测一致性。重要的是两个指标的范围都很宽,意思是即便是同一台仪器,测的部位不同,有时是可信的测量、有时则不是。报告单上弹性那一行数值之所以难以直接当作治疗效果的依据,原因就在这里。

为什么问诊、视诊与触诊仍然是基准

诊室里首先做的,不是打开仪器先拍照,而是一边用眼睛看一边提问。这不是说不用仪器的判读,而是顺序与权重的问题。

我们会先问的几件事

  • 从什么时候开始的 — 是几天还是几个月,能想到的原因就不一样。
  • 洁面后大约几分钟开始觉得紧绷 — 以时间为单位的感受,比任何测量都更具体。
  • 随季节如何变化 — 我们要看的是有没有反复出现的规律。
  • 最近有没有换过产品 — 变化与时点的先后关系,正是在这里显现出来。

通过这些问题,除了此刻的样子之外,我们也一并确认随时间推移发生的变化。反复出现的经历、季节性波动、更换产品与变化之间的先后关系,都无法从某一时点的测量中获得。在寻找皮肤问题原因的工作里,这些关于时间的信息往往是关键。

用眼睛看、用手触摸的过程

视诊与触诊也起着同样的作用。脱屑的形态、皮肤的厚度感、按压后回弹的速度、表面的油脂感,是一次性综合判断出来的信息。它们处在被拆解成一个个分数之前的状态,所以当各项所见彼此矛盾时,这种矛盾本身有时就是线索。

表面泛着油光、指尖却摸到脱屑,就是这样的例子。这是表面油脂与角质层水分没有朝同一个方向变动的状态;可一旦被拆成两行分数显示出来,就容易让人以为其中一行是错的。实际上两行都没错,而这个组合本身往往正是在告诉我们,此刻皮肤里在发生什么

这并不是在说使用仪器的诊疗是错的

为免误会,有一点想先说清楚。这篇文章并不是要拿使用皮肤检测仪的诊疗来做文章。在记录、说明与经过比较上,仪器带来的好处很明确,我们自己也正是为此在使用。能和患者看着同一个屏幕交流,在诊疗中确实相当有用。

只是那个屏幕是判断的起点,还是站在确认并留存判断的位置上,这是另一个问题。到目前为止积累的验证资料,对后一种用法的支持要好于前一种。所以我们才把顺序这样安排,而这不是设备的问题,而是当前证据所到达位置的问题

归纳起来是这样。仪器用一把固定的尺子读此刻的表面,而问诊、视诊与触诊读的是时间的流动。这两类信息不是替代关系,而更接近先后关系。所以诊疗在前,仪器的判读放在确认并记录这个判断的位置上。

那么仪器什么时候用才合适

把上面的内容反过来看,皮肤检测仪的位置反而更清楚了。说存在不太合适的用法,也就意味着存在合适的用法。

  • 治疗经过的追踪 — 对同一个人、用同一台仪器、在相同条件下反复测量,那么无论测量值本身的绝对准确度如何,变化的方向都能读出来。因为每次重复时套用的是同一把尺子。
  • 记录 — 单凭记忆去比较三个月前的泛红很难,但留成图像就可行。尤其在红斑这类光学上读得比较稳定的项目上更为有用。
  • 说明 — 为什么现在要加强保湿、为什么这一次间隔拉开一些更好,与其只用言语传达,不如一起看着同一个屏幕说明来得清楚。

例如用V-Beam或LDM处理泛红的经过、用PDT或Gold PTT调整痤疮状态的经过,这类随时间一点一点发生的变化,相同条件下的图像确实帮得上忙。眼睛也看得出来,只是间隔太长,单凭记忆难以比较。不过即便在这种时候,仪器决定的也不是次数或项目,而是经过正在朝哪个方向走

反过来不太推荐的用法

就是用一次测量值确定皮肤状态,或以那个数字为依据决定治疗项目。以上面梳理的证据来看,很难支持这种用途。如果因为报告单上某个项目被标注为偏低,就自动跟出一项针对该项目的治疗,那么更建议再确认一次当下实际有哪些症状。

若以追踪为目的,先把条件对齐

  • 用同一台仪器 — 固定尺子是第一步。
  • 让洁面后经过的时间接近 — 与上次测量对上同样的时间点,比较起来会容易得多。
  • 卸妆之后静置一会儿 — 留出适应室内环境的时间,在一致性上更好。
  • 测同一个部位 — 部位一变,信度本身就可能改变。

以追踪为目的时,把条件对齐与仪器性能同样重要。条件一旦摇摆,再好的仪器也难以做出可供比较的数值。

间隔也一并定下来会更好。测得太频繁,条件差异带来的波动会看起来像变化;测得太稀疏,又缺少读出方向的落点。合适的间隔会随所处理的问题而不同,所以在第一次测量时就把下一次的时间点一起定好,实际上最省事。这时候比较的对象也不是紧挨着的那一个数值,而是把多个时点连起来的走势

测量之前值得先了解的事

皮肤测量本身并不是有创操作,不过在探头接触的方式下,可能会留下一时的刺激感或压痕。皮肤处于敏感状态或有急性炎症时,把测量往后推一推更好。另外也请不要以测量结果为依据自行判断而中断或更改治疗。

文中引用的研究在样本量、测量部位与对象人群上都有限,尤其以面部部位为对象的验证资料尚未充分积累。今后的研究可能使解读发生变化。皮肤状态与测量值会因个人的皮肤条件、测量环境与仪器种类而呈现不同,存在个体差异。

最后

皮肤检测仪屏幕上显示的分数,不是诊断,而是当天的测量记录。只看今天这一个分数,意义并不大。可是把它和三个月后在相同条件下重新测得的数值并排放在一起,情况就不同了。从那时起,这个数字就不再是判定而成了追踪,而追踪在决定治疗方向时确实用得上。

还想再说一点,比起屏幕上的分数,您自己感受到的症状更靠前。洁面后几分钟开始紧绷、哪个季节会加重、用了哪款产品之后发生了变化,把这些记下来告诉我们,就会成为比任何仪器都有用的信息。仪器,请把它看作用来确认并记录这些叙述的工具。

从面诊到治疗

由皮肤科专科医生亲自面诊,确认问题所在的层次,确定设备与参数,之后由同一位专科医生接着完成治疗。这里不是由咨询顾问来推荐治疗的结构。

次数、间隔、维持的时间点与费用,都在第一次治疗之前一起确定。

常见问题

测量时探头会贴在皮肤上,会有刺激吗?
皮肤测量本身并不是有创操作。不过在探头接触的方式下,可能会留下一时的刺激感或压痕。皮肤处于敏感状态或有急性炎症时,把测量往后推一推更好。个体差异是存在的,如果有不适,请在测量前告诉我们。
不用仪器、只用眼睛看,是不是更准确?
这并不是哪一方取代哪一方的事。仪器用一把固定的尺子读此刻的表面,而问诊、视诊与触诊读的是时间的流动。反复出现的经历、季节性波动、更换产品前后的关系,很难从某一时点的测量中获得,所以面诊在前,仪器的判读放在确认并记录这个判断的位置上。
别的地方说我是干性,这里的说法却不一样。哪一边是对的?
与其说哪一边错了,不如说可能有测量没能纳入的前提。刚洁面之后测,角质层的电容可能读得偏低;而表面油脂与角质层水分本来就是不同的指标。所以我们会先问从什么时候开始、洁面后大约几分钟开始紧绷,再结合眼睛看到的样子一起判断。
弹性数值和上次不一样了。是治疗没有效果吗?
这是仅凭一个数值难以下结论的项目。一项以49名参与者为对象、验证皮肤厚度与弹性测量的研究中,弹性项目的评估者间组内相关系数从0.23到0.80,重测组内相关系数从0.25到0.84,分布都很宽。也就是说,即便是同一台仪器,测哪个部位不同,有时是可信的测量、有时则不是。经过我们会把症状、照片与诊疗所见放在一起看,而不是只看一行数值。
照片上说我的毛孔比上次多了。真的变多了吗?
建议先确认拍摄条件。表面拍摄方式只要光线角度与面部位置稍有变动,阴影就会改变;阴影一变,毛孔与皱纹的判读也跟着移动。仪器之所以配备固定拍摄条件的机制,原因正在于此。只有在相同条件下拍摄的图像之间作比较,才谈得上读出变化。
既然红斑吻合得好,油脂为什么差那么多?
越是容易在物理上定义的项目,仪器与人的判断越容易重合。反射光的波长分布与阴影的深浅定义清晰,与肉眼看到的泛红和沟纹深浅的对应也较为直接。而油脂则极易受触感与时间推移影响,更接近一张照片难以承载的那一类。
医生说我的水分分数处在偏低区间。这是需要治疗的状态吗?
偏低这个说法,多半是指在参照人群中位置偏下。一项以434名韩国人为对象、汇总8种仪器测量值并提出分类体系的研究,其分界点同样取自把测量值分成三分位数之后的取值。很难认为另有一条固定的正常值或病理数值的界线。同样的水分数值,在有些人身上会引发皮炎,在另一些人身上则没什么问题,所以要和症状放在一起看才谈得上判断。
皮肤年龄测出来比实际年龄大。需要担心吗?
皮肤年龄目前还是一个在学术上尚无公认定义的概念。选取哪些指标、组合几个、如何组合,算出的数值就会不同,而组合方式通常并不公开。以角质细胞的蛋白质指标计算生物学皮肤年龄的方式,也还没有研究讨论过它的诊断效度,因此处在暂缓判断的阶段。比起报告单上的数字,以当下有哪些症状为准来咨询更为实际。
测量之前需要做什么准备吗?
可以的话,请把洁面后经过的时间与室内环境,调整到与上次测量相近。卸妆之后静置一会儿再测,在一致性上更好。如果目的是追踪,把条件对齐与仪器性能同样重要。
那是不是干脆不要做皮肤检测更好?
倒不至于如此。如果用途是用同一台仪器、在相同条件下反复测量并追踪变化,它是足够有用的。只是如果一次拍摄的结果就确定了皮肤类型、或直接定下治疗项目,那么建议再把当下有哪些症状说一说。
同一天在两个地方测,结果差别很大。是机器坏了吗?
更可能不是坏了。一项对照两套面部分析系统判读的研究报告,其一致率为67.7%。不同仪器的测量方式与换算成分数的规则都不一样,数值出现分歧反而更自然。所以我们不建议把不同仪器的分数并排放在一起,据此读出变好了还是变差了。
报告单上油脂偏高,可我总觉得干。到底哪一边是对的?
两个结果很可能在测不同的东西。表面油脂量与紧绷感是不同的指标,表面带着油光而角质层偏干的状态并不少见。测量的时点也有影响,离上一次洁面过了多久,数值就会不同。把您实际感受到的症状在面诊时告诉我们,对判断的帮助要大得多。
活动公告与活动
预约快速预约
微信able_derm
Instagram@ableclinic_official
交通指南首尔 松坡区