V. Epidemiología Experimental y Clínica · Capítulo V.2

Validez de Pruebas Diagnósticas

Ninguna prueba diagnóstica es perfecta: cuantificar su desempeño es lo que permite decidir cuándo confiar en un resultado y cuándo desconfiar de él.

~28 min de lectura

1. La tabla 2x2 diagnóstica

Toda evaluación de una prueba diagnóstica parte de compararla contra un estándar de referencia (gold standard) — la prueba de diagnóstico definitivo aceptada para esa enfermedad — en una misma serie de sujetos:

Enfermo (estándar +)Sano (estándar −)
Prueba positivaa (verdadero positivo)b (falso positivo)
Prueba negativac (falso negativo)d (verdadero negativo)

2. Sensibilidad y especificidad

La sensibilidad es la capacidad de la prueba para detectar correctamente a quienes realmente tienen la enfermedad — la proporción de verdaderos positivos entre todos los enfermos:

Sensibilidad = a ÷ (a + c)

La especificidad es la capacidad de la prueba para descartar correctamente a quienes realmente no tienen la enfermedad — la proporción de verdaderos negativos entre todos los sanos:

Especificidad = d ÷ (b + d)

Ambas son propiedades intrínsecas de la prueba: en teoría, no dependen de qué tan frecuente sea la enfermedad en la población donde se aplique la prueba (aunque en la práctica pueden variar según el espectro de gravedad de los casos estudiados).

Ejemplo — validez de un urocultivo rápido frente al urocultivo estándar: en un estudio que compara un método diagnóstico rápido de infección urinaria contra el urocultivo tradicional (estándar de referencia) en una serie de pacientes con sospecha clínica de infección urinaria, se construye la tabla 2x2 y se calculan sensibilidad y especificidad a partir de los verdaderos/falsos positivos y negativos observados. El ejercicio ilustra el procedimiento estándar: primero identificar cuál de las dos pruebas es el "gold standard" (el urocultivo tradicional), y luego evaluar el desempeño del método nuevo contra ese estándar — el mismo procedimiento se aplica a cualquier prueba diagnóstica nueva que se quiera validar (radiografía frente a tomografía, test rápido frente a PCR, etc.).

3. Valores predictivos

Mientras que sensibilidad y especificidad responden "si sé que el paciente está enfermo/sano, ¿qué tan bien lo detecta la prueba?", los valores predictivos responden la pregunta clínicamente más relevante en la práctica diaria: "tengo un resultado de la prueba, ¿qué tan probable es que sea correcto?".

Valor predictivo positivo (VPP) = a ÷ (a + b)

Valor predictivo negativo (VPN) = d ÷ (c + d)

¿Por qué los valores predictivos, a diferencia de la sensibilidad y la especificidad, sí dependen de la prevalencia de la enfermedad? El VPP y el VPN se calculan sobre las columnas de resultado de la prueba (todos los positivos, todos los negativos), y esas columnas mezclan enfermos y sanos en una proporción que refleja directamente cuán frecuente es la enfermedad en la población estudiada. Si la misma prueba, con la misma sensibilidad y especificidad fijas, se aplica en una población donde la enfermedad es muy rara, la mayoría de los resultados positivos serán falsos positivos simplemente porque hay muchísimos más sanos que enfermos a quienes "confundir" — el VPP cae. Si se aplica en una población de alta prevalencia (por ejemplo, un servicio de referencia donde la sospecha clínica ya es alta), el VPP sube considerablemente con la misma prueba. Esta es la razón práctica por la cual una prueba diagnóstica se interpreta de forma diferente según el contexto clínico donde se aplica.

4. Razones de verosimilitud

Las razones de verosimilitud (likelihood ratios) combinan sensibilidad y especificidad en un solo índice que, a diferencia del VPP/VPN, no depende de la prevalencia, y permite actualizar directamente la probabilidad pre-prueba de enfermedad de un paciente individual.

Razón de verosimilitud positiva (LR+) = Sensibilidad ÷ (1 − Especificidad)

Razón de verosimilitud negativa (LR−) = (1 − Sensibilidad) ÷ Especificidad

Una LR+ alta (convencionalmente, mayor a 10) hace que un resultado positivo aumente considerablemente la probabilidad de enfermedad; una LR− baja (menor a 0,1) hace que un resultado negativo la disminuya considerablemente. Valores de LR cercanos a 1 indican que la prueba aporta poca información adicional.

5. Curvas ROC y el punto de corte

Cuando una prueba diagnóstica se basa en una variable continua (una concentración de laboratorio, un puntaje), es necesario elegir un punto de corte que separe "positivo" de "negativo". Ese punto de corte determina el equilibrio entre sensibilidad y especificidad: bajarlo aumenta la sensibilidad (se detectan más enfermos) a costa de la especificidad (más falsos positivos), y subirlo hace lo inverso.

La curva ROC (Receiver Operating Characteristic) grafica la sensibilidad (eje "y") contra 1−especificidad (eje "x") para todos los puntos de corte posibles, permitiendo visualizar ese equilibrio y elegir el punto de corte más apropiado según el uso clínico previsto de la prueba. El área bajo la curva (AUC) resume el desempeño global de la prueba en un único número entre 0,5 (equivalente al azar) y 1 (discriminación perfecta).

Trampa de examen: sensibilidad y especificidad son propiedades de la prueba y no cambian con la prevalencia; VPP y VPN sí cambian con la prevalencia aunque la prueba sea exactamente la misma. Un error frecuente es citar el VPP de un estudio como si fuera aplicable directamente a cualquier otra población, ignorando que su población de origen tenía una prevalencia distinta de la enfermedad.

6. Puntos clave

  • Sensibilidad = a/(a+c) (detecta enfermos); especificidad = d/(b+d) (descarta sanos) — propiedades intrínsecas de la prueba, no dependen de la prevalencia.
  • VPP = a/(a+b); VPN = d/(c+d) — sí dependen de la prevalencia de la enfermedad en la población estudiada.
  • Razones de verosimilitud (LR+, LR−): combinan sensibilidad/especificidad, no dependen de la prevalencia, permiten actualizar la probabilidad pre-prueba de un paciente individual.
  • Curva ROC: sensibilidad vs. 1−especificidad para todos los puntos de corte; AUC resume el desempeño global (0,5=azar, 1=perfecto).