Editor original– Judy Scopes como parte del World Physiotherapy Network for Amputee Rehabilitation Project
Principales colaboradores – Sheik Abdul Khadir, Lucy Aird, Admin, Tarina van der Stockt, Kim Jackson, Simisola Ajeyalemi, Lauren Lopez y Rachael Lowe
Las medidas de resultados pueden utilizarse con fines muy diversos. Una medida predictiva debe ser capaz de clasificar a las personas según un conjunto de categorías predefinidas, ya sea de forma concurrente o prospectiva; por ejemplo, si una persona amputada utilizará una prótesis con éxito (1) (2). Detectar diferencias entre personas o grupos demuestra el valor discriminativo de una medida de resultados, por ejemplo, poder determinar las diferentes capacidades de una persona amputada transtibial o transfemoral o las diferencias entre componentes protésicos a partir de las puntuaciones o los tiempos registrados. (3)
Mientras que una medida evaluativa debe ser capaz de detectar cambios, normalmente a lo largo de un periodo de tiempo en un individuo o grupo. Una medida de resultado evaluativa también puede detectar los cambios que se producen tras algún tipo de intervención, por ejemplo, un programa terapéutico(4) o el suministro de un componente protésico. Algunas medidas de resultados están diseñadas para hacer sólo una de las cosas anteriores, mientras que otras pueden hacer una combinación, aunque algunos de los criterios de estos diferentes tipos de medidas de resultados compiten entre sí. (5) Sea cual sea el propósito para el que se diseñe, las propiedades psicométricas de la medida de resultado deben notificarse para que el usuario quede satisfecho de que es adecuada para la población con la que desea utilizarla. (6)
Las propiedades psicométricas de una medida de resultados son las características que expresan su adecuación en términos de fiabilidad, validez y sensibilidad. Otro término utilizado a menudo es el de propiedades clinimétricas. Aunque se desarrolló a partir de orígenes similares a los de la psicometría, la clinimetría se ha descrito como la práctica de evaluar o describir síntomas, signos y hallazgos de laboratorio mediante escalas, índices y otros instrumentos cuantitativos, todos los cuales deben tener propiedades psicométricas adecuadas. (7) (8)
En las fases iniciales de la rehabilitación es importante utilizar medidas de resultados que ayuden a predecir la capacidad que tendrá un paciente para caminar con una prótesis y a determinar qué componentes protésicos serían los mejores para el paciente.(9)
Si estás pensando en utilizar una medida de resultados con una persona amputada, merece la pena que te plantees las preguntas que se plantean en la página de medidas de resultados aquí en la Physiopedia (Guide to Selecting Outcome Measures). Como mínimo, deberías plantearte estas preguntas pensando en tu paciente o grupo de pacientes amputados.
¿Por qué utilizo una medida de resultados?
¿Qué quiero medir?
Cuando tengas en mente una medida de resultados, también debes considerar estas preguntas.
¿Se han medido las propiedades clinimétricas de la medida de resultados que estoy considerando en una población similar a la mía?
He aquí algunos ejemplos de estudios en los que se han descrito las propiedades clinimétricas, a veces llamadas psicométricas, en una población de personas amputadas y lo que los resultados pueden indicarte.
La fiabilidad suele medirse mediante los coeficientes de correlación intraclase (CCI) y se presenta como un número comprendido entre 0 (ausencia de concordancia) y 1 (concordancia total). (10)
Fiabilidad intra-evaluador: Indica la consistencia con la que un evaluador administra y puntúa una medida de resultado.
Fiabilidad inter-evaluador: Indica hasta qué punto coinciden dos evaluadores en la forma de administrar y puntuar una medida de resultado.
Fiabilidad test-retest: Si una persona completa un cuestionario autoinformado y luego repite el cuestionario en una segunda ocasión en la que no se espera ningún cambio, los resultados deberían ser similares.
Error de medición: Se trata del grado en que las puntuaciones o calificaciones son idénticas independientemente de quién realice o puntúe la prueba, y puede notificarse utilizando el error estándar de medida (EEM) o el mínimo cambio detectable (MCD). (12)
Consistencia interna: Esta propiedad de fiabilidad se reserva para las medidas de resultados diseñadas para evaluar un solo concepto. La consistencia interna evalúa hasta qué punto todos los ítems o preguntas de una medida de resultados abordan el mismo concepto subyacente, por ejemplo, en una escala de movilidad, todos los ítems deberían tratar sobre la movilidad (5).
Existen dos métodos principales para informar sobre la consistencia interna. La teoría clásica de los tests utiliza el alfa de Cronbach (α) para indicar la fiabilidad de una medida de resultados en su conjunto. Y la teoría de respuesta al ítem utiliza el análisis de Rasch para evaluar la consistencia interna observando cada ítem dentro de la medida de resultado. (15).
Validez de contenido: Es el grado en que el contenido de una medida de resultados es un reflejo adecuado del constructo o concepto que se pretende medir (5). Suele considerarse y acordarse por consenso de un grupo de expertos clínicos y puede y debe incluir a representantes de los pacientes. Por ejemplo, un instrumento que mida la limitación de la actividad en jóvenes atletas debería incluir no sólo la marcha, sino también la carrera, el salto y la escalada.
Validez estructural: Se refiere al grado en que las puntuaciones de una medida de resultado son un reflejo adecuado de la dimensión o factor del constructo que se mide. (5) Puede medirse realizando un análisis factorial cuyo resultado demuestre que si >50% de los datos se refieren a un factor, esto confirma que la medida de resultado está midiendo un factor / dimensión. Cualquier cifra inferior indica que se está evaluando más de un factor. El análisis de Rasch también puede utilizarse cuando el resultado mide la unidimensionalidad, es decir, si mide uno o más factores o dimensiones.
Validez de constructo: Es el grado en que las puntuaciones de una medida de resultados son coherentes con hipótesis predefinidas (a priori) que esbozan relaciones con las puntuaciones de otros instrumentos, o diferencias entre grupos. Si > 75% de las hipótesis se demuestran, esto indica una buena validez. (19) .
También puede denominarse: Validez concurrente – mostrar la capacidad de distinguir entre grupos (por ejemplo, amputados de miembros inferiores mayores y jóvenes), lo que suele medirse mediante la comprobación de hipótesis, o; Validez convergente – mostrando que las medidas que deberían estar relacionadas lo están, lo que también puede medirse utilizando el coeficiente de correlación intraclase (CCI), valores altos indicando una buena validez.
Por lo tanto, se demostró que el L test era capaz de discriminar entre todos los grupos según la hipótesis planteada. (13)
Validez de criterio: Es el grado en que las puntuaciones de una medida de resultados son un reflejo adecuado de una medida de referencia. Sin embargo, hay muy pocas situaciones en la rehabilitación en las que exista una medida de referencia. Si no se dispone de una medida de referencia, puede ser conveniente probar relaciones hipotéticas con medidas de comparación.
La estimación de la validez de criterio depende del tipo de datos. Las correlaciones intraclase se utilizan si ambos instrumentos (instrumento de resultado y comparador) tienen puntuaciones continuas (por ejemplo, tiempo, distancia, etc.) y los resultados deben ser preferiblemente superiores a 0,70. Si el instrumento de resultado tiene una puntuación continua pero el comparador tiene una puntuación dicotómica (por ejemplo, Sí / No), el área bajo la característica operada por el receptor (ROC, por sus siglas en inglés) es el método de preferencia. De nuevo, se sugiere un criterio de 0,70 (19).
La sensibilidad interna es la capacidad de una medida para cambiar a lo largo de un periodo de tiempo determinado. Dependerá de la población concreta que se estudie, del tratamiento o intervención que tenga lugar durante el periodo de tiempo y de la medida de resultado utilizada para determinar cualquier cambio (5).
El tamaño estándar del efecto es la diferencia entre las puntuaciones medias basales y las de seguimiento, dividida por la desviación estándar (DE) basal. Si hay una gran variabilidad en las puntuaciones iniciales en relación con las puntuaciones medias de cambio, el tamaño del efecto será pequeño y la capacidad de la medida de resultado para detectar cambios significativos también será pequeña. Un efecto pequeño será de 0,2, lo que representa un cambio de aproximadamente 1/5 de la DE basal; 0,5 se considera moderado y cualquier efecto superior a 0,8, o un cambio de al menos 4/5 de la DE basal, se considera grande. (22) .
La paired-t-test es una prueba estadística que puede utilizarse para detectar el cambio en las puntuaciones medias en dos momentos, pero depende del tamaño de la muestra y de la variabilidad/fiabilidad de la medida de resultado utilizada(15).
En un estudio de Devlinet y col (2004), el tamaño del efecto calculado para el cambio en las puntuaciones medias de la escala de Houghton, desde el alta hasta el seguimiento, fue de 0,60, lo que indica una diferencia moderada(23).
Otras consideraciones (medidas de resultados) pueden entrar en juego a la hora de decidir qué medida de resultados utilizar:
Consideraciones financieras:
Aplicación del terapeuta:
Recursos:
Paciente:
Medidas de resultados informadas por el paciente (PROM):
Antes de utilizar una medida de resultados, recuerda tener en cuenta las preguntas anteriores.
Las siguientes medidas de resultados están incluidas en la versión más reciente (2014) de la British Association of Chartered Physiotherapists in Amputee Rehabilitation (BACPAR) Outcome Measures Toolbox.
Las medidas de resultado enumeradas anteriormente pueden utilizarse con personas amputadas con un alto nivel de actividad, pero debe tenerse en cuenta que pueden observarse efectos techo, es decir, que la persona amputada alcanzará puntuaciones máximas cuando se utilicen escalas ordinales, ya sean observadas o autoinformadas.
Se desarrolló el Comprehensive High-Level Activity Mobility Predictor (CHAMP, por sus siglas en inglés) para evaluar a los pacientes con pérdida de extremidades que necesitan volver a realizar actividades de alto nivel. Se comprobó que esta medida de resultados era segura y fiable con militares heridos en el Centro Médico Walter Reed, con alta nivel de movilidad y amputaciones traumáticas de miembros inferiores. (25)
Una revisión narrativa fue llevada a cabo por el BACPAR Outcome Measures Project Group, que analiza las pruebas científicas para el uso de medidas de resultados para amputados de miembros inferiores en la fase aguda o preprotésica. La revisión se presentó en la Spring 2014 BACPAR Journal bacpar.csp.org.uk/. Una búsqueda en MEDLINE, CINAHL y PsychINFO en mayo de 2013 utilizando términos de búsqueda como «Acute Care» y «Outcome Measures» con «Lower-limb Amputees» OR «Lower-limb Amputation» dio como resultado un total de 26 artículos que, tras la selección, produjeron dos artículos que merecían una lectura adicional. De estos artículos sólo se identificó la Medida de independencia funcional (MIF) como de interés potencial y se realizó una búsqueda adicional añadiendo el título específico de la MIF. Aunque hay pruebas de que la MIF se utiliza en la fase aguda y/o de rehabilitación temprana con las personas amputadas de miembros inferiores y puede demostrar una mejora entre el ingreso y el alta, las pruebas eran débiles. No hubo pruebas de que la puntuación total de la MIF fuera eficaz como herramienta de predicción, pero en un estudio se observó una buena correlación entre la subescala motora y el resultado protésico.
Cuando se actualizó la «caja de herramientas» en octubre de 2014, se decidió no incluir la MIF ni ninguna otra medidas de resultados específicas en la «caja de herramientas» para esta población, ya que las pruebas actuales no eran lo suficientemente sólidas. Las demás medidas de resultados incluidas en la «caja de herramientas» tenían todas buenas pruebas con tamaños de muestra más grandes. Además, la MIF requiere formación antes de utilizarla y se recomienda como herramienta multidisciplinar, por lo que no se ajusta a los criterios de «fácil de usar».