Автор – Judy Scopes у рамках Проєкту Всесвітньої фізіотерапевтичної мережі з реабілітації осіб з ампутованими кінцівками
Провідні автори – Sheik Abdul Khadir, Lucy Aird, Адміністратор, Tarina van der Stockt, Kim Jackson, Simisola Ajeyalemi, Lauren Lopez and Rachael Lowe
Критерії оцінювання ефективності можна використовувати для різних цілей. Прогнозоване оцінювання призначене для класифікації осіб відповідно до набору попередньо визначених категорій одночасно або перспективно, наприклад, чи успішно користуватиметься протезом особа з ампутованими кінцівками. (1) (2) Виявлення відмінностей між особами або групами осіб свідчить про диференційне значення критерію оцінювання, наприклад, можливість визначити різні здібності транстібіальної та трансфеморальної ампутації або відмінності між протезними компонентами на підставі набраних балів або зафіксованого часу. (3)
Однак оціночний показник повинен бути спрямований на виявлення змін зазвичай протягом певного періоду в окремої особи або групи осіб. Оціночний показник результативності може також виявляти зміни, що відбуваються після будь-якого втручання, наприклад, після терапії (4) або забезпечення протезом. Деякі показники результативності призначені для досягнення лише одного з вищезгаданих критеріїв, у той час як інші можуть поєднувати декілька, незважаючи на те, що деякі з вимог до цих різних типів показників результатів є конкуруючими. (5) Незалежно від того, для якої мети він розроблений, психометричні властивості інструменту оцінювання необхідно повідомити, щоб переконати користувача, що він відповідає своєму призначенню для населення, для якого він використовуватиметься. (6)
Психометричні властивості інструменту оцінювання – це характеристики, які виражають його адекватність з точки зору надійності, валідності та чутливості. Також часто використовується інший термін – клініметричні властивості. Клініметрія, хоч і розвивалася з тих самих джерел, що й психометрія, проте описується як практика оцінювання або опису симптомів, проявів та клінічних даних за допомогою шкал, індексів та інших кількісних інструментів, які повинні мати належні психометричні властивості. (7) (8)
На початкових етапах реабілітації важливо використовувати критерії оцінювання, які допомагають передбачити здатність пацієнта ходити з протезом і визначити, які компоненти протеза будуть найкращими для пацієнта.(9)
Якщо ви збираєтеся використовувати критерії результативності для пацієнта з ампутованою кінцівкою, вам слід звернутися до питань, викладених на сторінці “Критерії оцінювання ефективності” на сайті Physiopedia (Guide to Selecting Outcome Measures). Принаймні ви повинні розглянути ці питання, орієнтуючись на конкретного пацієнта або групу пацієнтів з ампутованими кінцівками.
Чому я використовую критерій оцінювання ефективності?
Що саме я маю намір виміряти?
Незважаючи на те, що ви можете знати критерій оцінювання ефективності, вам також слід обміркувати наступні питання.
Чи вимірювалися клініметричні властивості показника результативності, який я розглядаю, у популяції, подібної до моєї?
Ось кілька прикладів досліджень, у яких клініметричні, іноді звані психометричними, властивості були виявлені у популяції людей з ампутованими кінцівками, про що вам можуть розповісти отримані результати.
Надійність зазвичай вимірюється внутрішньокласовими коефіцієнтами кореляції (ВКК) і подається як число від 0 (немає відповідності) до 1 (повна відповідність). (10)
Внутрішньорейтерна надійність: показує, наскільки послідовно експерт застосовує та оцінює показник результативності.
Міжрейтерна надійність: показує, наскільки добре два експерти згодні з тим, як вони застосовують та оцінюють показник результативності.
Тест-ретест надійність: якщо особа заповнює опитування для власного звіту, а потім повторює опитування вдруге, коли не очікується жодних змін, результати мають бути подібними.
Помилки у вимірюваннях: це ступінь, до якого бали або рейтинги є ідентичними незалежно від того, хто виконує або оцінює тест, і можуть бути повідомлені за допомогою стандартної помилки вимірювання (СПМ) або мінімальної виявленої зміни (МВЗ), яка є такою ж, як найменша виявлена зміна (НВЗ).(12)
Внутрішня відповідність: ця властивість надійності призначена для критеріїв оцінювання, розроблених для перевірки лише однієї концепції. Внутрішня відповідність оцінює, наскільки всі пункти або питання в системі вимірювання результатів стосуються однієї і тієї ж базової концепції, наприклад, у шкалі мобільності всі пункти мають бути пов’язані з мобільністю. (5)
Є два основні методи, які використовуються для звіту про внутрішню відповідність. Теорія класичного тесту використовує альфа Кронбаха (Cronbachs alpha, α), щоб визначити надійність показника результативності в цілому. Відповідно до теорії “Завдання-Відповідь” (Item Response Theory, IRT) для оцінки внутрішньої відповідності використовується аналіз Rasch, який розглядає кожен елемент у рамках підсумкового показника. (15).
Змістовна валідність: це ступінь, до якого зміст інструмента оцінювання є адекватним відображенням конструкції або концепції, що підлягає вимірюванню (5). Зазвичай розглядається та погоджується на основі згоди експертної групи клініцистів, до якої можуть і повинні входити представники пацієнтів. Наприклад, інструмент для вимірювання обмеження активності у молодих спортивних людей повинен включати не тільки ходьбу, але також біг, стрибки та лазання.
Структурна валідність: стосується ступеня, до якого бали інструменту оцінювання є адекватним відображенням розміру або фактора конструкції, що вимірюється. (5) Її можна виміряти шляхом проведення факторного аналізу, результат якого показує, що > 50 % даних належать до одного фактора, це підтверджує, що критерій оцінювання вимірює один фактор/вимір. Найменше значення вказує на те, що оцінюється більше одного фактора. Rasch-аналіз може також використовуватися у випадках, коли результат вимірює одновимірний показник, тобто вимірює один або кілька факторів чи параметрів.
Конструктивна валідність: це ступінь, у якій результати дослідження відповідають заздалегідь визначеним (апріорним) гіпотезам, які описують взаємозв’язок із результатами інших інструментів чи відмінності між групами. Якщо >75 % гіпотез доведено, це свідчить про гарну валідність (19) .
Вона також може називатися: Конкурентна валідність – демонстрація здатності розрізняти групи (наприклад, літніх та молодих людей з ампутованими нижніми кінцівками), що часто вимірюється шляхом перевірки гіпотез, або: Конвергентна валідність – показує, що показники, які мають бути пов’язані, дійсно пов’язані, що також може бути виміряно за допомогою внутрішньокласового коефіцієнта кореляції (ВКК), високі значення якого вказують на хорошу валідність.
Таким чином, було продемонстровано, що L-тест здатний розрізнити всі групи згідно з гіпотезою. (13)
Валідність за критерієм: це ступінь, до якого бали, отримані під час вимірювання результату, є адекватним відображенням “золотого стандарту”. Однак у реабілітації дуже мало ситуацій, де існує такий золотий стандарт тесту. Якщо золотий стандарт недоступний, можливо доцільно перевірити гіпотетичні взаємозв’язки за допомогою порівняльних показників.
Оцінка валідності за критерієм залежить від типу даних. Внутрішньокласові кореляції використовуються, якщо обидва інструменти (інструмент оцінювання і той, з яким порівнюють) мають безперервні бали (наприклад, час, відстань тощо), а результати бажано перевищують 0,70. Якщо інструмент оцінювання має безперервну шкалу, а інструмент, що порівнюється, має дихотомічну шкалу (наприклад, так / ні), то кращим методом є робоча характеристика приймача (receiver operated characteristic (ROC). Знову ж таки, пропонується критерій 0,70 (19).
Внутрішня чутливість – це здатність показника змінюватися за певний проміжок часу. Це буде залежати від конкретної досліджуваної популяції, терапії або втручання, які проводяться протягом цього періоду часу, і показника результативності, що використовується для визначення будь-яких змін. (5)
Стандартний показник ефективності – це різниця між середніми вихідними балами і балами після спостереження, поділена на базове стандартне відхилення (SD). Якщо існує велика різниця у вихідних балах по відношенню до середніх показників змін, то ефект буде невеликим, і здатність показника результативності виявити значні зміни також буде невеликою. Невеликий ефект становитиме 0,2, що означає зміну приблизно на 1/5 базового SD, 0,5 вважається помірним, а все, що перевищує 0,8, або зміна принаймні 4/5 базового SD вважається великим. (22) .
Парний t-тест – це статистичний тест, який можна використовувати для виявлення зміни середніх балів у двох точках часу, але він залежить від розміру вибірки та валідності/чутливості обраного інструменту вимірювання результативності.(15).
У дослідженні Devlinet al (2004) розмір ефекту, розрахованого для зміни середніх балів за шкалою Houghton від виписки до подальшого спостереження, становить 0,60, що вказує на помірну різницю.(23).
При ухваленні рішення про те, який показник результативності використати, можуть з’явитися й інші аспекти (інструменти оцінювання):
Фінансові питання:
Залучення терапевта
Ресурси
Клієнт
Результати, про які повідомляють пацієнту (PROQ)
Перш ніж використовувати інструмент оцінювання, не забудьте розглянути питання, зазначені вище.
Наступні критерії оцінювання ефективності включені до останньої версії (2014) Інструментарій показників результативності Британської асоціації дипломованих фізичних терапевтів з реабілітації людей з ампутованими кінцівками (BACPAR).
Наведені вище критерії оцінювання ефективності можуть бути використані при роботі з пацієнтами з ампутованими кінцівками з високим рівнем активності, але слід зазначити, що може спостерігатися ефект граничного значення, тобто пацієнт досягне максимальної кількості балів при використанні порядкових шкал, чи то як результату спостереження, чи то як показнику самостійних вимірювань.
Комплексний прогноз високого рівня активності (Comprehensive High-Level Activity Mobility Predictor, CHAMP) був розроблений для оцінювання пацієнтів із втратою кінцівок, які потребують повернення до високої активності. Цей показник був визнаний безпечним та надійним для поранених військовослужбовців Walter Reed Medical Center з високим рівнем мобільності та травматичними ампутаціями нижніх кінцівок. (25)
Наративний огляд, проведений групою експертів проєкту BACPAR з критеріїв оцінювання ефективності, присвячений вивченню доказів використання показників результативності для людей з ампутацією нижніх кінцівок (LLA) у гострому чи передпротезному періоді. Огляд було представлено у журналі BACPAR навесні 2014 року bacpar.csp.org.uk/. Пошук у MEDLINE, CINAHL та PsychINFO у травні 2013 року з використанням таких пошукових термінів, як “невідкладна допомога” та “ккритерії оцінювання результатів” разом з “ампутації нижніх кінцівок” АБО “ампутація нижніх кінцівок” дозволив знайти загалом 26 статей, з яких після відбору було визначено дві статті, що заслуговують на подальше вивчення. З цих статей тільки шкала “Оцінювання функціональної незалежності (FIM)” виявилася потенційно цікавою, і подальший пошук був проведений з додаванням конкретної назви FIM. Незважаючи на наявність доказів того, що FIM використовується на етапі гострої та/або ранньої реабілітації пацієнтів з LLA і може продемонструвати покращення стану між госпіталізацією та випискою, ці докази виявилися слабкими. Не було доказів того, що загальний бал FIM ефективний як інструмент прогнозу, але в одному дослідженні було відзначено хорошу кореляцію рухової підшкали з результатами протезування.
При оновленні Інструментарію в жовтні 2014 року було прийнято рішення не включати FIM або будь-який інший специфічний критерій оцінювання в Інструментарій для цієї популяції, оскільки наявні докази недостатньо переконливі. Всі інші інструменти оцінювання, включені до Інструментарію (Toolbox), мають хороші докази при більшому обсязі вибірки. Крім того, FIM вимагає навчання перед початком використання і рекомендується як інструмент MDT, тому не відповідає критерію “простий у використанні”.