Проверка измерений на мировых эталонах
Для измерений на ЭКГ существуют открытые испытания, одни и те же для всех: базы с разметкой кардиологов, опубликованные измерения приборных программ, международный конкурс по интервалу QT и стандарт на поиск комплексов. Ниже — наши результаты на каждом из них рядом с планкой. Планка указана везде: без неё число ничего не значит.
Что считается планкой
Требовать от автоматического измерения точности выше, чем расходятся между собой признанные эталоны, бессмысленно: такой точности не бывает и у людей. Поэтому в каждой таблице есть планка, и это измеренная величина, а не наша оценка: допуск рабочей группы, расхождение двух приборных программ между собой или разброс между врачами-разметчиками.
Границы волн против разметки кардиологов
База LUDB Университета Лобачевского: 200 записей, в каждой границы всех волн расставлены вручную по каждому из 12 отведений. Показано смещение (медиана) и разброс (СКО) по 1200–1800 комплексам на каждую границу. Допуск — двойное стандартное отклонение рабочей группы CSE, тот самый, на который ссылается стандарт IEC 60601-2-25.
| Граница | Смещение | Разброс | Допуск CSE | Внутри допуска |
|---|---|---|---|---|
| конец зубца T | +6 мс | 29 мс | 31 мс | 94 % |
| начало QRS | +2 мс | 15 мс | 7 мс | 58 % |
| конец QRS | +8 мс | 17 мс | 12 мс | 50 % |
| начало зубца P | +2 мс | 19 мс | 10 мс | 89 % |
| конец зубца P | +2 мс | 16 мс | 13 мс | 80 % |
Конец зубца T — единственная граница внутри допуска, и она же самая важная: от неё зависит интервал QT. По границам комплекса QRS мы примерно в полтора раза хуже допуска, и это открытая работа — они влияют на длительность комплекса и на интервал PQ.
Чего мы не утверждаем. Мы измеряем границу по всем двенадцати отведениям сразу — это определение нужно для интервалов, и оно по построению шире, чем граница в отдельном отведении. Разброс от одного правила сведения отведений меняется вдвое: в одной и той же работе конец зубца T даёт 23 мс по отдельным отведениям, 30 при усреднении и 35 по одному. Поэтому прямое сравнение с чужими таблицами мы не приводим. И тем более не пишем «на уровне кардиолога»: два опытных читателя расходятся по концу зубца T на 12–22 мс, разметчики, обученные на этой же базе, публикуют 15–24 — наши 29 шире и того и другого.
Сам допуск тоже стоит понимать буквально: числа CSE — это исследовательские пороги, полученные на 125 записях в 1980-х, и эталоном там в большинстве случаев была не врачебная разметка, а медиана измерений нескольких программ того времени.
Согласие с двумя приборными программами
840 записей базы PTB-XL, для которых опубликованы измерения двух признанных программ интерпретации — GE Marquette 12SL и программы Университета Глазго. Это не разметка врача, а работа приборов, и сравнивать с ними правильно так: попадаем ли мы в тот разброс, в котором лежат они сами друг относительно друга.
| Величина | Мы против 12SL | Мы против Глазго | Планка: 12SL против Глазго | Где мы |
|---|---|---|---|---|
| интервал RR | +1 мс, разброс 23 мс | 0 мс, разброс 25 мс | разброс 33 мс | лучше планки |
| интервал PQ | +6 мс, разброс 13 мс | +8 мс, разброс 19 мс | разброс 17 мс | с одной лучше, с другой хуже |
| интервал QT | −4 мс, разброс 18 мс | −7 мс, разброс 17 мс | разброс 17 мс | на планке |
| длительность QRS | +2 мс, разброс 12 мс | 0 мс, разброс 11 мс | разброс 9 мс | чуть хуже |
По интервалам RR и PQ мы согласуемся с 12SL теснее, чем две программы согласуются между собой; по QT — ровно на планке; по длительности QRS немного хуже, и причина видна в таблице выше — точность границ комплекса.
Откуда взялась планка. Её мы посчитали сами по тем же опубликованным таблицам: сравнения этих двух программ друг с другом в миллисекундах не публиковал никто, в статье с их измерениями приведены только коэффициенты корреляции. Проверить наш подсчёт может любой — таблицы открыты.
На этих же записях сверены амплитуды и площади зубцов, из которых считаются критерии вроде Соколова–Лайона. Амплитуда зубца R в грудных отведениях расходится с обеими программами на 0,1–0,3 мм при разбросе 0,4–1,1 — сами программы расходятся на 0,4–1,0; по площади комплекса 5,1 и 5,8 при их собственном 7,7. Исключение — отведение aVR, где комплекс почти целиком ниже изолинии.
Поиск комплексов по стандарту ANSI/AAMI EC57
База MIT-BIH Arrhythmia Database по правилам стандарта: пятиминутный период обучения исключён из подсчёта, записи с кардиостимулятором исключены целиком, приводятся и общий показатель, и средний по записям. 44 записи, 83 978 комплексов.
| Показатель | Общий | Средний по записям |
|---|---|---|
| чувствительность по комплексам | 99,73 % | 99,73 % |
| точность по комплексам | 99,13 % | 99,13 % |
| чувствительность по желудочковым экстрасистолам | 99,22 % | 96,21 % |
| чувствительность по предсердным экстрасистолам | 97,77 % | 98,27 % |
Сравнивать это труднее, чем кажется. Обычно приводят полосу 99,5–99,9 %, но почти все эти числа получены на той же базе, где подбирались пороги алгоритма, и больше половины работ не указывают допуск по времени. Самое чистое сопоставимое число — работа 2003 года с явно названным протоколом: 99,65 % и 99,77 %. А независимая перепроверка десяти готовых детекторов на этих же 44 записях дала лучшему сводный балл 97,1 % — в собственной статье того же автора он показывал около 99,8.
Ещё две оговорки. Знаменитые «99,3 %» классической работы 1985 года — это не чувствительность, а единица минус суммарная доля промахов. И если требовать совпадения не в пределах 150 мс, а точно в отсчёт, ни один из проверенных детекторов не даёт больше 32 %: почти вся разница между хорошими детекторами лежит внутри окна допуска.
Международный конкурс по интервалу QT
PhysioNet/CinC Challenge 2006: 549 записей, эталон — медиана измерений пятнадцати человек. Официальная оценка — среднеквадратичная ошибка с поправкой на долю записей, по которым измерение выдано: отмалчиваться невыгодно.
| Участник | Оценка | Покрытие |
|---|---|---|
| лучший человек-измеритель | 6,7 | 99,8 % |
| лучший автоматический участник | 16,3 | 95,1 % |
| типичное расхождение одного человека с медианой пятнадцати | 16–18 | — |
| Кардиопилот | 20,3 | 97,1 % |
| обычные автоматические участники | 20–30 | — |
| нарочно простой алгоритм организаторов | 27,1 | — |
Ниже 20 мс среди всех автоматических заявок оказались только три, наши 20,3 стоят сразу за ними. Внимания стоит третья строка: в эталонном файле конкурса опубликовано, насколько отдельные измерения расходились с медианой пятнадцати, и это в среднем 17,9 мс — то есть наша ошибка примерно равна тому, на сколько от общего мнения отстоит отдельный человек-измеритель, при том что лучший отстоит на 6,7.
Часть оставшейся разницы — не ошибка, а разница определений. Эталон конкурса измерен вручную по одному отведению, а мы, как и приборные программы, по всем сразу; такое измерение по определению длиннее — наш конец зубца T лежит в среднем на 10 мс позже, чем в отдельном отведении, что совпадает с опубликованной оценкой 5–11 мс. Подогнать определение под эталон конкурса можно: оценка стала бы красивее, а измерение хуже.
Как устроены наши измерения
Коротко о том, за счёт чего получены числа выше. Методы здесь общеизвестные, описанные в литературе по электрокардиографии: мы их не изобретали — мы их реализовали, свели в одну цепочку и проверили на перечисленных базах.
Интервал QT: по всем отведениям сразу
Интервал измеряется от самого раннего начала комплекса QRS до самого позднего конца зубца T по всем 12 отведениям — так его определяют и стандарт, и приборные программы: деполяризация и репризация начинаются и заканчиваются в разных отведениях в разное время. Конец зубца T определяется по критерию накопленной площади на усреднённом комплексе — ищется точка, после которой прирост площади под кривой падает ниже заданной доли, — и решение подтверждается по отдельным отведениям в окне 50 мс. Порог и окно подтверждения выбраны перебором на размеченных базах.
Интервал RR: поиск комплексов по пространственной скорости
Комплексы ищутся не в одном отведении, а по сумме модулей первых разностей всех отведений — величине, которая велика там, где сигнал быстро меняется хоть в одном из них. Поэтому комплекс, низкий в отведении II, всё равно находится. Порог адаптивный, с поиском назад для пропущенных комплексов и с разбраковкой зубцов T, принятых за комплекс; найденная точка уточняется по вершине R. Это и дало чувствительность 99,73 % по стандарту EC57 и разброс интервала RR ниже расхождения двух приборных программ.
Начало зубца P и интервал PQ
Зубец P ищется в физиологически допустимом окне перед комплексом, в полосе 2–20 Гц, где он виден лучше всего. Границы определяются по порогу крутизны относительно наибольшей крутизны самого зубца, с проверкой на шум: если перепад между вершиной и найденной границей не превосходит размах шума, граница не принимается — лучше прочерк, чем выдуманное число. Пары «зубец P — интервал PQ», выходящие за физиологические пределы, отбраковываются целиком.
Отказ от измерения — тоже результат
Там, где измерить нельзя, печатается прочерк, а не число. В отчёте есть отдельная строка о том, что измерения требуют проверки, и отдельная — о возможной путанице электродов. Доля записей, по которым мы отказываемся измерить интервал QT, — 3 %; именно она учтена в оценке конкурса выше. Отказ честнее, чем измерение по неразличимому зубцу.
Внешняя проверка распознавания диагнозов
Это другой вопрос и другой показатель, поэтому он в отдельном разделе. Модели обучены на европейской базе; ниже — проверка на независимой базе другой страны, другого прибора и другой разметки. Показатель — площадь под характеристической кривой (AUROC): насколько верно система расставляет записи по вероятности находки.
| Заключение | Случаев в базе | AUROC |
|---|---|---|
| фибрилляция и трепетание предсердий | 1018 | 0,999 |
| синусовая брадикардия | 1201 | 0,999 |
| синусовая тахикардия | 523 | 0,999 |
| предсердная экстрасистолия | 128 | 0,999 |
| синусовая аритмия | 198 | 0,997 |
| АВ-блокада 1 степени | 95 | 0,994 |
| блокада правой ножки пучка Гиса | 156 | 0,987 |
| желудочковая экстрасистолия | 149 | 0,983 |
| удлинённый интервал QT | 47 | 0,981 |
| депрессия ST | 174 | 0,963 |
| низкий вольтаж комплексов | 130 | 0,941 |
| блокада передней ветви левой ножки | 60 | 0,925 |
| неспецифические изменения ST-T | 1228 | 0,876 |
Чего эти числа не означают. AUROC — не чувствительность и не точность: он описывает порядок, а не то, что напечатано при конкретном пороге. По неспецифическим изменениям ST-T AUROC 0,876, а при нашем пороге печати находка выводится лишь у небольшой доли тех, у кого она есть: порог выбран так, чтобы не пугать здоровых. Показатели напечатанного заключения — на странице точности, и в одну таблицу с AUROC их ставить нельзя.
Вторая оговорка столь же важна: разметка во всех открытых базах — это заключение врача по той же ЭКГ, а не независимый диагноз. Для ритма и блокад это почти одно и то же. Для гипертрофии — нет: если эталоном взять эхокардиографию, потолок для ЭКГ как метода 0,62–0,79. Поэтому высокие цифры по гипертрофии из публикаций измеряют совпадение с чужой формулой, а не выявление болезни, и мы их не приводим.
Чего мы не заявляем
Наборы эталонных сигналов CTS и CSE, по которым стандарт IEC 60601-2-25 требует проверять точность измерений, платные и нам недоступны. Но есть причина проще: стандарт распространяется на медицинское оборудование — электрокардиограф как изделие, — а не на алгоритм или сервис, и заявлять соответствие ему может изготовитель прибора. Всё выше — сверка с открытыми базами и с опубликованными измерениями приборных программ, а не клиническое исследование и не сертификационное испытание.
О том, что стандарт требует, потому что это часто пересказывают неточно. На биологическом наборе CSE проверяются четыре сводные величины — длительность зубца P, интервал PQ, длительность QRS и интервал QT — с допусками от 10 до 30 мс, причём восемь наибольших отклонений отбрасываются; на наборе CTS — ещё длительности зубцов Q, R и S. Требований к границам отдельных волн нет вовсе: допуски CSE, по которым мы сверяемся выше, строже формальных. И деталь, полезная при чтении чужих ссылок: американский регулятор признаёт этот стандарт частично и не признаёт ровно те три пункта, для которых нужны CTS и CSE.
Инструмент поддержки врачебного решения. Клиническая валидация и регистрация в качестве медицинского изделия не завершены. Сервис не предназначен для самостоятельной постановки диагноза и не заменяет осмотр врача.
Числа получены на исторической выборке с машинной разметкой. Это инженерная проверка воспроизводимости, а не независимое клиническое исследование.