Проверка измерений на мировых эталонах

Для измерений на ЭКГ существуют открытые испытания, одни и те же для всех: базы с разметкой кардиологов, опубликованные измерения приборных программ, международный конкурс по интервалу QT и стандарт на поиск комплексов. Ниже — наши результаты на каждом из них рядом с планкой. Планка указана везде: без неё число ничего не значит.

99,73 %чувствительность поиска комплексов по стандарту ANSI/AAMI EC57
23 мсразброс интервала RR против приборных программ — при их взаимном 33
94 %границ конца зубца T внутри допуска рабочей группы CSE
13 мсразброс интервала PQ против GE 12SL — при взаимном разбросе программ 17

Что считается планкой

Требовать от автоматического измерения точности выше, чем расходятся между собой признанные эталоны, бессмысленно: такой точности не бывает и у людей. Поэтому в каждой таблице есть планка, и это измеренная величина, а не наша оценка: допуск рабочей группы, расхождение двух приборных программ между собой или разброс между врачами-разметчиками.

Границы волн против разметки кардиологов

База LUDB Университета Лобачевского: 200 записей, в каждой границы всех волн расставлены вручную по каждому из 12 отведений. Показано смещение (медиана) и разброс (СКО) по 1200–1800 комплексам на каждую границу. Допуск — двойное стандартное отклонение рабочей группы CSE, тот самый, на который ссылается стандарт IEC 60601-2-25.

ГраницаСмещениеРазброс Допуск CSEВнутри допуска
конец зубца T+6 мс29 мс31 мс94 %
начало QRS+2 мс15 мс7 мс58 %
конец QRS+8 мс17 мс12 мс50 %
начало зубца P+2 мс19 мс10 мс89 %
конец зубца P+2 мс16 мс13 мс80 %

Конец зубца T — единственная граница внутри допуска, и она же самая важная: от неё зависит интервал QT. По границам комплекса QRS мы примерно в полтора раза хуже допуска, и это открытая работа — они влияют на длительность комплекса и на интервал PQ.

Чего мы не утверждаем. Мы измеряем границу по всем двенадцати отведениям сразу — это определение нужно для интервалов, и оно по построению шире, чем граница в отдельном отведении. Разброс от одного правила сведения отведений меняется вдвое: в одной и той же работе конец зубца T даёт 23 мс по отдельным отведениям, 30 при усреднении и 35 по одному. Поэтому прямое сравнение с чужими таблицами мы не приводим. И тем более не пишем «на уровне кардиолога»: два опытных читателя расходятся по концу зубца T на 12–22 мс, разметчики, обученные на этой же базе, публикуют 15–24 — наши 29 шире и того и другого.

Сам допуск тоже стоит понимать буквально: числа CSE — это исследовательские пороги, полученные на 125 записях в 1980-х, и эталоном там в большинстве случаев была не врачебная разметка, а медиана измерений нескольких программ того времени.

Согласие с двумя приборными программами

840 записей базы PTB-XL, для которых опубликованы измерения двух признанных программ интерпретации — GE Marquette 12SL и программы Университета Глазго. Это не разметка врача, а работа приборов, и сравнивать с ними правильно так: попадаем ли мы в тот разброс, в котором лежат они сами друг относительно друга.

ВеличинаМы против 12SLМы против Глазго Планка: 12SL против ГлазгоГде мы
интервал RR+1 мс, разброс 23 мс0 мс, разброс 25 мсразброс 33 мслучше планки
интервал PQ+6 мс, разброс 13 мс+8 мс, разброс 19 мсразброс 17 мсс одной лучше, с другой хуже
интервал QT−4 мс, разброс 18 мс−7 мс, разброс 17 мсразброс 17 мсна планке
длительность QRS+2 мс, разброс 12 мс0 мс, разброс 11 мсразброс 9 мсчуть хуже

По интервалам RR и PQ мы согласуемся с 12SL теснее, чем две программы согласуются между собой; по QT — ровно на планке; по длительности QRS немного хуже, и причина видна в таблице выше — точность границ комплекса.

Откуда взялась планка. Её мы посчитали сами по тем же опубликованным таблицам: сравнения этих двух программ друг с другом в миллисекундах не публиковал никто, в статье с их измерениями приведены только коэффициенты корреляции. Проверить наш подсчёт может любой — таблицы открыты.

На этих же записях сверены амплитуды и площади зубцов, из которых считаются критерии вроде Соколова–Лайона. Амплитуда зубца R в грудных отведениях расходится с обеими программами на 0,1–0,3 мм при разбросе 0,4–1,1 — сами программы расходятся на 0,4–1,0; по площади комплекса 5,1 и 5,8 при их собственном 7,7. Исключение — отведение aVR, где комплекс почти целиком ниже изолинии.

Поиск комплексов по стандарту ANSI/AAMI EC57

База MIT-BIH Arrhythmia Database по правилам стандарта: пятиминутный период обучения исключён из подсчёта, записи с кардиостимулятором исключены целиком, приводятся и общий показатель, и средний по записям. 44 записи, 83 978 комплексов.

ПоказательОбщийСредний по записям
чувствительность по комплексам99,73 %99,73 %
точность по комплексам99,13 %99,13 %
чувствительность по желудочковым экстрасистолам99,22 %96,21 %
чувствительность по предсердным экстрасистолам97,77 %98,27 %

Сравнивать это труднее, чем кажется. Обычно приводят полосу 99,5–99,9 %, но почти все эти числа получены на той же базе, где подбирались пороги алгоритма, и больше половины работ не указывают допуск по времени. Самое чистое сопоставимое число — работа 2003 года с явно названным протоколом: 99,65 % и 99,77 %. А независимая перепроверка десяти готовых детекторов на этих же 44 записях дала лучшему сводный балл 97,1 % — в собственной статье того же автора он показывал около 99,8.

Ещё две оговорки. Знаменитые «99,3 %» классической работы 1985 года — это не чувствительность, а единица минус суммарная доля промахов. И если требовать совпадения не в пределах 150 мс, а точно в отсчёт, ни один из проверенных детекторов не даёт больше 32 %: почти вся разница между хорошими детекторами лежит внутри окна допуска.

Международный конкурс по интервалу QT

PhysioNet/CinC Challenge 2006: 549 записей, эталон — медиана измерений пятнадцати человек. Официальная оценка — среднеквадратичная ошибка с поправкой на долю записей, по которым измерение выдано: отмалчиваться невыгодно.

УчастникОценкаПокрытие
лучший человек-измеритель6,799,8 %
лучший автоматический участник16,395,1 %
типичное расхождение одного человека с медианой пятнадцати16–18—
Кардиопилот20,397,1 %
обычные автоматические участники20–30—
нарочно простой алгоритм организаторов27,1—

Ниже 20 мс среди всех автоматических заявок оказались только три, наши 20,3 стоят сразу за ними. Внимания стоит третья строка: в эталонном файле конкурса опубликовано, насколько отдельные измерения расходились с медианой пятнадцати, и это в среднем 17,9 мс — то есть наша ошибка примерно равна тому, на сколько от общего мнения отстоит отдельный человек-измеритель, при том что лучший отстоит на 6,7.

Часть оставшейся разницы — не ошибка, а разница определений. Эталон конкурса измерен вручную по одному отведению, а мы, как и приборные программы, по всем сразу; такое измерение по определению длиннее — наш конец зубца T лежит в среднем на 10 мс позже, чем в отдельном отведении, что совпадает с опубликованной оценкой 5–11 мс. Подогнать определение под эталон конкурса можно: оценка стала бы красивее, а измерение хуже.

Как устроены наши измерения

Коротко о том, за счёт чего получены числа выше. Методы здесь общеизвестные, описанные в литературе по электрокардиографии: мы их не изобретали — мы их реализовали, свели в одну цепочку и проверили на перечисленных базах.

Интервал QT: по всем отведениям сразу

Интервал измеряется от самого раннего начала комплекса QRS до самого позднего конца зубца T по всем 12 отведениям — так его определяют и стандарт, и приборные программы: деполяризация и репризация начинаются и заканчиваются в разных отведениях в разное время. Конец зубца T определяется по критерию накопленной площади на усреднённом комплексе — ищется точка, после которой прирост площади под кривой падает ниже заданной доли, — и решение подтверждается по отдельным отведениям в окне 50 мс. Порог и окно подтверждения выбраны перебором на размеченных базах.

Интервал RR: поиск комплексов по пространственной скорости

Комплексы ищутся не в одном отведении, а по сумме модулей первых разностей всех отведений — величине, которая велика там, где сигнал быстро меняется хоть в одном из них. Поэтому комплекс, низкий в отведении II, всё равно находится. Порог адаптивный, с поиском назад для пропущенных комплексов и с разбраковкой зубцов T, принятых за комплекс; найденная точка уточняется по вершине R. Это и дало чувствительность 99,73 % по стандарту EC57 и разброс интервала RR ниже расхождения двух приборных программ.

Начало зубца P и интервал PQ

Зубец P ищется в физиологически допустимом окне перед комплексом, в полосе 2–20 Гц, где он виден лучше всего. Границы определяются по порогу крутизны относительно наибольшей крутизны самого зубца, с проверкой на шум: если перепад между вершиной и найденной границей не превосходит размах шума, граница не принимается — лучше прочерк, чем выдуманное число. Пары «зубец P — интервал PQ», выходящие за физиологические пределы, отбраковываются целиком.

Отказ от измерения — тоже результат

Там, где измерить нельзя, печатается прочерк, а не число. В отчёте есть отдельная строка о том, что измерения требуют проверки, и отдельная — о возможной путанице электродов. Доля записей, по которым мы отказываемся измерить интервал QT, — 3 %; именно она учтена в оценке конкурса выше. Отказ честнее, чем измерение по неразличимому зубцу.

Внешняя проверка распознавания диагнозов

Это другой вопрос и другой показатель, поэтому он в отдельном разделе. Модели обучены на европейской базе; ниже — проверка на независимой базе другой страны, другого прибора и другой разметки. Показатель — площадь под характеристической кривой (AUROC): насколько верно система расставляет записи по вероятности находки.

ЗаключениеСлучаев в базеAUROC
фибрилляция и трепетание предсердий10180,999
синусовая брадикардия12010,999
синусовая тахикардия5230,999
предсердная экстрасистолия1280,999
синусовая аритмия1980,997
АВ-блокада 1 степени950,994
блокада правой ножки пучка Гиса1560,987
желудочковая экстрасистолия1490,983
удлинённый интервал QT470,981
депрессия ST1740,963
низкий вольтаж комплексов1300,941
блокада передней ветви левой ножки600,925
неспецифические изменения ST-T12280,876

Чего эти числа не означают. AUROC — не чувствительность и не точность: он описывает порядок, а не то, что напечатано при конкретном пороге. По неспецифическим изменениям ST-T AUROC 0,876, а при нашем пороге печати находка выводится лишь у небольшой доли тех, у кого она есть: порог выбран так, чтобы не пугать здоровых. Показатели напечатанного заключения — на странице точности, и в одну таблицу с AUROC их ставить нельзя.

Вторая оговорка столь же важна: разметка во всех открытых базах — это заключение врача по той же ЭКГ, а не независимый диагноз. Для ритма и блокад это почти одно и то же. Для гипертрофии — нет: если эталоном взять эхокардиографию, потолок для ЭКГ как метода 0,62–0,79. Поэтому высокие цифры по гипертрофии из публикаций измеряют совпадение с чужой формулой, а не выявление болезни, и мы их не приводим.

Чего мы не заявляем

Наборы эталонных сигналов CTS и CSE, по которым стандарт IEC 60601-2-25 требует проверять точность измерений, платные и нам недоступны. Но есть причина проще: стандарт распространяется на медицинское оборудование — электрокардиограф как изделие, — а не на алгоритм или сервис, и заявлять соответствие ему может изготовитель прибора. Всё выше — сверка с открытыми базами и с опубликованными измерениями приборных программ, а не клиническое исследование и не сертификационное испытание.

О том, что стандарт требует, потому что это часто пересказывают неточно. На биологическом наборе CSE проверяются четыре сводные величины — длительность зубца P, интервал PQ, длительность QRS и интервал QT — с допусками от 10 до 30 мс, причём восемь наибольших отклонений отбрасываются; на наборе CTS — ещё длительности зубцов Q, R и S. Требований к границам отдельных волн нет вовсе: допуски CSE, по которым мы сверяемся выше, строже формальных. И деталь, полезная при чтении чужих ссылок: американский регулятор признаёт этот стандарт частично и не признаёт ровно те три пункта, для которых нужны CTS и CSE.

Инструмент поддержки врачебного решения. Клиническая валидация и регистрация в качестве медицинского изделия не завершены. Сервис не предназначен для самостоятельной постановки диагноза и не заменяет осмотр врача.

Числа получены на исторической выборке с машинной разметкой. Это инженерная проверка воспроизводимости, а не независимое клиническое исследование.