Регуляторы разных стран ужесточают требования к созданию синтетических медданных
Синтетические медицинские данные становятся важным инструментом в современном здравоохранении и научных исследованиях, открывая возможности для создания и тестирования искусственного интеллекта, разработки новых методов лечения и диагностики. Однако использование таких данных не лишено рисков, особенно когда речь идет о защите конфиденциальности и приватности пациентов. Это ставит перед исследователями и регуляторами актуальную задачу — выработать механизмы, которые обеспечат безопасность синтетических данных, одновременно позволяя использовать их для научных и медицинских целей.
В исследовании, проведенном учеными из Университета Оттавы, были рассмотрены существующие подходы разных стран к регулированию синтетических медицинских данных. В частности, были проанализированы официальные рекомендации Великобритании, Сингапура и Южной Кореи, которые, на сегодняшний день, представляют собой единственные документы, подробно описывающие требования к использованию структурированных синтетических медданных. Результаты работы, опубликованные в журнале Digital Medicine, подчеркивают, что, несмотря на растущий интерес к технологиям синтетических данных, регуляторы не рассматривают их как гарантированно безопасные и требуют обязательной оценки остаточного риска раскрытия личности.
Синтетические данные — это искусственно созданные наборы данных, которые не содержат реальной персональной информации, но при этом имитируют характеристики настоящих данных. В области медицины такие данные используются для разработки и тестирования ИИ-моделей, создания открытых исследовательских наборов, а также для проверки цифровых систем, не нарушая при этом конфиденциальности личной информации пациентов. Основным преимуществом синтетических данных является их способность снижать риски утечек информации, облегчать доступ к данным для научных исследований и одновременно защищать личные данные пациентов.
Однако, несмотря на преимущества, синтетические данные могут быть уязвимы. Если модель, генерирующая такие данные, обучена некачественно или переобучена, существует риск, что сгенерированные данные будут слишком похожи на реальные, и их можно будет использовать для восстановления личности пациента. Кроме того, синтетические данные могут сохранять статистические зависимости, которые могут быть использованы для идентификации отдельных пациентов. Все эти риски были подробно рассмотрены в руководствах, которые анализировали авторы исследования.
В исследованных документах выделены несколько ключевых аспектов, которым должны соответствовать синтетические данные, чтобы гарантировать их безопасность. Во-первых, необходимо проводить оценку уязвимости к раскрытию личных данных, а также проверку устойчивости данных к попыткам восстановления личной информации. Во-вторых, особое внимание следует уделить контролю качества на каждом этапе работы с синтетическими данными, начиная с обработки исходных наборов данных и заканчивая тестированием результата.
Тем не менее, важной проблемой, на которую обращают внимание авторы исследования, является отсутствие международных стандартов и единых критериев оценки приватности синтетических данных. На данный момент ни одно из рассматриваемых руководств не устанавливает конкретных пороговых значений, которые бы определяли приемлемый уровень остаточного риска раскрытия личности. Вместо этого регуляторы предлагают общие методологические рекомендации, такие как анализ структуры данных, оценка вероятности атрибутивного и членского раскрытия, а также сравнение статистических свойств синтетических и реальных данных.
Кроме того, важно подчеркнуть, что использование синтетических данных не освобождает организации от обязательств по защите персональных данных. Обработка реальных персональных данных, на основе которых обучаются генеративные модели, должна происходить в соответствии с законодательством о защите данных. Все этапы работы с такими данными должны быть документированы, и организация должна иметь прозрачное правовое основание для их использования. Синтетические данные могут считаться неперсональными только в случае, если вероятность восстановления личности пациента сведена к «очень низкой» и это подтверждено соответствующими исследованиями.
Исследователи, работающие в этой области, подчеркивают, что для дальнейшего развития технологий синтетических данных необходимо создать единые стандарты и метрики для оценки уровня приватности, а также разработать механизмы независимой экспертизы. Эти меры помогут определить скорость и масштаб внедрения синтетических данных в цифровую медицину, особенно в условиях растущего спроса на медицинские данные и ужесточающихся требований к их защите.
Кроме того, вопросы приватности и безопасности синтетических данных становятся особенно актуальными на фоне новейших разработок в области автоматического обезличивания данных. Например, исследователи медицинского центра Asan в Сеуле разработали ИИ-систему деидентификации электронных медкарт на базе модели Klue-Bert. Этот алгоритм способен удалять персональные данные с точностью до 95%, при этом сохраняется достаточная клиническая информация для медицинских исследований и диагностики. Такие технологии, безусловно, могут сыграть важную роль в обеспечении безопасности данных, но их эффективность также зависит от качества алгоритмов и моделей, используемых для их создания.
