Все статьи
данныеИИмедицинамашинное обучениегеномика

Почему 14 миллионов геномов недостаточно: масштаб данных в медицинском ИИ

В интернете хватает данных для обучения ChatGPT. Но почему для медицинского ИИ 14 миллионов образцов — это мало? Разбираем математику масштаба, смещение выборки и нелинейный рост точности.

29 апреля 2026 г.7 минКоманда Dattel

На вопрос «зачем вам ещё данные, у вас же их итак достаточно?» Энн Войжицки отвечает примерно так: «Здесь как раз и проявляется разница между технологической и биотехнологической индустрией. В технологиях всегда считают — чем больше данных, тем лучше. В биотехнологиях иногда думают иначе. Но сейчас эти подходы сходятся».

Это важное наблюдение о природе медицинских данных. И оно объясняет, почему 14 миллионов геномов — крупнейшая в мире база генетических данных — это одновременно и огромный массив, и ещё недостаточно.

Нелинейный рост точности

Исследование 23andMe, опубликованное в Nature, показало любопытную закономерность. После миллиона образцов качество предсказаний начинает расти нелинейно — то есть каждый следующий миллион даёт больше улучшений, чем предыдущий.

Это противоречит интуиции, но объясняется статистически. Редкие события (редкие заболевания, редкие генетические варианты, редкие комбинации факторов) в выборке 1 000 000 человек просто не встречаются достаточно часто для надёжных выводов. Но при 10 миллионах — начинают.

Это похоже на то, как работают рекомендательные системы. «Длинный хвост» продуктов (фильмы, треки, книги, которые смотрит/слушает/читает небольшой процент аудитории) требует огромной базы для качественных рекомендаций. Генетика — тоже про «длинный хвост»: редкие генетические варианты, встречающиеся у 0,1% популяции, могут быть клинически значимы.

Три причины, почему 14 миллионов — всё ещё мало

Смещение выборки. Первые несколько лет 23andMe работала преимущественно в США среди покупателей, готовых потратить $99–$199 на тест. Это непропорционально много людей европейского происхождения с определённым уровнем дохода.

Модели, обученные на этой выборке, работают хуже для людей африканского, азиатского, латинского происхождения. Это не техническая нюанс — это медицинская проблема. Инструмент, который хорошо предсказывает риск рака у одной этнической группы и плохо у другой, воспроизводит и усиливает существующее неравенство в здравоохранении.

Редкие болезни. По оценкам ВОЗ, существует около 7 000 редких заболеваний, каждое из которых встречается у менее 1 на 2 000 человек. Для надёжного генетического исследования редкой болезни нужны тысячи носителей. При 14 миллионах пациентов многих редких заболеваний будет всего несколько сотен случаев — недостаточно для статистически значимых выводов. Полигенные взаимодействия. Большинство распространённых заболеваний определяются сотнями тысяч генетических вариантов. Каждая комбинация этих вариантов — уникальная история. Чтобы отличить настоящий сигнал от шума при таком числе признаков, нужна огромная выборка. Математика статистических тестов беспощадна: чем больше гипотез проверяете, тем строже требования к p-value, тем больше нужна выборка.

Аналогия с интернет-данными

GPT-4 обучался на сотнях миллиардов токенов. Claude — сравнимые масштабы. Почему это возможно, а медицинские данные такого масштаба не существуют?

Интернет-данные создавались миллиардами людей каждый день в течение тридцати лет. Они не требовали согласия на конкретное использование. Их не нужно было стандартизировать между тысячами лабораторий с разным оборудованием и протоколами.

Медицинские данные — принципиально иначе. Каждый геном требует согласия пользователя, разработки, аппаратуры секвенирования, биоинформатической обработки. Медицинские записи фрагментированы между тысячами больниц и клиник, хранятся в несовместимых системах, защищены разными законами в разных странах.

Это объясняет, почему 23andMe ценит каждый из своих 14 миллионов образцов не просто как «данные», а как долгосрочный актив. И почему цель — 100 миллионов — это многолетний проект, а не то, что можно сделать за год.

Что происходит при 100 миллионах

Войжицки описывает конкретную гипотезу: при 100 миллионах геномов начнут проявляться закономерности, которые сейчас невидимы.

В первую очередь это касается взаимодействия генетики и среды. Например: почему у женщин, никогда не куривших, развивается рак лёгких? Есть ли генетические варианты, которые делают человека более чувствительным к загрязнению воздуха? Какой полигенный вариант определяет, будет ли хроническое воздействие пестицидов вызывать болезнь Паркинсона или нет?

Сейчас на эти вопросы нет ответа — не потому что вопросы плохи, а потому что данных недостаточно для статистически значимой проверки гипотез.

Параллельно 23andMe интегрировала Apple HealthKit. Около 500 000 пользователей согласились делиться данными со своих устройств: шаги, сон, частота пульса, уровень кислорода. Более 50 000 предоставили медицинские записи. Это создаёт мультимодальный датасет: геном + физиология в реальном времени + медицинская история.

Уроки для других индустрий

История 23andMe иллюстрирует принцип, применимый далеко за пределами геномики.

В задачах с редкими событиями и высокой размерностью данных (много признаков, но мало примеров каждого класса) масштаб данных имеет нелинейную отдачу. Это верно для fraud detection, диагностики промышленных дефектов, медицинской визуализации.

Вторая проблема — смещение выборки — универсальна. Любая ML-модель унаследует предубеждения данных, на которых обучена. Это не технический баг — это математическое следствие статистики. Решение одно: расширять выборку, пока она не становится репрезентативной.

Наконец, согласие и доверие пользователей — это инфраструктура. 23andMe десятилетиями выстраивала ситуацию, где 90% клиентов соглашаются участвовать в исследованиях. Это не маркетинг — это долгосрочная инвестиция в доверие, которую нельзя купить быстро.

Данные в медицине будут становиться всё важнее по мере того, как ИИ-модели показывают реальную диагностическую ценность. Гонка за масштаб уже началась.

Dattel

Есть задача? Обсудим.

Разработка, ИИ, автоматизация, highload — подберём решение под вашу задачу.

Обсудить задачу
Почему 14 миллионов геномов недостаточно: масштаб данных в медицинском ИИ — Блог Dattel