Все статьи
данныеИИбиотехbig dataархитектура

ДНК как данные: почему геномика — это задача больших данных, а не биологии

Геном человека — это цифровой код из четырёх букв. Компания 23andMe собрала 14 миллионов таких кодов. Разбираем, почему это задача data engineering, и чему ИТ-индустрия может научиться у геномики.

30 апреля 2026 г.8 минКоманда Dattel

Есть удивительно точная формулировка, которую произносит Энн Войжицки — основатель компании 23andMe: «ДНК — это цифровой код. У любой формы жизни есть четыре базовые буквы — A, C, G, T. Они по-разному сочетаются и располагаются, и именно поэтому вы можете быть человеком, лягушкой или даже бананом».

Это не поэтическая метафора. Это буквальное описание. Геном человека — строка из примерно трёх миллиардов символов в алфавите из четырёх символов. База данных. Со всеми вытекающими инженерными задачами: хранение, поиск паттернов, машинное обучение, масштабирование.

Почему геномика — это IT-задача

Медицина долго смотрела на геном как на биологический объект. Но с момента завершения проекта «Геном человека» в 2003 году стало очевидно: главная проблема не в том, как «прочитать» ДНК — технологии секвенирования резко подешевели. Главная проблема — в том, что делать с прочитанным.

Геном одного человека занимает около 1,5 гигабайта в сжатом виде. 14 миллионов геномов — это примерно 21 петабайт сырых данных. Это не считая метаданных: медицинские анкеты, данные с носимых устройств, результаты анализов крови, геолокация, образ жизни.

Задача 23andMe — найти статистические закономерности в этих данных. Какие генетические варианты коррелируют с каким заболеванием? Какие комбинации нескольких вариантов (полигенный риск) предсказывают риск диабета, рака или болезни Альцгеймера?

Это задача machine learning на нетривиальных данных. И здесь принципы те же, что в рекомендательных системах или fraud detection: больше данных — лучше модель.

Две стратегии генетического риска

В геномике есть два принципиально разных типа анализа, и понимание их различия полезно для любого дата-инженера.

Моногенный риск — мутация в одном гене значительно повышает риск конкретного заболевания. Пример: мутации в гене BRCA1/BRCA2 повышают риск рака груди в несколько раз. Или семейная гиперхолестеринемия — вариант одного гена, при котором уровень холестерина неконтролируемо высок независимо от диеты.

Такие варианты работают как жёсткие правила: если ген присутствует — риск радикально выше. Это детерминированная логика, понятная в классических базах данных.

Полигенный риск — сотни и тысячи генетических вариантов, каждый из которых по отдельности незначительно влияет на риск. Но взятые вместе, они дают индивидуальный «полигенный балл». Это уже не детерминированные правила, а статистическая модель — что-то близкое к gradient boosting или нейронной сети.

И вот тут проявляется главная техническая проблема. Чтобы надёжно обучить модель на сотнях тысяч признаков (генетических вариантов), нужны миллионы примеров с хорошей статистикой. 14 миллионов геномов звучит много — но для редких заболеваний, редких этнических групп, редких комбинаций факторов это всё ещё мало.

Проблема смещения в данных

Один из главных рисков в геномном датасете — смещение выборки. Первые несколько лет 23andMe активно использовали в США, поэтому в базе непропорционально много людей европейского происхождения.

Это создаёт техническую проблему: модели, обученные на одной этнической группе, плохо обобщаются на другие. Если у вас высокий полигенный риск по европейской модели — это не значит, что он так же высок для человека с азиатскими или африканскими корнями.

Исследование, опубликованное в Nature, показало: после миллиона человек качество предсказаний начинает расти нелинейно. Это не просто больше данных — это принципиально другое покрытие вариантов и комбинаций.

Следующая важная отметка — 100 миллионов. Там, по расчётам команды, начнётся область, где геномные модели смогут работать на уровне серьёзной диагностической ценности для разных популяций.

Что общего с рекомендательными системами

Инженер, работавший с рекомендациями в Netflix или Spotify, сразу узнает знакомые паттерны.

Во-первых, проблема холодного старта. У нового пользователя нет истории взаимодействий — и нет данных о здоровье, кроме генетики. Приходится строить рекомендации на ограниченной информации.

Во-вторых, проблема распределения. Большинство пользователей — здоровы. Заболевания — редкие события. Дисбаланс классов требует специальных техник обучения.

В-третьих, проблема объяснимости. Сказать человеку «у вас повышенный риск рака кишечника» — недостаточно. Нужно объяснить, почему и что делать. Explainability в биомедицинском ML — не академическая роскошь, а клиническая необходимость.

Наконец, проблема обратной связи. В рекомендательной системе вы быстро узнаёте, кликнул ли пользователь. В медицине обратная связь — заболел человек или нет — приходит через годы или десятилетия. Это радикально осложняет валидацию моделей.

Данные + ИИ: синергия, которую ждали с 2006 года

23andMe была основана в 2006 году. Уже тогда идея звучала примерно так: собрать генетические данные миллионов людей, найти паттерны, понять болезни.

Но двадцать лет назад не было ни достаточно мощных моделей машинного обучения, ни достаточно дешёвых вычислений, ни достаточно данных.

Сейчас всё три компонента сошлись. Трансформеры и большие языковые модели, обученные на текстах, показали: архитектура, способная работать с последовательностями, умеет находить паттерны в огромных корпусах. ДНК — тоже последовательность. Уже существуют DNA-трансформеры, обученные непосредственно на геномных данных.

Параллельно Apple HealthKit, Oura Ring, носимые глюкозометры генерируют потоки физиологических данных в реальном времени. Объединить генетику со временными рядами биометрики — задача мультимодального обучения.

Это и есть причина, почему медицинский ИИ — одна из самых горячих областей ближайших десяти лет. Не потому что кто-то придумал хорошую идею, а потому что технологические компоненты наконец созрели.

Что это означает для бизнеса

Для компаний, которые строят IT-решения в здравоохранении или работают с биомедицинскими данными, несколько практических выводов.

Данные — это актив дольше, чем код. ДНК-данные пользователей, накопленные за 20 лет, не устаревают. Наоборот, с появлением новых методов анализа они становятся ценнее. Это принципиально иная модель, чем в большинстве B2C-продуктов. Согласие пользователей — конкурентный актив. 90% клиентов 23andMe согласились участвовать в исследованиях. Это результат многолетнего построения доверия — и почти невоспроизводимый актив для конкурентов. Независимость данных критична. Генетические данные не должны принадлежать одной фармацевтической компании или одной национальной структуре. Это создаёт регуляторные и этические требования к тому, как данные хранятся, кто имеет к ним доступ и на каких условиях.

Геномика — это не будущее медицины. Это уже настоящее. И это большая задача инженерии данных.

Dattel

Есть задача? Обсудим.

Разработка, ИИ, автоматизация, highload — подберём решение под вашу задачу.

Обсудить задачу
ДНК как данные: почему геномика — это задача больших данных, а не биологии — Блог Dattel