АлекСо

В зарубежных базах для обучения ИИ нашли сотни треков Басты и Билана: почему это проблема для всех

Аналитики Национальной федерации музыкальной индустрии (НФМИ) обнаружили в открытых зарубежных датасетах для обучения нейросетей сотни композиций российских исполнителей.

В зарубежных базах для обучения ИИ нашли сотни треков Басты и Билана: почему это проблема для всех

Исследование, о котором «Ведомости» сообщили 17 сентября 2026 года, показывает: лейблы не получали запросов на лицензирование контента, а значит, треки могли использовать для тренировки генеративных моделей без разрешения авторов.

Это первый подобный аудит с участием российских правообладателей, и его результаты бьют сразу по нескольким острым вопросам — от авторского права до суверенности данных.

Что именно нашли в датасетах

Объектом исследования стала база проекта AI Watchdog американского журнала The Atlantic, который анализирует два известных датасета:

Датасет

Источник

Объём

Laion-Disco-12M (компания Laion)

YouTube

12,3 млн композиций

Sleeping-D 9M (Sleeping AI)

YouTube + тексты с Genius

9,7 млн песен

Лидером по числу треков оказался рэпер Баста: 193 композиции в одном датасете и 104 — во втором. Дальше — Feduk (150 и 91), Сергей Лазарев (144 и 118), Дима Билан (140 и 119) и группа «Звери» (135 и 41). В топ-10 также попали Леонид Агутин, Егор Крид и Ваня Дмитриенко. Помимо самих треков, в базах нашлись и клипы: 17 роликов с Лазаревым и 28 с Кридом.

Важная оговорка из самого проекта: наличие композиции в датасете не доказывает, что она реально использовалась при обучении конкретной модели. Но вероятность этого высока.

Почему это юридическая ловушка

Ключевая деталь — ни один разработчик ИИ, ни зарубежный, ни российский, не обращался к правообладателям за разрешением. Представитель Первого музыкального издательства (выпускает треки Агутина, «Руки вверх!» и других) подтвердил, что запросов не поступало. Гендиректор «ON лейбла» Надежда Бойчевски добавляет: часть компаний заявляет, что берёт контент из «открытых интернет-источников», — по её оценке, это может означать использование пиратских ресурсов.

Принятый в России закон о поддержке развития ИИ, по словам гендиректора НФМИ Никиты Данилова, фактически разрешает разработчикам использовать авторский контент без разрешения. Музыкальная индустрия настаивает на прозрачном механизме: правообладатель сам решает, можно ли использовать его произведения для обучения моделей.

Что это значит для вас

Ситуация касается не только музыкантов. Речь о том, как «открытые» данные превращаются в товар без согласия их авторов:

  • для авторов и лейблов — риск потерять контроль над контентом и доход от него;

  • для пользователей ИИ — чем больше моделей обучается на нелегально собранных данных, тем выше правовые риски у тех, кто внедряет такие сервисы в бизнес;

  • для рынка в целом — по оценке НИУ ВШЭ, совокупные потери правообладателей от генеративного контента за 2025–2030 годы могут достичь 1 трлн рублей.

Мировая практика уже начинает меняться: Warner Music и Suno, а затем Universal Music Group и Udio заключили соглашения о легальном обучении моделей. Но пока это исключение, а не правило.

Вывод

Находки НФМИ — напоминание, что проблема обучения нейросетей на чужом контенте имеет российское измерение. Президент уже поручил правительству проработать поправки, защищающие интересы правообладателей; рабочие группы должны представить предложения осенью. Станут ли датасеты с треками Басты поводом для системных изменений — вопрос ближайших месяцев.

Источники

Полезное

Читайте также