Ещё несколько лет назад разговоры о «мёртвом интернете» воспринимались примерно как цифровая городская легенда. Сторонники теории утверждали, что значительная часть сетевой активности уже создаётся ботами, выдаётся за человеческую и направляется алгоритмами, а реальные люди постепенно исчезают из публичного пространства.
Важно, что эта теория распространилась в сети ещё в 2021 году — почти за два года до массового появления ChatGPT. Тогда речь шла прежде всего о ботах, искусственной активности, алгоритмических лентах и ощущении, что разные сайты всё чаще показывают одни и те же переработанные материалы. Генеративный ИИ не придумал эту теорию, но неожиданно предоставил ей технически правдоподобный механизм.
В своей радикальной версии теория включала почти обязательный конспирологический элемент: будто интернет централизованно заполняют искусственными пользователями и материалами для управления общественным мнением. Научных подтверждений у такого объяснения нет.
Но за последние годы произошло нечто любопытное. Отдельные процессы, которые раньше объединяли одной полумистической картиной, стали вполне наблюдаемыми: генеративные модели массово производят тексты и изображения, поисковая выдача заполняется вторичными пересказами, часть публичных обсуждений уходит в закрытые диалоги с ИИ, а новые модели рискуют обучаться на результатах работы предыдущих.
Теория мёртвого интернета не стала доказанным научным фактом. Зато у неё появилась более узкая, неконспирологическая и значительно более серьёзная версия.
Интернет не обязательно становится «мёртвым». Но он может постепенно утрачивать роль независимой памяти человеческого опыта и превращаться в среду, где машины всё чаще пересказывают машинам уже накопленное знание.
Проблема появилась не вместе с ChatGPT
Сама логика замкнутого информационного контура известна давно. Ещё до бума больших языковых моделей исследователи рекомендательных систем показывали: модель не просто наблюдает реальность, но и меняет её. Она решает, что показать пользователю; пользователь реагирует на показанное; реакция попадает в новый набор данных; затем модель принимает собственные прошлые решения за объективное описание мира.
Так возникают петли обратной связи. Популярное становится ещё популярнее, редкое получает всё меньше видимости, а исходные перекосы могут усиливаться при каждом новом цикле. В работе о data feedback loops, представленной на ICML 2023, этот эффект исследовался на задачах классификации изображений, визуально-семантического анализа и языкового моделирования.
Генеративный ИИ добавил к старой проблеме новый уровень. Раньше алгоритм в основном определял, какой человеческий материал мы увидим. Теперь он способен сам произвести материал, опубликовать его, повлиять им на поведение людей, а затем встретить собственный производный текст в следующей обучающей выборке.
Получился почти идеальный замкнутый цикл:
- люди создают открытый корпус знаний;
- на нём обучается модель;
- модель генерирует новый контент и отвечает пользователям;
- часть сгенерированного попадает обратно в интернет;
- часть человеческих вопросов и ответов, наоборот, больше не публикуется;
- следующее поколение моделей получает меньше нового человеческого материала и больше производного машинного.
Именно здесь исследования ИИ пересекаются с теорией мёртвого интернета — но только с её «слабой» версией: без предположения о едином центре управления, зато с вполне понятными технологическими и экономическими причинами.
Интернет уже в основном написан ИИ?
Короткий ответ: мы этого не знаем, а доказательств такого утверждения пока нет.
Первая проблема — само измерение. Надёжно отличать ИИ-текст от человеческого всё сложнее. Детекторы ошибаются, хуже распознают короткие тексты, зависят от языка и конкретной модели, а после содержательной правки человеком происхождение материала становится особенно трудно определить.
Вторая проблема — огромная неоднородность интернета. Доля машинного текста на площадке для длинных публикаций, в комментариях Reddit, в научных статьях, интернет-магазинах и на автоматически созданных SEO-сайтах будет совершенно разной.
Исследование примерно 2,4 млн публикаций на трёх платформах показало именно такой разрыв. С января 2022 года по октябрь 2024 года рассчитанная авторами доля вероятного ИИ-текста выросла на Medium с 1,77 до 37,03%, на Quora — с 2,06 до 38,95%, а на Reddit — только с 1,31 до 2,45%. Это результаты детектора, а не достоверная перепись авторов, однако разница между платформами показательна. Работа опубликована в материалах ACL 2025.
Ещё ближе к самой теории мёртвого интернета подошёл препринт исследователей Imperial College London, Internet Archive и Stanford 2026 года. По их оценке, к середине 2025 года до 35% сайтов, вновь опубликованных или впервые зафиксированных в исследованной выборке Internet Archive, классифицировались как полностью либо частично подготовленные с помощью ИИ.
Но здесь особенно важно не потерять ограничения результата:
- речь идёт о новых сайтах, а не о 35% всего накопленного интернета;
- оценка зависит от качества выбранного детектора;
- работа пока является препринтом;
- участие ИИ в редактировании не означает, что весь смысл материала придуман моделью.
Авторы обнаружили статистически значимое сокращение семантического разнообразия: машинные материалы в среднем становились тематически ближе друг к другу. Также наблюдался сдвиг к более положительной, сглаженной тональности. При этом исследование не подтвердило общего падения фактической точности или исчезновения стилистического разнообразия.
Это важная поправка к алармизму. На сегодня научно защищаемая позиция звучит не как «интернет уже захвачен ИИ», а так: доля машинного текста быстро растёт, особенно в некоторых дешёвых и массовых сегментах, но глобальный масштаб и последствия этого процесса пока измерены недостаточно точно.
И ещё одно принципиальное уточнение: бот-трафик нельзя приравнивать к ИИ-контенту. Поисковый робот, система мониторинга, сканер уязвимостей, спам-бот и языковая модель, публикующая статью, — это разные явления. Процент автоматических сетевых запросов ничего сам по себе не говорит о доле знаний, созданных человеком или машиной.
Закончатся ли «живые» данные
Прогнозы об исчерпании данных часто пересказывают так, будто в определённый день модели дочитают интернет до последней страницы и развитие ИИ остановится. Исследования говорят о другом.
Авторы работы ICML 2024 о пределах масштабирования LLM оценили, что при продолжении наблюдавшихся тенденций размеры обучающих наборов могут сравняться с доступным запасом качественного публичного человеческого текста примерно между 2026 и 2032 годами. Это не срок исчезновения данных. Это возможный предел стратегии «возьмём ещё больше уникального текста из открытой сети и получим пропорционально более сильную модель».
Повторное использование корпуса способно отложить этот предел, но не отменить его. В экспериментах Scaling Data-Constrained Language Models до четырёх эпох повторения данных давали незначительную потерю по сравнению с использованием уникальных данных, однако при дальнейшем повторении полезность дополнительных вычислений постепенно сходила на нет.
При этом термин «человеческие данные» тоже не вполне точен. Для обучения важнее не то, кто набрал символы на клавиатуре, а есть ли в материале новый независимый сигнал о реальности.
Человек может вручную переписать чужую статью — и не добавить ни одного нового факта. ИИ может оформить отчёт о проведённом человеком эксперименте — и в тексте окажутся новые наблюдения. Модель может сгенерировать программный код, который затем пройдёт компиляцию и независимые тесты, — это уже проверяемый результат, а не простой пересказ собственных предположений.
Для информационной безопасности разница особенно наглядна. Первичный бюллетень производителя, запись CVE, результат воспроизведения уязвимости, телеметрия SIEM или EDR и отчёт лабораторного анализа привязаны к реальному событию. Сотня сгенерированных SEO-статей, пересказывающих один и тот же advisory, увеличивает объём интернета, но почти не увеличивает объём знаний. Более того, если первичный материал содержал ошибку, пересказы способны многократно её размножить и создать иллюзию подтверждения из множества «источников».
Поэтому будущий дефицит — это не нехватка байтов. Это нехватка свежих, независимых, разнообразных, проверяемых и юридически доступных данных, связанных с реальным миром.
Действительно ли модели начнут деградировать
Такой риск существует, но его часто описывают слишком прямолинейно.
В исследовании, опубликованном в Nature в 2024 году, показан эффект model collapse. При последовательном обучении новых поколений моделей на результатах предыдущих сначала исчезали редкие случаи — «хвосты» исходного распределения, — затем сокращалось разнообразие и накапливалось искажение представления о реальности.
Иными словами, модель обычно воспроизводит наиболее вероятное лучше, чем редкое. Если следующий цикл видит преимущественно это усреднённое воспроизведение, редкие знания получают ещё меньший вес. Через несколько итераций система может уверенно описывать уже не исходный мир, а его всё более бедную копию.
Однако из этого не следует, что любые синтетические данные вредны и неизбежно «отравляют» модель. В работе Is Model Collapse Inevitable? исследователи подтвердили деградацию при замене исходных данных синтетическими, но показали, что накопление новых машинных данных вместе с сохранённым реальным корпусом позволяло избежать collapse в проведённых экспериментах.
Решающими становятся условия:
- сохраняются ли первичные данные или синтетика их вытесняет;
- можно ли установить происхождение материала;
- сохраняются ли редкие и неудобные случаи;
- есть ли внешний механизм проверки;
- насколько разнообразны модели и способы генерации;
- используется ли машинный текст как гипотеза или как уже подтверждённый факт.
Синтетические задачи с ответами, проверяемыми компилятором, формальным верификатором, математическим вычислением, симулятором или реальным экспериментом, могут быть очень полезны. Бесконтрольная генерация пересказов без внешней проверки в основном возвращает модели её собственные представления.
Более опасная петля: люди перестают пополнять открытый интернет
Возможно, главный риск находится даже не внутри обучающих алгоритмов, а в изменении человеческого поведения.
Раньше программист сталкивался с новой ошибкой, задавал вопрос на Stack Overflow, получал несколько решений, видел спор специалистов, проверял код и оставлял публичный, датированный и коллективно оценённый объект знания. Теперь тот же вопрос часто задаётся модели в закрытом диалоге. Даже если ответ оказался верным и пользователь нашёл новое решение, оно обычно:
- не индексируется поисковиками;
- не проверяется другими специалистами;
- не получает исправлений и дополнений;
- не становится частью открытого корпуса;
- не достаётся будущим исследователям и разработчикам моделей.
Это уже подтверждается не только общим впечатлением. Авторы исследования PNAS Nexus 2024 сравнили Stack Overflow с несколькими контрольными Q& A-площадками и оценили, что в течение шести месяцев после появления ChatGPT активность на Stack Overflow снизилась примерно на 25% относительно контрфактического сценария. Средний оценённый эффект за весь шестимесячный период составлял около 15% и усиливался по мере распространения ChatGPT. Снижение затронуло не только новичков и простые вопросы: авторы не обнаружили значимого улучшения качества оставшихся публикаций и наблюдали спад среди пользователей с разным уровнем опыта.
Разумеется, ChatGPT не является единственной причиной многолетнего снижения активности Stack Overflow. Влияли жёсткая модерация, накопление ответов на типовые вопросы, развитие документации, миграция обсуждений в GitHub, Discord и закрытые корпоративные пространства. Но генеративный ИИ резко усилил уже существовавший перенос знаний из открытой сети в частные каналы.
Одновременно владельцы качественных источников закрывают их от автоматизированного сбора. Исследование Consent in Crisis, представленное на NeurIPS 2024, показало: всего за 2023–2024 годы ограничения затронули более 5% токенов корпуса C4 и более 28% токенов из наиболее активно поддерживаемых критически важных источников. По условиям использования ограниченным оказалось около 45% C4.
Получается двойное сжатие. Свежего открытого человеческого материала может создаваться меньше, а доступ к части уже существующих качественных источников становится юридически или технически ограниченным.
Что может произойти дальше
Научные данные пока не позволяют нарисовать один неизбежный сценарий. Но уже видны несколько вероятных направлений.
1. Открытый интернет станет менее однородным по уровню доверия
Сеть, скорее всего, не превратится целиком в машинный шум. Она расслоится.
В одном слое останется дешёвый массовый контент: автоматические карточки, SEO-тексты, пересказы, сгенерированные комментарии и материалы без прозрачного происхождения. Во втором — доверенные публичные источники с редакцией, репутацией, ссылками на первичные данные и историей изменений. В третьем — закрытые массивы: корпоративная телеметрия, научные измерения, профессиональные базы, пользовательские диалоги и лицензируемый контент.
Объём первого слоя будет расти быстрее всего, но наибольшую ценность для обучения и принятия решений получат второй и третий.
2. Происхождение данных станет важнее объёма
Будущие системы придётся учить различать первичный факт, человеческую интерпретацию, машинный пересказ и результат, прошедший независимую проверку. Простого удаления всего «похожего на ИИ» недостаточно: детекторы ненадёжны, а полезный материал может быть подготовлен с помощью модели.
На практике ценность будут иметь цепочка происхождения, ссылка на первоисточник, время получения данных, метод проверки и возможность воспроизвести результат. Для ИБ это фактически знакомая задача управления доверием к источнику: vendor advisory и подтверждённая телеметрия должны весить больше, чем десятки вторичных публикаций.
3. Качественные данные станут отдельным экономическим активом
Если открытый корпус перестанет давать прежний прирост, разработчики будут всё сильнее зависеть от лицензионных соглашений, профессиональных баз, корпоративных данных и доступа к реальным средам. Это может повысить качество моделей, но одновременно усилить крупнейшие компании, способные покупать уникальные массивы.
Возникает риск новой цифровой асимметрии: открытые модели и академические команды будут учиться на более шумной сети, тогда как закрытые лаборатории — на отобранных и дорогих данных, происхождение которых невозможно независимо проверить.
4. Обучение сместится от пересказа интернета к взаимодействию с миром
Выходом из дефицита текста могут стать не бесконечные синтетические статьи, а данные, возникающие при решении задач: исполнение кода, эксперименты, симуляции, работа с инструментами, наблюдения за физическими процессами, экспертная обратная связь. В таких средах модель получает внешний сигнал о том, сработало решение или нет.
Это не отменяет риск рекурсивного обучения, но размыкает контур: истину определяет уже не согласие модели с собственным предыдущим ответом, а результат проверки за её пределами.
5. Открытым сообществам придётся заново создать стимул делиться знаниями
Публичные базы знаний не смогут конкурировать с ИИ только скоростью ответа. Их преимущество — происхождение, спор, репутация автора, проверяемость и накопление исправлений. Вероятно, появятся гибридные механизмы, при которых ИИ помогает оформить вопрос или решение, но итог сохраняется в открытом, цитируемом и проверяемом виде.
Иначе возникает парадокс общего ресурса: модели получают ценность из десятилетий открытого человеческого труда, но удобство закрытого диалога сокращает приток новых материалов в тот же общий фонд.
Так интернет всё-таки умирает?
Нет — по крайней мере, наука сегодня этого не подтверждает.
Не доказано, что большая часть всего интернета уже создана ИИ. Не доказано глобальное падение фактической точности сети. Не доказано, что model collapse неизбежен при любом использовании синтетических данных. И тем более нет оснований принимать конспирологическую часть теории о едином управляемом замещении людей ботами.
Но подтверждены отдельные процессы, делающие метафору всё менее фантастической:
- в некоторых сегментах доля ИИ-текста уже измеряется десятками процентов;
- при наивном рекурсивном обучении модели теряют редкие знания и разнообразие;
- генеративный ИИ сокращает публикацию новых материалов на открытых Q& A-площадках;
- владельцы качественных источников ограничивают автоматизированный доступ;
- происхождение и независимость данных становятся важнее их валового объёма.
Поэтому главная угроза — не момент, когда «в интернете закончатся слова». Слова машины способны производить практически бесконечно. Дефицитным становится новое наблюдение, реальный опыт, аргумент, эксперимент, спор и ошибка, которую кто-то обнаружил и публично исправил.
И если интернет действительно может стать «мёртвым», то не потому, что в нём исчезнет активность. Напротив, активности, текстов, картинок и комментариев может стать больше, чем когда-либо.
Он станет мёртвым в другом смысле — если перестанет пополняться независимым знанием о мире и начнёт всё громче повторять самого себя.
Блог

Проект нового приказа ФСТЭК по ИСПДн: от перечня мер к управляемой защите

А где все остальные безопасники? Зачем я начал собирать Профессиональный атлас ИБ

«Остановите нас» — или не мешайте гонке? Что видно, если сложить открытые данные об ИИ в один пазл

Освободить ЦОД от ответственности за утечки? Всё сложнее, чем кажется

