Мой блог
Как я создал ИИ-сайт на 2000 страниц: опыт и ошибки
Этим летом я решил запустить масштабный проект — цифровую энциклопедию по истории искусства artatlas.site. На сайте собрано 184 картины, 107 художников, а также музеи и подробные статьи, переведенные на русский, английский, испанский и французский языки. Итогом работы стали более двух тысяч HTML-файлов. Весь код и значительную часть текстов генерировала нейросеть Claude Code, тогда как я брал на себя роль постановщика задач, редактора и проверяющего.
Техническая база получилась крепкой: Lighthouse оценивает доступность в абсолютную сотню баллов, а разметка JSON-LD везде валидна. Тем не менее, реальность поисковой оптимизации оказалась суровой — Google стабильно приводит на ресурс чуть меньше двух человек в сутки. Ниже я подробно расскажу обо всех этапах этого эксперименты, подводных камнях автоматизации и неожиданных факапах искусственного интеллекта.
Июнь: стремительный старт и первые сбои
Первые недели работы с искусственным интеллектом напоминали рекламный проспект. Стоило мне написать задачу «сделай страницы для 49 новых картин», как через час всё было готово. Перенос 250 графических файлов общим весом 74 мегабайта с Википедии занимал считанные минуты, а к вечеру успевала сформироваться и полноценная англоязычная версия. В какой-то момент я просто увлекся придумыванием новых поручений.
Однако 22 июня выяснилось, что на работающем сервере полностью парализован весь JavaScript. Ключевой файл site.js случайно получил права доступа 600, из-за чего веб-сервер закономерно отдавал ошибку 403. Визуально снаружи всё выглядело безупречно: верстка на месте, иллюстрации отображаются, тексты читаются. Вот только ни один интерактивный элемент интерфейса не функционировал. Подобных сюрпризов в дальнейшем оказалось предостаточно.
Как скрипт чинил то, что не было сломано
ИИ самостоятельно написал скрипт для проверки ссылок hreflang, обеспечивающих связь между языковыми версиями страниц. Алгоритм опирался на логику: английский URL равен префиксу /en/ плюс русский адрес. Проведя сканирование, программа обнаружила «ошибки» и моментально исправила 312 ссылок. Беда заключалась в том, что реальные английские адреса имели сложные суффиксы на конце. В результате правильные ссылки массово превратились в битые, и мне пришлось срочно откатывать более двухсот блоков из резервной копии.
В другой раз бэкапы главных страниц скопировались некорректно, из-за чего русскоязычная главная страница полностью перезаписалась английским каталогом. Обнаружив ресурс на иностранном языке, я был шокирован. Пришлось восстанавливать структуру напрямую из живого веба, после чего работающий сайт официально закрепился в статусе основного бэкапа. Ошибка человека обычно портит одну страницу, тогда как ИИ способен мгновенно испортить три сотни и бодро отчитаться об успехе.
Свечи на шляпе и художественный вымысел
Для энциклопедического проекта достоверность фактов имеет первостепенное значение. Нейросеть генерировала отличные детальные тексты, и в июле я попросил добавить им живости. Результат превзошел ожидания. После ручной проверки 964 фактов обнаружилось два десятка ошибок на восемьнадцати картинах. Самое обидное, что выдумкой оказались именно самые яркие детали, привлекающие читателя.
Например, ИИ утверждал, что в «Мону Лизу» стреляли (хотя в нее бросали камень и обливали кислотой), что Микеланджело расписывал Сикстинскую капеллу лежа на спине (на самом деле стоя на лесах), а Ван Гог работал ночью со свечами на шляпе (красивый миф из книги 1922 года). Каждую выдумку приходилось вычищать в пяти разных местах на четырех языках. В итоге я ввел правило: увлекательные легенды оставляем, но обязательно маркируем их соответствующим образом.
Проблемы перевода и Realismoo
Изначально в планах фигурировало десять языков вплоть до японского, но после французского я вовремя остановился. Перевод 183 картин на испанский и французский занял 17 заходов, доведя количество страниц до 309 на каждом языке. Радость длилась недолго. В испанской версии эпохи неожиданно превратились в Realismoo, а французский Modernisme стал Modernismee — всего зафиксировано 264 подобных удвоения.
Технические теги тоже пострадали: HTML-тег body перевели на испанский как , а на французский как . Браузеры как-то справлялись с этим, но я долго смеялся. Гораздо сильнее меня напугала пропажа одной буквы в разметке на 14 английских страницах, из-за чего браузеры просто скрывали целые предложения, считая их ошибочными тегами.
Миллион слов: производственный ад
В августе я приступил к созданию масштабных разборов объемом от 1200 до 1800 слов на каждую картину во всех языковых версиях. Суммарный объем превысил миллион слов. Процесс превратился в тяжелое производство со всеми сопутствующими авариями: регулярным упиранием в лимиты расходов API, потерей закрывающих тегов разметки и внезапными сбоями файловой системы macOS, очистившей временную папку с задачами прямо посреди рабочего процесса.
Проверка качества финальных текстов выявила десятки материалов с серьезными недоработками и фактическими ошибками. ИИ регулярно находил собственные огрехи с незакрытыми абзацами, исправлял их, тут же создавая новые лишние теги, и самостоятельно вырабатывал правила для последующих итераций. Полная чистота кода достигалась лишь после нескольких кругов проверок.
Ноль из сорока и скрытые препятствия SEO
К концу августа сайт был полностью готов: настроены FAQ, файлы llms.txt и robots.txt с открытым доступом для ведущих поисковых ботов. Однако тестовая проверка по сорока реальным поисковым запросам показала нулевой результат — проект не появился ни разу, уступив авторитетным энциклопедиям. Как выяснилось позже, встроенная функция Managed robots.txt в Cloudflare автоматически блокировала тех же ботов, которых я пытался привлечь.
Дополнительной проблемой стал двухчасовой кэш на Cloudflare, из-за чего поисковые роботы постоянно натыкались на медленный холодный сервер, оставляя страницы непросканированными. Увеличение времени кэширования и прогрев сервера решили эту проблему.
Испанский языковой казус
Необычный инцидент произошел с языковой индексацией. Заметив нулевую статистику по испанскому и французскому языкам, я ошибочно решил, что они портят общую картину, и закрыл их от индексации. После возвращения доступа выяснилось, что поисковые системы мгновенно проиндексировали огромный массив страниц, а испанский раздел стал самым крупным. Проблема заключалась вовсе не в самих языках, а в том, что поисковики их элементарно не видели.
Итоги эксперимента
На сегодняшний день инфраструктура насчитывает более двух тысяч файлов и свыше 1200 страниц в индексе. Парадоксально, но максимальный поисковый трафик приносят обычные статьи под популярные запросы, тогда как сложнейшая техническая оптимизация и разметка дали минимальный отдаток.
Главный вывод от взаимодействия с нейросетями заключается в том, что искусственный интеллект выполняет колоссальный объем рутинной работы молниеносно, но совершенно не умеет адекватно оценивать собственные ошибки. Его отчеты о готовности требуют обязательной ручной инспекции, а стратегические решения и ответственность всегда остаются за человеком. Построить техническую базу силами ИИ возможно, но привлекать живых людей на ресурс — по-прежнему наша задача.
