3D-сцена из текста · эксперимент Karpathy

Текст в 3D-сцену нейросетью в 2026 году: повторяю приём Karpathy

5 сентября 2026 я попросил Claude собрать 3D-сцену из трёх строк текста - результат появился в браузере за 1:18.94. Тот же принцип 2 августа 2026 испытал Andrej Karpathy: дал Claude Opus первый абзац «Властелина колец» и попросил превратить его в three.js-рендер

К концу статьи у тебя будет: честный разбор, что Karpathy сделал на самом деле (это не «текстовое описание в 3D», как многие пересказывают, а куда более масштабная задача), мой собственный прогон с логами и кадрами, 4 шага, чтобы повторить приём на своём компьютере, и список того, где этот метод ломается прямо сейчас - я наткнулся на это сам, не в теории

Опиши сцену тремя-пятью простыми предложениями в текстовом файле, попроси Claude Code одним запросом собрать из неё HTML-файл с three.js - и через минуту-полторы получишь рабочую 3D-сцену в браузере. Дальше в статье - что сделал Karpathy на несравнимо большем масштабе, мой собственный прогон с логами и где эта техника ломается

Что Karpathy сделал на самом деле - и почему это не совсем то, что кажется

Короткая версия, которая разошлась в пересказах: «Karpathy превратил текст в 3D-сцену». Длинная версия честнее и интереснее. В посте на X он написал: «We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle"» - старый простой тест ИИ (нарисовать пеликана на велосипеде) он назвал пройденным этапом

Дальше - собственно эксперимент. Karpathy дал модели Claude Opus не абстрактное «опиши лес», а первый абзац настоящего романа - «Властелина колец» Толкина, бюджет 1 миллион токенов (около 10 долларов) и задание сделать из этого текста процедурный рендер на three.js - открытой библиотеке для 3D-графики в браузере. Модель работала около 2 часов и написала примерно 5500 строк кода, которые сами разместили низкополигональные объекты в 3D-долине, расставили персонажей и камеры

Собственный прогон: 3D-сцена леса, хижины и костра, построенная Claude из трёх строк текста
Мой собственный прогон 5 сентября 2026: сцена собрана Claude Code из трёх предложений текста за 1:18.94, без единой ручной правки кода

Karpathy выложил готовую интерактивную версию на karpathy.ai/lotr-movie и открыл исходный код - сцену можно менять: подвинуть здание, переставить камеру, дописать взаимодействие. Свою же оценку результата он дал прямо и без прикрас: «It's kind of janky but fun» - «немного корявое, но забавное». Отдельно назвал происходящее «mindboggling» в смысле, что модель сама управляла координатами многоугольников в пространстве через код, без единого 3D-редактора с мышкой

Почему подача «текстовое описание в 3D» вводит в заблуждение

Разница важна для честности статьи. Karpathy не набросал сам короткое описание сцены - он скормил модели готовый литературный текст (абзац Толкина) и потратил сумму и время, недоступные для разового личного эксперимента: миллион токенов, 10 долларов и 2 часа расчёта ради одной сцены. Это тест возможностей флагманской модели на пределе бюджета, а не рецепт «сделай себе так же за вечер»

Я это не повторяю буквально - трата сравнимого бюджета ради гайда никому не нужна. Дальше в статье - повторение того же ПРИНЦИПА (текст → процедурная 3D-сцена одним запросом к Claude) на разумном для одного человека масштабе: свой прогон занял 79 секунд и не потребовал отдельной оплаты токенов сверх обычной подписки

Проверил сам: от трёх строк текста до сцены в браузере

Чтобы не пересказывать чужой эксперимент со стороны, я собрал свой - на своём компьютере, версия Claude Code 2.1.251. Если у тебя ещё не установлен сам инструмент, с этого стоит начать: гайд Claude Code установка из России: скачать, оплатить подписку Pro и Max разбирает вход с нуля, а гайд Что делать после установки Claude Code: первые шаги - первые команды сразу после входа. Написал текстовый файл с тремя предложениями:

На краю тёмного соснового леса стоит маленькая деревянная хижина с покатой крышей.
Перед ней горит костёр, вокруг него три низких валуна.
Небо над лесом фиолетовое, взошла одна большая жёлтая луна.

Дальше - один запрос в терминале Claude Code с просьбой прочитать этот файл и написать самодостаточный HTML-файл со сценой на three.js, подключённой через CDN, плюс управление камерой мышью. Запустил и замерил время командой time: результат готов за 1 минуту 18,94 секунды. На выходе - файл на 345 строк и 12423 байта, который я не трогал руками ни разу

Открыл файл в браузере headless-скриптом - и сцена реально построилась: низкополигональные сосны, хижина с покатой крышей и светящимся окном, костёр с языками пламени и точечным светом, фиолетовое небо через эффект дымки (fog). Всё, что было в трёх строчках текста, оказалось на экране без единой строчки кода, написанной мной лично. Насколько точно текст запроса влияет на результат - отдельная тема, которую разбирает гайд Как писать промпты для Claude 5: 6 правил вместо старых: чем конкретнее формулировка, тем меньше приходится доводить сцену руками

3D-сцена крупным планом - лес, хижина со светящимся окном и костёр без искажений камеры
Тот же собственный прогон 5 сентября 2026, камера довёрнута мышью крупным планом на хижину: видны сосны, покатая крыша, светящееся окно и костёр с тремя валунами - ровно то, что было в трёх строках текста

Сравнение масштаба: что потратил Karpathy и что потратил я

Разница в бюджете и времени - не мелкая деталь, а главное объяснение, почему результаты выглядят по-разному:

Эксперимент KarpathyМой собственный прогон
Исходный текстАбзац романа Толкина3 своих предложения
Бюджет1 млн токенов (~$10)Обычный запрос без доплаты
Время~2 часа1:18.94
Итог~5500 строк кода, целая долина345 строк, одна сцена во дворе

Таблица прокручивается вбок →

Технические детали моего прогона

Для тех, кто хочет повторить точь-в-точь - вот параметры, которые я использовал:

ПараметрЗначение
Версия Claude Code2.1.251
Библиотекаthree.js через CDN (unpkg.com)
Управление камеройOrbitControls (тоже через CDN)
Размер результата345 строк, 12423 байта
Время выполнения1:18.94 (замерено командой time)

Таблица прокручивается вбок →

Что сломалось при повороте камеры - живой предел метода

Здесь начинается самое честное место статьи. Я покрутил сцену мышью через встроенное управление камерой (OrbitControls) с разных сторон - и на части ракурсов вместо аккуратной композиции получил либо гигантскую плоскую землю крупным планом, либо одну низкополигональную сосну, закрывающую половину экрана

Второй ракурс той же 3D-сцены - виден предел метода, гигантская сосна закрывает часть кадра при повороте камеры
Тот же собственный прогон 5 сентября 2026, сцена развёрнута мышью: одна низкополигональная сосна крупным планом закрывает половину кадра - масштаб объекта не согласован с позицией камеры

Разобрал причину прямо в коде: земля построена как плоский диск радиусом 120 условных единиц, а сосны расставлены по сцене без проверки, не окажется ли какая-то из них слишком близко к точке, откуда в итоге посмотрит камера. Модель не сопоставила размеры объектов с диапазоном возможных ракурсов - при повороте то диск земли, то отдельная сосна попадают в кадр крупным планом и закрывают собой всю композицию вместо аккуратного вида на лес и хижину

Второй дефект: файл не такой самодостаточный, как просили

Второй честный дефект того же файла: я прямым текстом просил написать «ОДИН самодостаточный HTML-файл», но результат не содержит тегов <html>, <head> и <body> вообще - только фрагмент разметки. Сцена всё равно работает, потому что браузер сам достраивает эти теги вокруг любого фрагмента, но с точки зрения корректного документа это дефект, а не мелочь

Это ровно тот же класс ограничений, который назвал сам Karpathy про свой куда более крупный эксперимент: модель не воспринимает готовую 3D-сцену «глазами» и не может на лету проверить, как она выглядит с разных ракурсов, - только пишет код и надеется, что расчёт координат окажется верным. Проверка результата и его доводка остаются на человеке

Оба честных дефекта моего прогона одной строкой:

ДефектЧто произошлоЧто я сделал
Масштаб объектовДиск земли и отдельная сосна закрывают кадр при повороте камерыНашёл ракурс, где предел виден, а не скрыл его
Структура файлаНет тегов html/head/body при прямой просьбе о самодостаточном файлеОставил как честную находку, не подчистил вручную

Таблица прокручивается вбок →

Шаг 1. Опиши сцену простыми словами

Открой любой текстовый редактор и опиши сцену 3-5 предложениями: что на ней стоит, какого цвета небо, что светится или движется. Чем конкретнее предметы (не «дерево», а «низкая сосна»; не «дом», а «хижина с покатой крышей») - тем точнее модель попадёт в задуманное

Что увидишь: обычный текстовый файл без единой строчки кода. Это тебе даёт черновик задания, который дальше превратится в код без твоего участия

Шаг 2. Попроси Claude Code одним запросом собрать HTML-файл

Открой терминал в папке с текстовым описанием и попроси Claude прочитать файл и написать HTML-страницу с three.js-сценой, подключённой через CDN, с управлением камерой мышью. Одна команда, один запрос - без переписки туда-сюда. Если хочется закрепить такой запрос как повторяемую команду, а не набирать заново каждый раз - для этого в Claude Code есть отдельный механизм навыков, разобранный в гайде Как сделать свой Skill в Claude за 5 шагов: живой прогон 2026

Что увидишь: через минуту-полторы (мой прогон занял 79 секунд) в папке появится новый HTML-файл. Это тебе даёт готовый результат без единой строчки кода, написанной руками

Шаг 3. Открой файл в браузере и проверь

Дважды кликни по получившемуся HTML-файлу - он откроется прямо в браузере с адресом вида file://

Что увидишь: 3D-сцену с объектами, которые ты описал текстом. Это тебе даёт первую живую проверку - совпадает ли то, что построилось, с тем, что ты представлял себе в голове

Шаг 4. Покрути сцену и найди, что сломалось

Зажми левую кнопку мыши на сцене и подвигай - это управление камерой (OrbitControls) должно повернуть вид. Проверь сцену с нескольких ракурсов, не только с того, что открылся по умолчанию

Что увидишь: скорее всего, где-то масштаб объектов относительно друг друга или позиция камеры окажется странной - у меня это была гигантская плоская земля, закрывающая полкадра. Это тебе даёт честную картину: метод работает, но результат первого запроса почти никогда не финальный, доводка на глаз всё равно нужна

Чем это отличается от других приёмов «сделай штуку одним промптом»

3D-сцена текстом - не единственный подобный трюк. Игра одним промптом устроена похоже, но выдаёт другой результат - интерактивную игру с правилами и вводом от игрока, а не статичную сцену: смотри разбор в гайде Игра одним промптом: Claude Opus 5 и GPT-5.6 в браузере. Лендинг одной строкой - тоже one-shot генерация Claude, но итог там текст и разметка для людей, а не 3D-объекты: смотри Создание сайтов на Claude: лендинг одной строкой в Claude Code

Готовый чужой 3D-проект, который не нужно собирать самому, а можно сразу установить и запустить - это другой сценарий: Офис ИИ агентов в 3D: открытый проект The Delegation в браузере разбирает готовое приложение с виртуальным офисом агентов, а не эксперимент по one-shot генерации сцены

Если хочется не просто повторить трюк, а закрепить его в готовую настройку под свои проекты - разница между разовым промптом и постоянной настройкой разобрана в гайде Как усилить Claude в 10 раз: 7 настроек вместо промптов. А сравнение самого Claude Code с похожими инструментами - в гайдах Cursor или Claude Code в 2026 году: разница в 6 раз на тесте и Goose или Claude Code: 2 способа получить ИИ-агента в 2026

Если сама техника «попросить Claude одним запросом» ещё в новинку - общий подход разобран в гайде Вайбкодинг: что это простыми словами и как начать с нуля в 2026. А ещё один вирусный текстовый файл этого же автора, но совсем про другое (правила поведения для Claude Code, не про 3D) - в гайде CLAUDE.md Karpathy: 210K звёзд и 4 правила простыми словами

Генерация 3D-сцены текстом - лишь один приём из целого направления, где нейросеть создаёт визуал по описанию: картинки, видео, аватары и озвучку разбирает раздел Генерация визуала нейросетью - там собраны похожие эксперименты и готовые инструменты

Что этот метод не решает

Метод не заменяет 3D-художника и не даёт контроля над деталями на уровне профессионального рендера - модель расставляет примитивы по своей логике, и результат первого запроса почти всегда требует доводки на глаз, как показал мой собственный прогон с гигантской землёй не того масштаба

Метод также не даёт модели «увидеть» готовую сцену со стороны в процессе работы - она пишет код вслепую и полагается на то, что расчёт координат окажется верным. Сам Karpathy отметил ту же границу на своём куда более крупном эксперименте: проверка через скриншоты медленная, потому что модель не воспринимает видео и картинку сцены нативно в процессе генерации кода

Что ещё почитать про Claude Code и подобные эксперименты

Источники

Памятка: текст в 3D-сцену за 4 шага

Пять строк, которые закрывают путь от идеи до первого рабочего кадра

Сохрани себе

  • Karpathy дал Claude Opus абзац «Властелина колец», 1 млн токенов (~$10) и 2 часа расчёта - это тест на пределе бюджета, не рецепт на вечер
  • Мой собственный прогон занял 79 секунд на трёх предложениях текста, без доплаты за токены
  • Опиши сцену 3-5 конкретными предложениями, попроси Claude Code одним запросом собрать HTML-файл с three.js
  • Открой файл в браузере и обязательно поверни камеру мышью - первый ракурс редко показывает все проблемы
  • Метод не заменяет доводку на глаз: масштаб объектов и позиция камеры почти всегда требуют правки после первого запроса

Порог входа

Сцена за минуту получилась бесплатно, следующий шаг - тоже

Всё, что нужно, чтобы превратить текст в 3D-сцену через Claude, ты только что прочитал бесплатно: что сделал Karpathy на самом деле, мой собственный прогон с честным разбором предела и 4 шага, чтобы попробовать самому. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоих же экспериментов, тоже бесплатно

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

Правда ли Karpathy просто описал сцену текстом и получил готовый 3D-мир?

Не совсем. Он дал модели готовый литературный абзац «Властелина колец», а не собственное описание сцены, и потратил 1 миллион токенов (около 10 долларов) на 2 часа расчёта ради одной большой демонстрации - это тест возможностей модели на пределе бюджета, а не быстрый личный эксперимент

Сколько стоил мой собственный прогон?

Отдельной доплаты не было - запрос уложился в обычную подписку Claude Code, а сам прогон занял 79 секунд без дополнительных трат сверх обычного использования инструмента

Что Karpathy сказал о качестве результата?

Дословно: «It's kind of janky but fun» - «немного корявое, но забавное». Отдельно назвал происходящее «mindboggling» в смысле того, что модель сама рассчитывала координаты объектов в 3D-пространстве через код

Какая библиотека стоит за такими сценами?

Three.js - открытая JavaScript-библиотека для 3D-графики в браузере, актуальная версия на 5 сентября 2026 - r185. И эксперимент Karpathy, и мой собственный прогон построены на ней

В чём главный предел метода на практике?

Модель не видит готовую сцену со стороны в процессе работы и пишет код вслепую, поэтому масштаб объектов и позиция камеры почти всегда получаются рассогласованными с первого раза - в моём прогоне земля оказалась гигантским диском, который закрывал половину кадра при повороте камеры

Нужны ли навыки программирования, чтобы повторить эксперимент?

Нет для самого запроса - весь код пишет Claude по текстовому описанию. Но для разбора того, что сломалось (как в разделе про предел метода выше), придётся хотя бы немного прочитать получившийся код и понять, что означают такие вещи как размер и позиция объектов