3D-сцена из текста · эксперимент Karpathy
Текст в 3D-сцену нейросетью в 2026 году: повторяю приём Karpathy
5 сентября 2026 я попросил Claude собрать 3D-сцену из трёх строк текста - результат появился в браузере за 1:18.94. Тот же принцип 2 августа 2026 испытал Andrej Karpathy: дал Claude Opus первый абзац «Властелина колец» и попросил превратить его в three.js-рендер
К концу статьи у тебя будет: честный разбор, что Karpathy сделал на самом деле (это не «текстовое описание в 3D», как многие пересказывают, а куда более масштабная задача), мой собственный прогон с логами и кадрами, 4 шага, чтобы повторить приём на своём компьютере, и список того, где этот метод ломается прямо сейчас - я наткнулся на это сам, не в теории
Опиши сцену тремя-пятью простыми предложениями в текстовом файле, попроси Claude Code одним запросом собрать из неё HTML-файл с three.js - и через минуту-полторы получишь рабочую 3D-сцену в браузере. Дальше в статье - что сделал Karpathy на несравнимо большем масштабе, мой собственный прогон с логами и где эта техника ломается
Что Karpathy сделал на самом деле - и почему это не совсем то, что кажется
Короткая версия, которая разошлась в пересказах: «Karpathy превратил текст в 3D-сцену». Длинная версия честнее и интереснее. В посте на X он написал: «We're starting to leave the territory where you'd test an LLM by e.g. "create an svg of pelican on a bicycle"» - старый простой тест ИИ (нарисовать пеликана на велосипеде) он назвал пройденным этапом
Дальше - собственно эксперимент. Karpathy дал модели Claude Opus не абстрактное «опиши лес», а первый абзац настоящего романа - «Властелина колец» Толкина, бюджет 1 миллион токенов (около 10 долларов) и задание сделать из этого текста процедурный рендер на three.js - открытой библиотеке для 3D-графики в браузере. Модель работала около 2 часов и написала примерно 5500 строк кода, которые сами разместили низкополигональные объекты в 3D-долине, расставили персонажей и камеры
Karpathy выложил готовую интерактивную версию на karpathy.ai/lotr-movie и открыл исходный код - сцену можно менять: подвинуть здание, переставить камеру, дописать взаимодействие. Свою же оценку результата он дал прямо и без прикрас: «It's kind of janky but fun» - «немного корявое, но забавное». Отдельно назвал происходящее «mindboggling» в смысле, что модель сама управляла координатами многоугольников в пространстве через код, без единого 3D-редактора с мышкой
Почему подача «текстовое описание в 3D» вводит в заблуждение
Разница важна для честности статьи. Karpathy не набросал сам короткое описание сцены - он скормил модели готовый литературный текст (абзац Толкина) и потратил сумму и время, недоступные для разового личного эксперимента: миллион токенов, 10 долларов и 2 часа расчёта ради одной сцены. Это тест возможностей флагманской модели на пределе бюджета, а не рецепт «сделай себе так же за вечер»
Я это не повторяю буквально - трата сравнимого бюджета ради гайда никому не нужна. Дальше в статье - повторение того же ПРИНЦИПА (текст → процедурная 3D-сцена одним запросом к Claude) на разумном для одного человека масштабе: свой прогон занял 79 секунд и не потребовал отдельной оплаты токенов сверх обычной подписки
Проверил сам: от трёх строк текста до сцены в браузере
Чтобы не пересказывать чужой эксперимент со стороны, я собрал свой - на своём компьютере, версия Claude Code 2.1.251. Если у тебя ещё не установлен сам инструмент, с этого стоит начать: гайд Claude Code установка из России: скачать, оплатить подписку Pro и Max разбирает вход с нуля, а гайд Что делать после установки Claude Code: первые шаги - первые команды сразу после входа. Написал текстовый файл с тремя предложениями:
На краю тёмного соснового леса стоит маленькая деревянная хижина с покатой крышей.
Перед ней горит костёр, вокруг него три низких валуна.
Небо над лесом фиолетовое, взошла одна большая жёлтая луна.
Дальше - один запрос в терминале Claude Code с просьбой прочитать этот файл и написать самодостаточный HTML-файл со сценой на three.js, подключённой через CDN, плюс управление камерой мышью. Запустил и замерил время командой time: результат готов за 1 минуту 18,94 секунды. На выходе - файл на 345 строк и 12423 байта, который я не трогал руками ни разу
Открыл файл в браузере headless-скриптом - и сцена реально построилась: низкополигональные сосны, хижина с покатой крышей и светящимся окном, костёр с языками пламени и точечным светом, фиолетовое небо через эффект дымки (fog). Всё, что было в трёх строчках текста, оказалось на экране без единой строчки кода, написанной мной лично. Насколько точно текст запроса влияет на результат - отдельная тема, которую разбирает гайд Как писать промпты для Claude 5: 6 правил вместо старых: чем конкретнее формулировка, тем меньше приходится доводить сцену руками
Сравнение масштаба: что потратил Karpathy и что потратил я
Разница в бюджете и времени - не мелкая деталь, а главное объяснение, почему результаты выглядят по-разному:
| Эксперимент Karpathy | Мой собственный прогон | |
|---|---|---|
| Исходный текст | Абзац романа Толкина | 3 своих предложения |
| Бюджет | 1 млн токенов (~$10) | Обычный запрос без доплаты |
| Время | ~2 часа | 1:18.94 |
| Итог | ~5500 строк кода, целая долина | 345 строк, одна сцена во дворе |
Таблица прокручивается вбок →
Технические детали моего прогона
Для тех, кто хочет повторить точь-в-точь - вот параметры, которые я использовал:
| Параметр | Значение |
|---|---|
| Версия Claude Code | 2.1.251 |
| Библиотека | three.js через CDN (unpkg.com) |
| Управление камерой | OrbitControls (тоже через CDN) |
| Размер результата | 345 строк, 12423 байта |
| Время выполнения | 1:18.94 (замерено командой time) |
Таблица прокручивается вбок →
Что сломалось при повороте камеры - живой предел метода
Здесь начинается самое честное место статьи. Я покрутил сцену мышью через встроенное управление камерой (OrbitControls) с разных сторон - и на части ракурсов вместо аккуратной композиции получил либо гигантскую плоскую землю крупным планом, либо одну низкополигональную сосну, закрывающую половину экрана
Разобрал причину прямо в коде: земля построена как плоский диск радиусом 120 условных единиц, а сосны расставлены по сцене без проверки, не окажется ли какая-то из них слишком близко к точке, откуда в итоге посмотрит камера. Модель не сопоставила размеры объектов с диапазоном возможных ракурсов - при повороте то диск земли, то отдельная сосна попадают в кадр крупным планом и закрывают собой всю композицию вместо аккуратного вида на лес и хижину
Второй дефект: файл не такой самодостаточный, как просили
Второй честный дефект того же файла: я прямым текстом просил написать «ОДИН самодостаточный HTML-файл», но результат не содержит тегов <html>, <head> и <body> вообще - только фрагмент разметки. Сцена всё равно работает, потому что браузер сам достраивает эти теги вокруг любого фрагмента, но с точки зрения корректного документа это дефект, а не мелочь
Это ровно тот же класс ограничений, который назвал сам Karpathy про свой куда более крупный эксперимент: модель не воспринимает готовую 3D-сцену «глазами» и не может на лету проверить, как она выглядит с разных ракурсов, - только пишет код и надеется, что расчёт координат окажется верным. Проверка результата и его доводка остаются на человеке
Оба честных дефекта моего прогона одной строкой:
| Дефект | Что произошло | Что я сделал |
|---|---|---|
| Масштаб объектов | Диск земли и отдельная сосна закрывают кадр при повороте камеры | Нашёл ракурс, где предел виден, а не скрыл его |
| Структура файла | Нет тегов html/head/body при прямой просьбе о самодостаточном файле | Оставил как честную находку, не подчистил вручную |
Таблица прокручивается вбок →
Шаг 1. Опиши сцену простыми словами
Открой любой текстовый редактор и опиши сцену 3-5 предложениями: что на ней стоит, какого цвета небо, что светится или движется. Чем конкретнее предметы (не «дерево», а «низкая сосна»; не «дом», а «хижина с покатой крышей») - тем точнее модель попадёт в задуманное
Что увидишь: обычный текстовый файл без единой строчки кода. Это тебе даёт черновик задания, который дальше превратится в код без твоего участия
Шаг 2. Попроси Claude Code одним запросом собрать HTML-файл
Открой терминал в папке с текстовым описанием и попроси Claude прочитать файл и написать HTML-страницу с three.js-сценой, подключённой через CDN, с управлением камерой мышью. Одна команда, один запрос - без переписки туда-сюда. Если хочется закрепить такой запрос как повторяемую команду, а не набирать заново каждый раз - для этого в Claude Code есть отдельный механизм навыков, разобранный в гайде Как сделать свой Skill в Claude за 5 шагов: живой прогон 2026
Что увидишь: через минуту-полторы (мой прогон занял 79 секунд) в папке появится новый HTML-файл. Это тебе даёт готовый результат без единой строчки кода, написанной руками
Шаг 3. Открой файл в браузере и проверь
Дважды кликни по получившемуся HTML-файлу - он откроется прямо в браузере с адресом вида file://
Что увидишь: 3D-сцену с объектами, которые ты описал текстом. Это тебе даёт первую живую проверку - совпадает ли то, что построилось, с тем, что ты представлял себе в голове
Шаг 4. Покрути сцену и найди, что сломалось
Зажми левую кнопку мыши на сцене и подвигай - это управление камерой (OrbitControls) должно повернуть вид. Проверь сцену с нескольких ракурсов, не только с того, что открылся по умолчанию
Что увидишь: скорее всего, где-то масштаб объектов относительно друг друга или позиция камеры окажется странной - у меня это была гигантская плоская земля, закрывающая полкадра. Это тебе даёт честную картину: метод работает, но результат первого запроса почти никогда не финальный, доводка на глаз всё равно нужна
Чем это отличается от других приёмов «сделай штуку одним промптом»
3D-сцена текстом - не единственный подобный трюк. Игра одним промптом устроена похоже, но выдаёт другой результат - интерактивную игру с правилами и вводом от игрока, а не статичную сцену: смотри разбор в гайде Игра одним промптом: Claude Opus 5 и GPT-5.6 в браузере. Лендинг одной строкой - тоже one-shot генерация Claude, но итог там текст и разметка для людей, а не 3D-объекты: смотри Создание сайтов на Claude: лендинг одной строкой в Claude Code
Готовый чужой 3D-проект, который не нужно собирать самому, а можно сразу установить и запустить - это другой сценарий: Офис ИИ агентов в 3D: открытый проект The Delegation в браузере разбирает готовое приложение с виртуальным офисом агентов, а не эксперимент по one-shot генерации сцены
Если хочется не просто повторить трюк, а закрепить его в готовую настройку под свои проекты - разница между разовым промптом и постоянной настройкой разобрана в гайде Как усилить Claude в 10 раз: 7 настроек вместо промптов. А сравнение самого Claude Code с похожими инструментами - в гайдах Cursor или Claude Code в 2026 году: разница в 6 раз на тесте и Goose или Claude Code: 2 способа получить ИИ-агента в 2026
Если сама техника «попросить Claude одним запросом» ещё в новинку - общий подход разобран в гайде Вайбкодинг: что это простыми словами и как начать с нуля в 2026. А ещё один вирусный текстовый файл этого же автора, но совсем про другое (правила поведения для Claude Code, не про 3D) - в гайде CLAUDE.md Karpathy: 210K звёзд и 4 правила простыми словами
Генерация 3D-сцены текстом - лишь один приём из целого направления, где нейросеть создаёт визуал по описанию: картинки, видео, аватары и озвучку разбирает раздел Генерация визуала нейросетью - там собраны похожие эксперименты и готовые инструменты
Что этот метод не решает
Метод не заменяет 3D-художника и не даёт контроля над деталями на уровне профессионального рендера - модель расставляет примитивы по своей логике, и результат первого запроса почти всегда требует доводки на глаз, как показал мой собственный прогон с гигантской землёй не того масштаба
Метод также не даёт модели «увидеть» готовую сцену со стороны в процессе работы - она пишет код вслепую и полагается на то, что расчёт координат окажется верным. Сам Karpathy отметил ту же границу на своём куда более крупном эксперименте: проверка через скриншоты медленная, потому что модель не воспринимает видео и картинку сцены нативно в процессе генерации кода
Что ещё почитать про Claude Code и подобные эксперименты
- Игра одним промптом: Claude Opus 5 и GPT-5.6 в браузере (2026) - тот же жанр one-shot генерации, но результат - интерактивная игра
- Создание сайтов на Claude: лендинг одной строкой в Claude Code - one-shot генерация текста и разметки вместо 3D-объектов
- Офис ИИ агентов в 3D: открытый проект The Delegation в браузере - готовое чужое 3D-приложение для установки, не эксперимент с генерацией
- Вайбкодинг: что это простыми словами и как начать с нуля в 2026 - общий подход, если сама техника «попросить Claude одним запросом» пока в новинку
- CLAUDE.md Karpathy: 210K звёзд и 4 правила простыми словами - ещё один вирусный артефакт того же автора, но про правила поведения агента, не про 3D
- Claude Code установка из России: скачать, оплатить подписку Pro и Max - если инструмента для собственного прогона ещё нет
- Что делать после установки Claude Code: первые шаги - первые команды сразу после установки
- Как писать промпты для Claude 5: 6 правил вместо старых - как точнее сформулировать текстовое описание сцены
- Как сделать свой Skill в Claude за 5 шагов: живой прогон 2026 - как закрепить повторяемый запрос вместо разового промпта
- Как усилить Claude в 10 раз: 7 настроек вместо промптов - разница между разовым промптом и постоянной настройкой
- Cursor или Claude Code в 2026 году: разница в 6 раз на тесте - сравнение с похожим инструментом
- Goose или Claude Code: 2 способа получить ИИ-агента в 2026 - ещё одно сравнение подходов
Источники
- Пост Andrej Karpathy на X - первоисточник задания, цифр и цитаты «kind of janky but fun»
- BigGo Finance: разбор эксперимента - независимое подтверждение цифр $10, 5500 строк, 2 часа
- explainx.ai: разбор с цитатами Karpathy - оценка «kind of janky but fun», ограничения (видео, аудио через ElevenLabs)
- Developers Digest: разбор бюджета и задания - независимое подтверждение 1M токенов и формулировки задания
- Three.js - официальный сайт библиотеки - инструмент, на котором построены оба эксперимента
Памятка: текст в 3D-сцену за 4 шага
Пять строк, которые закрывают путь от идеи до первого рабочего кадра
Сохрани себе
- Karpathy дал Claude Opus абзац «Властелина колец», 1 млн токенов (~$10) и 2 часа расчёта - это тест на пределе бюджета, не рецепт на вечер
- Мой собственный прогон занял 79 секунд на трёх предложениях текста, без доплаты за токены
- Опиши сцену 3-5 конкретными предложениями, попроси Claude Code одним запросом собрать HTML-файл с three.js
- Открой файл в браузере и обязательно поверни камеру мышью - первый ракурс редко показывает все проблемы
- Метод не заменяет доводку на глаз: масштаб объектов и позиция камеры почти всегда требуют правки после первого запроса
Порог входа
Сцена за минуту получилась бесплатно, следующий шаг - тоже
Всё, что нужно, чтобы превратить текст в 3D-сцену через Claude, ты только что прочитал бесплатно: что сделал Karpathy на самом деле, мой собственный прогон с честным разбором предела и 4 шага, чтобы попробовать самому. Следующий шаг - три дня разбора и сборки рабочего порядка вокруг твоих же экспериментов, тоже бесплатно
Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно
Частые вопросы
Правда ли Karpathy просто описал сцену текстом и получил готовый 3D-мир?
Не совсем. Он дал модели готовый литературный абзац «Властелина колец», а не собственное описание сцены, и потратил 1 миллион токенов (около 10 долларов) на 2 часа расчёта ради одной большой демонстрации - это тест возможностей модели на пределе бюджета, а не быстрый личный эксперимент
Сколько стоил мой собственный прогон?
Отдельной доплаты не было - запрос уложился в обычную подписку Claude Code, а сам прогон занял 79 секунд без дополнительных трат сверх обычного использования инструмента
Что Karpathy сказал о качестве результата?
Дословно: «It's kind of janky but fun» - «немного корявое, но забавное». Отдельно назвал происходящее «mindboggling» в смысле того, что модель сама рассчитывала координаты объектов в 3D-пространстве через код
Какая библиотека стоит за такими сценами?
Three.js - открытая JavaScript-библиотека для 3D-графики в браузере, актуальная версия на 5 сентября 2026 - r185. И эксперимент Karpathy, и мой собственный прогон построены на ней
В чём главный предел метода на практике?
Модель не видит готовую сцену со стороны в процессе работы и пишет код вслепую, поэтому масштаб объектов и позиция камеры почти всегда получаются рассогласованными с первого раза - в моём прогоне земля оказалась гигантским диском, который закрывал половину кадра при повороте камеры
Нужны ли навыки программирования, чтобы повторить эксперимент?
Нет для самого запроса - весь код пишет Claude по текстовому описанию. Но для разбора того, что сломалось (как в разделе про предел метода выше), придётся хотя бы немного прочитать получившийся код и понять, что означают такие вещи как размер и позиция объектов