Попросили ChatGPT составить план тренировок, а затем показали его профессиональным тренерам. Реакция экспертов была далека от восторга. Узнайте, почему нейросеть не справилась с этой задачей и какие ошибки она допустила.
Есть такой соблазн, знакомый почти каждому, кто хоть раз открывал приложение с нейросетью в межсезонье или после Нового года. Написать программу тренировок самому? Долго, муторно, опять же вдруг ошибёшься с объёмом или неправильно подберешь силовые упражнения.
Идти к тренеру? Дорого, да и запись на следующую неделю. А тут открыл чат, набросал пару предложений про свой уровень и цель, и через десять секунд получил стройный план на двенадцать недель, с процентами от максимума и красивой периодизацией. Соблазн велик. Вопрос в другом: а он вообще рабочий, этот план?
Именно этим вопросом задалась команда исследователей из нескольких европейских университетов (Германия, включая Брауншвейгский технический университет и Вюрцбургский университет спортивной науки) и опубликовала ответ в 2025 году в журнале Biology of Sport. Работу так и назвали, без затей: профессиональная оценка тренировочных планов для гипертрофии и максимальной силы, разработанных генеративным искусственным интеллектом.
Как проверяли: не на глаз, а по 27 пунктам
Схема эксперимента получилась приятно дотошной. Исследователи взяли три языковые модели, доступные широкой публике на момент исследования (30 апреля 2024 года): GPT-3.5 через интерфейс ChatGPT, тот же GPT-3.5 через Microsoft Copilot, и отдельно Google Gemini. Каждой модели дали одинаковый структурированный запрос с описанием вымышленного, но детально прописанного атлета: уровень подготовки продвинутый, цели и тренировочная история заданы заранее, никакой отсебятины и додумывания за пользователя.
Дальше в дело вступили люди. Десять практикующих тренеров, у каждого профильное образование в области спортивной науки и минимум два года реального коучинга за плечами, оценили полученные планы по строгой сетке: 27 критериев, от выбора упражнений и подбора объёма до продуманности стратегий восстановления и наличия тестирующих процедур.
Оценка по классической пятибалльной шкале Лайкерта, той самой, которой меряют вообще всё на свете, от удобства сайта до вкуса кофе в переговорной.
И что показала оценка
Если коротко: неплохо, но без явного восторга. Общее качество планов эксперты назвали умеренным, средним, ни рыба ни мясо. По большинству из 27 критериев статистически значимой разницы между моделями не нашлось, планы получились в целом сопоставимыми.
Gemini обошёл связку GPT-3.5 по паре пунктов, в первую очередь по продуманности продвинутых методов тренировки и стратегий восстановления, там, где нужна не просто арифметика подходов и повторений, а понимание, как тело реагирует на усталость. GPT-3.5 через Copilot, в свою очередь, оказался немного точнее в одном пункте, касающемся процедур тестирования исходного уровня атлета.
Но куда важнее сухих цифр другой факт: оценки почти никогда не поднимались выше четырёх баллов из пяти, ни у одной из моделей. Не провал, но и не тот уровень, при котором тренер готов подписаться под тренировочным планом не глядя.
Авторы работы сформулировали вывод предельно осторожно и одновременно прямо: языковые модели годятся как черновой каркас тренировочной программы, но экспертный надзор человека остаётся необходимым, чтобы этот каркас довести до ума, потому что нейросеть не способна учитывать индивидуальную реакцию конкретного человека на нагрузку, вопросы безопасности и сложные физиологические процессы адаптации, которые видит опытный тренер вживую.
А если спросить более новую модель
Тут есть занятный постскриптум. Отдельное исследование, проведённое чуть позже (2025 год, журнал сравнивал уже GPT-4 и Google Gemini), проверило не только качество, но и воспроизводимость: если задать модели один и тот же запрос несколько раз подряд, выдаст ли она примерно одинаковый по качеству план, или это будет каждый раз лотерея?
Ответ обнадёживающий для сторонников ИИ-планирования: воспроизводимость оказалась ожидаемо высокой, из 28 оцениваемых пунктов разница между повторными генерациями нашлась только по одному. А вот более новая модель, GPT-4, в целом получила от экспертов более значимые оценки, чем Gemini.
И ещё одна практичная деталь: чем подробнее и информативнее был исходный запрос пользователя, тем выше эксперты оценивали итоговый план. Иными словами, нейросеть не читает мысли, и полтора слова про "хочу накачаться" дают ожидаемо посредственный результат.
При чём тут вообще силовые тренажеры и железо
Прямая связь простая. Значительная часть из тех самых 27 критериев касалась именно подбора конкретных упражнений и оборудования: насколько план учитывает доступный инвентарь, предлагает ли разумную последовательность между базовыми движениями и изолирующими упражнениями на тренажёрах, встроена ли в него логика прогрессии нагрузки, о которой мы уже писали применительно к новым рекомендациям ACSM.
Именно по этим пунктам, тесно связанным с практическим пониманием биомеханики движения и правильной эксплуатации оборудования, нейросети чаще всего показывали слабину, ведь никакая языковая модель пока не имеет физического опыта работы с реальным телом на реальном тренажёре.
Забавно, что пока нейросети учатся понимать биомеханику движения по текстовым описаниям в интернете, есть люди, которые занимаются буквально противоположным делом: строят спортивные тренажёры, отталкиваясь от биомеханики, а не подгоняя её задним числом под готовую конструкцию.
Российский завод "Форма Спорта", выпускающий силовые тренажеры с 2009 года, как раз из этой категории. Там с самого начала делали ставку не на внешний эффектный дизайн, а на инженерное соответствие траектории движения естественной работе сустава, будь то плечевой блок, тяга или разгибание ног.
На практике это означает довольно приземлённые вещи, которые ни один чат-бот пока не в силах предугадать без реального тела перед глазами: правильную высоту точки опоры под конкретный рост, плавность хода рычага без мёртвых зон в амплитуде, регулировку под разную длину конечностей.
Именно эти нюансы, кстати, чаще всего и всплывали в исследовании как слабое место у языковых моделей, ведь запрос "составь программу для продвинутого атлета" не содержит ни одной цифры про длину бедра или подвижность плечевого сустава.
Показательно и то, что спрос на рынке, если верить данным аналитического отдела того же завода, всё активнее смещается от универсальных многофункциональных станций к узкоспециализированным тренажёрам под конкретную мышечную группу, спроектированным именно вокруг биомеханики движения.
То есть индустрия производителей оборудования и научная статья про ИИ, при всей разнице тем, неожиданно движутся в одном направлении: понимание особенностей конкретного тела побеждает универсальные шаблонные решения, откуда бы они ни исходили, хоть от нейросети, хоть от инженера, который просто не потрудился разобраться в анатомии.
Луи Симмонс, легендарный тренер по пауэрлифтингу и, что здесь особенно уместно, изобретатель нескольких культовых силовых тренажёров (обратный гиперэкстензии, бельт-сквот), в своё время сформулировал мысль, которая неожиданно точно описывает главный вывод этого исследования, хоть и была сказана задолго до появления ChatGPT:
если бы всё было так просто, никому не понадобились бы специальные упражнения, тренажёры или системы тренировок.
Именно эта сложность, судя по всему, пока и остаётся тем самым узким местом, где искусственному интеллекту требуется помощь живого человека.
А старая русская поговорка, будто специально придуманная для эпохи нейросетей, формулирует то же самое ещё короче: гладко было на бумаге, да забыли про овраги.
План на экране смартфона выглядит безупречно. А овраги, то есть индивидуальные особенности конкретного тела, вылезают уже в тренажерном зале.
Коротко: что показало исследование
|
Параметр |
Значение |
|---|---|
|
Проверяемые модели |
GPT-3.5 (ChatGPT), GPT-3.5 (Microsoft Copilot), Google Gemini |
|
Кто оценивал |
10 тренеров с профильным образованием и опытом от 2 лет |
|
Критериев оценки |
27, шкала от 1 до 5 |
|
Общее качество планов |
Умеренное, редко выше 4 из 5 баллов |
|
Где Gemini обошёл GPT-3.5 |
Продвинутые методы тренировки, стратегии восстановления (2 из 27 критериев) |
|
Где GPT-3.5 (Copilot) обошёл Gemini |
Процедуры тестирования (1 из 27 критериев) |
|
Воспроизводимость при повторных запросах (GPT-4 vs Gemini, отдельное исследование) |
Высокая: разница лишь по 1 из 28 пунктов |
|
Влияние детализации запроса на качество плана |
Чем подробнее запрос, тем выше оценка плана |
Экспертное мнение - вопросы, которые вы наверняка хотели задать
Значит ли это, что нейросетям вообще нельзя доверять программу тренировок? Нет, речь не о полном запрете, а о роли. Исследование показало, что план от ChatGPT или Gemini вполне годится как черновая структура, скелет будущей программы.
Проблема начинается там, где этот черновик используют без доработки, без учёта конкретного тела, травм и реакции на нагрузку конкретного человека.
Почему тренеры вообще не поставили планам высокие оценки, если по сути всё было правильно и логично? Потому что "логично на бумаге" и "правильно для конкретного человека" не одно и то же.
Экспертные оценки почти никогда не поднимались выше 4 из 5 именно из-за нехватки индивидуализации: продвинутых стратегий восстановления, тонкой настройки тестовых процедур, учёта нюансов, которые видны только вживую.
А если попросить нейросеть учесть травмы и особенности тела, результат станет лучше? Судя по отдельному исследованию про воспроизводимость, да, чем подробнее и информативнее запрос, тем выше эксперты оценивали итоговый план.
Но модель всё равно не сможет увидеть, как именно вы садитесь в присед или под каким углом у вас работает плечо, а именно это видит тренер вживую.
Какая модель в итоге показала себя лучше, ChatGPT или Gemini? Существенной разницы между GPT-3.5 и Gemini на момент первого исследования не нашли, у каждой были свои сильные пункты из 27. А вот более новая модель, GPT-4, в отдельном сравнении получила от экспертов оценки выше, чем Gemini, что намекает на постепенный прогресс технологии.
Так пользоваться нейросетью для тренировок или нет
Авторы обоих исследований, в общем-то, сходятся: как отправная точка, черновик, из которого потом можно и нужно лепить готовый план, нейросеть вполне годится, особенно если формулировать запрос подробно и конкретно.
Но как замену тренеру, который видит вашу технику вживую, знает, что вчера у вас болело плечо, и умеет вовремя скорректировать нагрузку, языковая модель пока не тянет. Овраги, как выяснилось, всё ещё побеждают гладкую бумагу.
Источник: "A professional assessment of training plans for muscle hypertrophy and maximal strength developed by generative artificial intelligence", Biology of Sport, 2025-2026