Вчера я прожёг все лимиты токенов во всех моделях: Gemini ушёл отдыхать на день, а с Claude’ом мы увидимся снова только через месяц. Куда можно было угрохать столько бюджета? 😦
Может, я генерил тяжеловесные видосы и картинки? Нет.
Может, кодил огромные проекты? Тоже нет, кодил совсем чуть-чуть. Топка, в которой сгорели все токены — это мой изолированный эксперимент.
Сейчас я готовлю доклад на конференцию о пользе оптимизации скиллов (тех самых SKILL.md). Чтобы не быть голословным, решил подтвердить теорию цифрами и провести эксперимент в управляемой среде: сравнить результаты обычного one-shot промпта, базового скилла и оптимизированного. Звучит просто, да? Я тоже так думал. 😅
😯 Во-первых, в природе нет готовых сред для корректного сравнения именно скиллов. Промпты — пожалуйста, хоть в параллели запускай. А вот сложные скиллы — увы и ах, извольте ручками. Пришлось пилить кастомный стенд на базе agy (CLI Antigravity от Google), благо он такое могёт.
👀Во-вторых, отсматривать глазками результаты по 50 дизайн-системам — занятие неэффективное. Поэтому я выбрал путь истинной боли и страданий собрать пайплайн LLM as a Judge (больше о концепции написано у MindStudio).
Суть концепции: после каждого рана скилла более дешевая модель выступает судьей, оценивает качество и ищет брак. И если вы верите в сказки, что современные модели «сами всё понимают» — у меня для вас сюрприз. На одном голом промпте ваш судья уедет не туда. Ему нужно подготовить жесткие критерии (рубрики) оценки под каждый сценарий, дать expected output для сверки, а еще детально объяснить: что такое хорошо, что такое плохо, на что закрывать глаза, а за что карать. 🧑⚖️
Но даже несмотря на все преграды в виде «слишком умного» Gemini, который почему-то всегда выбирал использовать «самому продвинутый скилл, блокировки автоматических ранов и бесконечную заточку алгоритма, самым сложным оказалось другое. Убедить модель, что она неправа! 😡
Gemini еще как-то поддается и раскаивается. А вот Claude в последнее время вообще берега путает. Говорит: «Схожу-ка я проверю, правду ли ты мне сказал... А, реально ошибка, извиняюсь. Но я всё равно слежу за тобой, кожаный». Словно переходный возраст у него. В общем повеселилися.
А вы на что сливали свои токены и нервы в последнее время?
Может, я генерил тяжеловесные видосы и картинки? Нет.
Может, кодил огромные проекты? Тоже нет, кодил совсем чуть-чуть. Топка, в которой сгорели все токены — это мой изолированный эксперимент.
Сейчас я готовлю доклад на конференцию о пользе оптимизации скиллов (тех самых SKILL.md). Чтобы не быть голословным, решил подтвердить теорию цифрами и провести эксперимент в управляемой среде: сравнить результаты обычного one-shot промпта, базового скилла и оптимизированного. Звучит просто, да? Я тоже так думал. 😅
😯 Во-первых, в природе нет готовых сред для корректного сравнения именно скиллов. Промпты — пожалуйста, хоть в параллели запускай. А вот сложные скиллы — увы и ах, извольте ручками. Пришлось пилить кастомный стенд на базе agy (CLI Antigravity от Google), благо он такое могёт.
👀Во-вторых, отсматривать глазками результаты по 50 дизайн-системам — занятие неэффективное. Поэтому я выбрал путь истинной боли и страданий собрать пайплайн LLM as a Judge (больше о концепции написано у MindStudio).
Суть концепции: после каждого рана скилла более дешевая модель выступает судьей, оценивает качество и ищет брак. И если вы верите в сказки, что современные модели «сами всё понимают» — у меня для вас сюрприз. На одном голом промпте ваш судья уедет не туда. Ему нужно подготовить жесткие критерии (рубрики) оценки под каждый сценарий, дать expected output для сверки, а еще детально объяснить: что такое хорошо, что такое плохо, на что закрывать глаза, а за что карать. 🧑⚖️
Но даже несмотря на все преграды в виде «слишком умного» Gemini, который почему-то всегда выбирал использовать «самому продвинутый скилл, блокировки автоматических ранов и бесконечную заточку алгоритма, самым сложным оказалось другое. Убедить модель, что она неправа! 😡
Gemini еще как-то поддается и раскаивается. А вот Claude в последнее время вообще берега путает. Говорит: «Схожу-ка я проверю, правду ли ты мне сказал... А, реально ошибка, извиняюсь. Но я всё равно слежу за тобой, кожаный». Словно переходный возраст у него. В общем повеселилися.
А вы на что сливали свои токены и нервы в последнее время?