TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
VanillaTime

22 Sep, 15:22

Открыть в Telegram Поделиться Пожаловаться

Вчера я прожёг все лимиты токенов во всех моделях: Gemini ушёл отдыхать на день, а с Claude’ом мы увидимся снова только через месяц. Куда можно было угрохать столько бюджета? 😦

Может, я генерил тяжеловесные видосы и картинки? Нет.
Может, кодил огромные проекты? Тоже нет, кодил совсем чуть-чуть. Топка, в которой сгорели все токены — это мой изолированный эксперимент.

Сейчас я готовлю доклад на конференцию о пользе оптимизации скиллов (тех самых SKILL.md). Чтобы не быть голословным, решил подтвердить теорию цифрами и провести эксперимент в управляемой среде: сравнить результаты обычного one-shot промпта, базового скилла и оптимизированного. Звучит просто, да? Я тоже так думал. 😅

😯 Во-первых, в природе нет готовых сред для корректного сравнения именно скиллов. Промпты — пожалуйста, хоть в параллели запускай. А вот сложные скиллы — увы и ах, извольте ручками. Пришлось пилить кастомный стенд на базе agy (CLI Antigravity от Google), благо он такое могёт.

👀Во-вторых, отсматривать глазками результаты по 50 дизайн-системам — занятие неэффективное. Поэтому я выбрал путь истинной боли и страданий собрать пайплайн LLM as a Judge (больше о концепции написано у MindStudio).

Суть концепции: после каждого рана скилла более дешевая модель выступает судьей, оценивает качество и ищет брак. И если вы верите в сказки, что современные модели «сами всё понимают» — у меня для вас сюрприз. На одном голом промпте ваш судья уедет не туда. Ему нужно подготовить жесткие критерии (рубрики) оценки под каждый сценарий, дать expected output для сверки, а еще детально объяснить: что такое хорошо, что такое плохо, на что закрывать глаза, а за что карать. 🧑‍⚖️

Но даже несмотря на все преграды в виде «слишком умного» Gemini, который почему-то всегда выбирал использовать «самому продвинутый скилл, блокировки автоматических ранов и бесконечную заточку алгоритма, самым сложным оказалось другое. Убедить модель, что она неправа! 😡

Gemini еще как-то поддается и раскаивается. А вот Claude в последнее время вообще берега путает. Говорит: «Схожу-ка я проверю, правду ли ты мне сказал... А, реально ошибка, извиняюсь. Но я всё равно слежу за тобой, кожаный». Словно переходный возраст у него. В общем повеселилися.

А вы на что сливали свои токены и нервы в последнее время?
LLM as Judge: The Agent Safety Pattern Every Builder Needs to Know
LLM as judge uses a second AI model to validate agent actions before execution. Learn how this pattern prevents costly mistakes in production workflows.

351 0 5 9 14
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot