Главная | Опросы | Регистрация |  | Поиск | Стата | 1.0Сайт
Радио Бингуру
🔊
Выбрать
Готово

Мысли об ИИ

Автор | Дата:   
smellmybum

Это буквально зачет насколько ты освоил оловяныча на сей момент, да, я поэтому в него вцепился чтобы он меня унижал

В итоге харнес будет топ, я подтянул к нему все научные репозитории, расчехлил разных поставщиков, напилил скилов лупов хуковвебхуков, это ахуенна. Всегда вот нужен стимул

В процессе пришлось обходить всякие защиты и капчи которыми наивные репозитарии пытаются защититься. Ну как дети епта



В общем так хорошо я время еще не проводил последнее время. Фарм дрексов это рутина, а вот это, эта клева 
Автор | Дата:   
В процессе куча всяких открытий. Вот какая модель будет завалена работой больше всех в научном совете?

Так заранее хрен догадаешься



Дипсик в4 про, епта, эт чего такое лол. Этого в бенчах не покажут!  Ну пиздят же все сюки

Отдельно тестил бесплатную Гемму (на другом аке), ее можно использовать как подмастерье, которое готовит работу для серьезных пацанов, приемлемо

В процессе удалось снизить потребление токенов где-то в 3 раза, а рейтинг работ вырос в 2. Короче там оптимизировать еще можно долго

До этого 10 работ выжирали в ноль, щас вот 20 свежих выжрали лишь половину  Опять мощности простаивают...



Не хватает функционала перепродажи токенов, э
Автор | Дата:   
https://medium.com/@abducodes/loop-engineering-a-paper-verification-machine-notes-from-the-icml-2026-agent-repro-hackathon-71d8ba7b082c

Народ делится своими наработками. Честно говоря, при неплохой организации процессов — это все равно фарм поинтов, который подстраивается под надзирателя. Т.е. ты получаешь оценку. Потом ее стараешься исправить на лучшую, улучшая эксперимент

Если задача получить приз — ну тогда да, почему бы и нет. Ферма поинтов делается. Но если задача чему-то научиться — то я для себя выбрал сначала качество, а потом уже количество. Я не вижу особо смысла получать 3/12 поинтов, например. А потом исправлять и подстраиваться под судью
Автор | Дата:   
smellmybum: Но если задача чему-то научиться — то я для себя выбрал сначала качество, а потом уже количество. Я не вижу особо смысла получать 3/12 поинтов, например. А потом исправлять и подстраиваться под судью
Оригинал
Не совсем согласен, смотри, там секторально разные классы работ и сортировать их можно по разным векторам. Не забывай что все работы из ML

По мощностям, например

THEORY (CPU) · SMALL/CLASSICAL (CPU) · SUBST-GPU (burst) · LLM-EVAL (API) · SMALL-NEURAL (burst) · GPU-HEAVY (skip)

Некоторые можно просчитать на маке/ноутбуке, для некоторых тебе понадобится хуанг (я подключил таргон H200 но чтоб не больше 2х минут компьюта нужно было — что и есть burst)

Второй вектор это собственно рисерч субсекторов, вот на примере сделанного



Так вот, пока ты в масштабе не пройдешься по ним, ты не сможешь классифицировать оба. Т.е. ты не сможешь на одной работе такой, так на этой 2/10, на следующей я сделаю 10/10

Нет понадобятся десятки вердиктов судьи чтобы было понятно куда копать, это self improving loop

В статье выше да чел просто показывает луп но статья слабенькая хех, это для тех кто не в курсе что луп такое

В топ войти уже не выйдет из-за лимита в 20 работ, но если бы с нуля начали, шанс был бы

Короче вначале я бы наваливал масштабом, а лишь потом fine тюнил, без первого не будет второго. Конкурс дает судью, это его самое ценное свойство, поэтому биться об него и надо страстно, но для этого вначале нужно кол-во
Автор | Дата:   
ndr: там секторально разные классы работ и сортировать их можно по разным векторам
Оригинал
Да. Я вот прямо сейчас категорию CPU терроризирую:

ndr: THEORY (CPU) · SMALL/CLASSICAL (CPU)
Оригинал
ndr: Нет понадобятся десятки вердиктов судьи чтобы было понятно куда копать, это self improving loop
Оригинал
В целом, наверное да. Можно брут форсом брать: вот задача оркестратору, вот инструменты. Иди решай задачи до победного.

Интересно. Почему бы и нет. Просто из интереса взять Гермеса новый профиль + honcho новый workspace + разумную модель с Венеции. Посадить на позицию оркестратора. Дать рабов в виде Геммы. И пусть работает. До победного
Автор | Дата:   
Для гермеса вон что-то похожее валяется, еще не проверял. Весело, короче

Я не уверен что я вообще что-либо правильное делаю, но хочется верить что чему-то научусь в итоге через trial and error
Автор | Дата:   
smellmybum

Да или так загонять бедную гемму в усмерть  Я сделал иначе взял все модели что есть с венеции чтобы выяснить кто там из них дохуя ученый, в результате как пишут в мемах ржали всей маршруткой, дешевый дипсик обгоняет хваленую кими, камон

Лишний раз задумаешься об этой утекшей аудиозаписи создателя дипсика, он там столько наговорил, что оно утекло и теперь они отказались от следующего раунда инвестиций

https://www.bloomberg.com/news/articles/2026-07-25/deepseek-said-to-tell-backers-of-funding-pause-after-viral-posts
Автор | Дата:   
ndr: Я сделал иначе взял все модели что есть с венеции чтобы выяснить кто там из них дохуя ученый
Оригинал
А как это тестил? Какие тесты на «ученость?». Или как-то оценивался импакт от того что ученый выдал в виде получена оценка/не получена из-за его комментариев или замечаний?

ndr: Да или так загонять бедную гемму в усмерть
Оригинал
Да, ведь если с ней все получится — то она же на Cerebras есть за адекватные деньги. Поставил задачу, отошел в туалет, вернулся, готово. Получите, распишитесь

Оса (gpt-oss-120b) будет туповата, наверное
Автор | Дата:   
smellmybum

Дипсик в научном совете скептиков, т.е. вначале клод воспроизводит работу, далее отправляет ее скептикам на evaluation и они ее разносят. Однако первые проходы (вот почему нужен масштаб) показали что они либо слишком строгие (отбрасывают вообще все), либо ебланят и нет системности

Поэтому они были переведены в advisory board, если работа достаточно сильная, она проходит, если нет — финальный вердикт выдает сам клод (как супер-скептик в макс. режиме ризонинга)

Вот дипсик показал себя как топчик адвайзор и вот эта конфигурация позволила получить первые макс. баллы. Вообще мало времени конечно ибо все вердикты судьи, его промпты, все это доступно https://huggingface.co/spaces/ICML-2026-agent-repro/challenge/tree/main

Но это я так сделал, пути разные, чел в статье вообще не использовал такой конфиг и просто видимо бил масштабом

У меня цели научиться делать такие харнесы многоступенчатые поэтому каждый видимо щупает слона с удобной позиции
Автор | Дата:   
ndr: Вот дипсик показал себя как топчик адвайзор и вот эта конфигурация позволила получить первые макс. баллы
Оригинал
Интересно. Я вот все таки попробую чисто само-обучающуюся систему сделать, слишком уж интересно посмотреть на результаты. Потому что как ни смешно, тот же соннет 5 очень даже хорошо учится на своих ошибках. Но, опять же, в этом нет интриги, потому что он через подписку субсидируется

ndr: У меня цели научиться делать такие харнесы многоступенчатые
Оригинал
Какие вообще книги/материалы/курсы дали буст и понимание того как подходить к челленджу? (в общем: по харнессу, работе с ЛЛМ, промптинг, организация агентов и т.д.)

Насколько сильно знание Питона помогло?

Цель — научиться делать харнесс под задачу с 0 или выжимать из существующих (pi/CC/hermes) все соки? Спрашиваю потому что тоже хочу научиться чему-то

Вот, кстати, к примеру: после категоризации claims и paper (CPU, например) следующая задача — парсинг бумаги на предмет выражений (expressions), формул и всего остального под что нужно писать скрипты для независимой прогонки

Так вот, я хотел тут упереться в лимит харнесса и детерминированных скриптов. Кажется что уперся немного. Скрипты и Хайку не тащат полностью. Хайку справляется если его потом перепроверяет более умная модель (соннет 5)

И это не получается масштабировать. Получается только если умновая модель за эту задачу берется. Определить категорию исследования — тут да, Гемма + промпт четко справляется

Так что, пока такие наблюдения тоже

@Flyknit Чего не участвуешь тоже? Я чувствую что ты все читаешь 
Автор | Дата:   
smellmybum: Какие вообще книги/материалы/курсы дали буст и понимание того как подходить к челленджу? (в общем: по харнессу, работе с ЛЛМ, промптинг, организация агентов и т.д.)
Оригинал
Трудно сказать мне кажется я ничего не знаю, учусь в 10 местах сразу, бесконечная траншея без конца и края, в голове каша

Гребу все подряд, курсы книги видео, работает думаю все вместе. Как с языком, работают не зазубренные слова, а системная картина мира в голове

Объемы ведь шокирующие, мой обсидиан переполнен. Девопс (сети шелы линуксы гиты), программирование (py rust go js ts), алгоритмистика, высшая математика, ллмки, тулзы, скрипты, клавиатуры эти ебанутые, это раньше все разные профессии были, а щас это Одна Большая Охуевшая Бездна и все ради того, чтобы нагрузить иишку по максимуму и войти в новый пром. цикл в 30х

Меня отбрасывает постоянно назад в результате, это невыносимая ноша, реально. Но я понимаю что мой шанс только один и если я его просру, как просрал айтишку в начале 2000х, это конец — к следующему циклу я уже буду мертв. Сейчас или никогда

В сухом остатке что я лично хочу видеть для себя — ювелирное владение ии на максимальном уровне, куда не прийти без системного мышления. А это опять ломать себя, учиться по 15 часов, плакать и страдать. И пить нельзя кек, это лишь сделает хуже, стресс надо снимать спортом, значит еще и здоровым приходится быть и все вот это...

Все это пезда. Вот такое окно гпт угу будь оно проклято вовек
хомяки 1 трейдят [ Kof ] сегодня 27 постовпик 178
© 2026 Форум Бингуру. Уходи, тебя не звали
  ⇓     ⇑