Главная | Опросы | Регистрация |  | Поиск | Стата | 1.0Сайт
Радио Бингуру
🔊
Выбрать
Готово

Мысли об ИИ

Автор | Дата:   
smellmybum

Это буквально зачет насколько ты освоил оловяныча на сей момент, да, я поэтому в него вцепился чтобы он меня унижал

В итоге харнес будет топ, я подтянул к нему все научные репозитории, расчехлил разных поставщиков, напилил скилов лупов хуковвебхуков, это ахуенна. Всегда вот нужен стимул

В процессе пришлось обходить всякие защиты и капчи которыми наивные репозитарии пытаются защититься. Ну как дети епта



В общем так хорошо я время еще не проводил последнее время. Фарм дрексов это рутина, а вот это, эта клева 
Автор | Дата:   
В процессе куча всяких открытий. Вот какая модель будет завалена работой больше всех в научном совете?

Так заранее хрен догадаешься



Дипсик в4 про, епта, эт чего такое лол. Этого в бенчах не покажут!  Ну пиздят же все сюки

Отдельно тестил бесплатную Гемму (на другом аке), ее можно использовать как подмастерье, которое готовит работу для серьезных пацанов, приемлемо

В процессе удалось снизить потребление токенов где-то в 3 раза, а рейтинг работ вырос в 2. Короче там оптимизировать еще можно долго

До этого 10 работ выжирали в ноль, щас вот 20 свежих выжрали лишь половину  Опять мощности простаивают...



Не хватает функционала перепродажи токенов, э
Автор | Дата:   
https://medium.com/@abducodes/loop-engineering-a-paper-verification-machine-notes-from-the-icml-2026-agent-repro-hackathon-71d8ba7b082c

Народ делится своими наработками. Честно говоря, при неплохой организации процессов — это все равно фарм поинтов, который подстраивается под надзирателя. Т.е. ты получаешь оценку. Потом ее стараешься исправить на лучшую, улучшая эксперимент

Если задача получить приз — ну тогда да, почему бы и нет. Ферма поинтов делается. Но если задача чему-то научиться — то я для себя выбрал сначала качество, а потом уже количество. Я не вижу особо смысла получать 3/12 поинтов, например. А потом исправлять и подстраиваться под судью
Автор | Дата:   
smellmybum: Но если задача чему-то научиться — то я для себя выбрал сначала качество, а потом уже количество. Я не вижу особо смысла получать 3/12 поинтов, например. А потом исправлять и подстраиваться под судью
Оригинал
Не совсем согласен, смотри, там секторально разные классы работ и сортировать их можно по разным векторам. Не забывай что все работы из ML

По мощностям, например

THEORY (CPU) · SMALL/CLASSICAL (CPU) · SUBST-GPU (burst) · LLM-EVAL (API) · SMALL-NEURAL (burst) · GPU-HEAVY (skip)

Некоторые можно просчитать на маке/ноутбуке, для некоторых тебе понадобится хуанг (я подключил таргон H200 но чтоб не больше 2х минут компьюта нужно было — что и есть burst)

Второй вектор это собственно рисерч субсекторов, вот на примере сделанного



Так вот, пока ты в масштабе не пройдешься по ним, ты не сможешь классифицировать оба. Т.е. ты не сможешь на одной работе такой, так на этой 2/10, на следующей я сделаю 10/10

Нет понадобятся десятки вердиктов судьи чтобы было понятно куда копать, это self improving loop

В статье выше да чел просто показывает луп но статья слабенькая хех, это для тех кто не в курсе что луп такое

В топ войти уже не выйдет из-за лимита в 20 работ, но если бы с нуля начали, шанс был бы

Короче вначале я бы наваливал масштабом, а лишь потом fine тюнил, без первого не будет второго. Конкурс дает судью, это его самое ценное свойство, поэтому биться об него и надо страстно, но для этого вначале нужно кол-во
Автор | Дата:   
ndr: там секторально разные классы работ и сортировать их можно по разным векторам
Оригинал
Да. Я вот прямо сейчас категорию CPU терроризирую:

ndr: THEORY (CPU) · SMALL/CLASSICAL (CPU)
Оригинал
ndr: Нет понадобятся десятки вердиктов судьи чтобы было понятно куда копать, это self improving loop
Оригинал
В целом, наверное да. Можно брут форсом брать: вот задача оркестратору, вот инструменты. Иди решай задачи до победного.

Интересно. Почему бы и нет. Просто из интереса взять Гермеса новый профиль + honcho новый workspace + разумную модель с Венеции. Посадить на позицию оркестратора. Дать рабов в виде Геммы. И пусть работает. До победного
Автор | Дата:   
Для гермеса вон что-то похожее валяется, еще не проверял. Весело, короче

Я не уверен что я вообще что-либо правильное делаю, но хочется верить что чему-то научусь в итоге через trial and error
Автор | Дата:   
smellmybum

Да или так загонять бедную гемму в усмерть  Я сделал иначе взял все модели что есть с венеции чтобы выяснить кто там из них дохуя ученый, в результате как пишут в мемах ржали всей маршруткой, дешевый дипсик обгоняет хваленую кими, камон

Лишний раз задумаешься об этой утекшей аудиозаписи создателя дипсика, он там столько наговорил, что оно утекло и теперь они отказались от следующего раунда инвестиций

https://www.bloomberg.com/news/articles/2026-07-25/deepseek-said-to-tell-backers-of-funding-pause-after-viral-posts
Автор | Дата:   
ndr: Я сделал иначе взял все модели что есть с венеции чтобы выяснить кто там из них дохуя ученый
Оригинал
А как это тестил? Какие тесты на «ученость?». Или как-то оценивался импакт от того что ученый выдал в виде получена оценка/не получена из-за его комментариев или замечаний?

ndr: Да или так загонять бедную гемму в усмерть
Оригинал
Да, ведь если с ней все получится — то она же на Cerebras есть за адекватные деньги. Поставил задачу, отошел в туалет, вернулся, готово. Получите, распишитесь

Оса (gpt-oss-120b) будет туповата, наверное
Автор | Дата:   
smellmybum

Дипсик в научном совете скептиков, т.е. вначале клод воспроизводит работу, далее отправляет ее скептикам на evaluation и они ее разносят. Однако первые проходы (вот почему нужен масштаб) показали что они либо слишком строгие (отбрасывают вообще все), либо ебланят и нет системности

Поэтому они были переведены в advisory board, если работа достаточно сильная, она проходит, если нет — финальный вердикт выдает сам клод (как супер-скептик в макс. режиме ризонинга)

Вот дипсик показал себя как топчик адвайзор и вот эта конфигурация позволила получить первые макс. баллы. Вообще мало времени конечно ибо все вердикты судьи, его промпты, все это доступно https://huggingface.co/spaces/ICML-2026-agent-repro/challenge/tree/main

Но это я так сделал, пути разные, чел в статье вообще не использовал такой конфиг и просто видимо бил масштабом

У меня цели научиться делать такие харнесы многоступенчатые поэтому каждый видимо щупает слона с удобной позиции
Автор | Дата:   
ndr: Вот дипсик показал себя как топчик адвайзор и вот эта конфигурация позволила получить первые макс. баллы
Оригинал
Интересно. Я вот все таки попробую чисто само-обучающуюся систему сделать, слишком уж интересно посмотреть на результаты. Потому что как ни смешно, тот же соннет 5 очень даже хорошо учится на своих ошибках. Но, опять же, в этом нет интриги, потому что он через подписку субсидируется

ndr: У меня цели научиться делать такие харнесы многоступенчатые
Оригинал
Какие вообще книги/материалы/курсы дали буст и понимание того как подходить к челленджу? (в общем: по харнессу, работе с ЛЛМ, промптинг, организация агентов и т.д.)

Насколько сильно знание Питона помогло?

Цель — научиться делать харнесс под задачу с 0 или выжимать из существующих (pi/CC/hermes) все соки? Спрашиваю потому что тоже хочу научиться чему-то

Вот, кстати, к примеру: после категоризации claims и paper (CPU, например) следующая задача — парсинг бумаги на предмет выражений (expressions), формул и всего остального под что нужно писать скрипты для независимой прогонки

Так вот, я хотел тут упереться в лимит харнесса и детерминированных скриптов. Кажется что уперся немного. Скрипты и Хайку не тащат полностью. Хайку справляется если его потом перепроверяет более умная модель (соннет 5)

И это не получается масштабировать. Получается только если умновая модель за эту задачу берется. Определить категорию исследования — тут да, Гемма + промпт четко справляется

Так что, пока такие наблюдения тоже

@Flyknit Чего не участвуешь тоже? Я чувствую что ты все читаешь 
Автор | Дата:   
smellmybum: Какие вообще книги/материалы/курсы дали буст и понимание того как подходить к челленджу? (в общем: по харнессу, работе с ЛЛМ, промптинг, организация агентов и т.д.)
Оригинал
Трудно сказать мне кажется я ничего не знаю, учусь в 10 местах сразу, бесконечная траншея без конца и края, в голове каша

Гребу все подряд, курсы книги видео, работает думаю все вместе. Как с языком, работают не зазубренные слова, а системная картина мира в голове

Объемы ведь шокирующие, мой обсидиан переполнен. Девопс (сети шелы линуксы гиты), программирование (py rust go js ts), алгоритмистика, высшая математика, ллмки, тулзы, скрипты, клавиатуры эти ебанутые, это раньше все разные профессии были, а щас это Одна Большая Охуевшая Бездна и все ради того, чтобы нагрузить иишку по максимуму и войти в новый пром. цикл в 30х

Меня отбрасывает постоянно назад в результате, это невыносимая ноша, реально. Но я понимаю что мой шанс только один и если я его просру, как просрал айтишку в начале 2000х, это конец — к следующему циклу я уже буду мертв. Сейчас или никогда

В сухом остатке что я лично хочу видеть для себя — ювелирное владение ии на максимальном уровне, куда не прийти без системного мышления. А это опять ломать себя, учиться по 15 часов, плакать и страдать. И пить нельзя кек, это лишь сделает хуже, стресс надо снимать спортом, значит еще и здоровым приходится быть и все вот это...

Все это пезда. Вот такое окно гпт угу будь оно проклято вовек
Автор | Дата:   
ndr

Ты счастливчик, потому что у тебя есть и лопата и направление куда копать. Тут вот кто-то как дурак (не будем показывать пальцем в зеркало): вроде лопата есть, поле есть, а куда копать пока не понятно... отсюда и пока солнце не сядет..в надежде, что по ходу задача станет яснее😂! Но я думаю это лучше, чем совсем не копать, в текущее время.
Автор | Дата:   
Sanych: а куда копать пока не понятно
Оригинал
Иишка это как майнкрафт — самая популярная игра в мире, потому что в мире миллионы игр, но только ты знаешь, во что ты хочешь играть. Вот у тебя бесконечное число кубиков — так что ты хочешь из них сделать?

Точно также появился опенсорс в 80е — что бы самая большая корпорация в мире не считала, что тебе нужно, только ты это знаешь

Это бесконечный потенциал творения и уж конечно чтобы достичь желаемого ты зайдешь так далеко, как того пожелаешь

Ты же описал нечто похожее на классическую Обломовщину, помнишь со школы? ) Обломов не был бездарен или беден — у него было все. Кроме... побуждения встать с дивана

Этому есть разные объяснения, паралич желания (все возможно, да ничего не тянет), сплин — скука как метафизическое состояние и т.д. Из прикольных последних — Общество усталости. Выгорание в современном обществе происходит не из-за запретов, как встарь. Теперь мы «можем все» — что и привело к нему, ибо неограниченная возможность сама по себе является ограничением

Я могу все — я не могу ничего

Решить это можно. Большинству людей банально нужен психолог ) На самом-то деле. А кому-то и не один (как был нужен Обломову, но тогда не было такой профессии хе)
Автор | Дата:   
ndr

Не в бровь, а в глаз...

...мдее, подкинул ты мне конечно мыслишек и вектор движения... глубоко! Пасиб!
Автор | Дата:   
ndr: Трудно сказать мне кажется я ничего не знаю, учусь в 10 местах сразу, бесконечная траншея без конца и края, в голове каша
Оригинал
бл думал я один такой непутевый, в день посмотреть 10 видосов на разные темы, утром что то про мл, бля для мл нужен питон, надо проходить курсы, в обед что то по харнесикам, пока ешь рисерчишь какие то новые скиллы, бля, я сам даже не умею пользоваться консолью, срочно ищем курс (в закладках на курсере уже шт 30 ), а еще документацию полика и полигона надо прочитать, новая статья в тви, пиздец короче, это какая то новая форма СДВГ, вот так выглядит одно из окон браузера 24\7, и к этому я уже привык (открыто 2-3 окна плюс петя и обсидиан)



Но на самом деле начал ощущать вот этот синдром «бесконечного ученика», что за некоторые вещи ты не берешься, потому что испытываешь нехватку знаний, идешь мучить клод-получаешь иллюзию знаний, наполняешься уверенностью, что то хуячишь с ним часами-цикл роняется, и ты у разбитого корыта снова с ощущением что ничего не знаешь и надо что то рисерчить, короче весело, интересно чем это закончится через пару лет, как и писал в дневнике-надеюсь не суицидом)))
Автор | Дата:   
ndr: Меня отбрасывает постоянно назад в результате
Оригинал
Понятно, а я думал что я дебил и со мной что-то не так, раз чувствую что вроде толкаю телегу вперед, а по ощущениям она как-будто назад едет. Значит у всех так сейчас

ndr: И пить нельзя кек, это лишь сделает хуже, стресс надо снимать спортом, значит еще и здоровым приходится быть и все вот это
Оригинал
Пить можно. Колу ()

Artemkickbox: и ты у разбитого корыта снова с ощущением что ничего не знаешь и надо что то рисерчить
Оригинал
Вот поэтому нужно бросаться на такие челленджи, как умеешь. Дело мастера боится. А мастером без практики не стать, увы

Я тоже с этим челленджем чувствую себя каким-то придурком, который головой об стену бьется. Ну ничего, дорогу осилит идущий

Потом смотришь сколько участников, видишь что 300 человек всего лишь и понимаешь что ты как раз таки не настолько безнадежен. Потому что подавляющее большинство окошко чатика GPT мучает и их это устраивает. Мы равняемся на тех кто лучше нас. И нам кажется что мы бестолочи
Автор | Дата:   
Главное не сдаваться и все получится посоны

Автор | Дата:   
smellmybum: Просто из интереса взять Гермеса новый профиль + honcho новый workspace + разумную модель с Венеции. Посадить на позицию оркестратора. Дать рабов в виде Геммы
Оригинал
В общем, не удержался. Решил затестить такой подход в лоб, грубой силой

Пациентом пока что выбран DeepDeek V4 Flash: цена + контекст больше чем у Gemma. Рабов ему выделил в виде той же модели

Взял пока простенький paper. Промпт с HF, который они дают. Ну и + добавил как в меме «Pls do this. Don't make mistakes». Ради эксперимента, конечно. Суть: может ли харнесс + недорогая reasoning модель самообучиться на этой задаче и тащить в будущем?

Mistakes были конечно. Первый прогон — 0 баллов, куча ошибок, полный шлак. Чуда не произошло. Придется железяке учиться и делать выводы из замечаний судьи

Но вот honcho conclusions прям вот наглядно показывают почему результаты работы/отдельных этапов должна проверять серьезная модель:





О чем это говорит? Дипсик сделал какую-то работу. Огромную, я бы сказал. За скромные деньги. 

Написал скрипты, прогнал тесты и т.д. Но допустил ошибки: где-то поленился, где-то неправильный вывод сделал.

Но пруф концепции есть: дешевая модель в состоянии выполнять огромный объем работы. Просто сейчас она это делает хреново





Теперь вот интрига: она вообще чему-то научится?

Так что вот прям пример из полей как флоу выстраивается сам: тот кто выполняет работу не имеет права ее же и оценивать/проверять

Потом оказывается что это вообще-то базовые вещи в том Good Manufacturing Practices. И что это уже давно ни для кого не секрет
Автор | Дата:   
smellmybum: Так что вот прям пример из полей как флоу выстраивается сам: тот кто выполняет работу не имеет права ее же и оценивать/проверять
Оригинал
Да это так, оценка должна осуществляться другой моделью/моделями, поэтому я и сделал флоу с научным советом/адвайзерами
Автор | Дата:   
smellmybum: Good Manufacturing Practices
Оригинал
И вообще, так-то мы сейчас занимаемся производством, по факту. Почему бы не взять тогда лучшие практики с GMP/ISO9001 тех же? Нас же интересует качественный продукт и процессы. Четкая иерархия и разделение полномочий: QA не может отчитываться директору производства и т.д.

Куда я вообще полез, прости Господи. Я же хотел просто клодом прогнать пару бумаг по челленджу. Куда-то не туда завело
хомяки 0 трейдят [ GraficoAcu ] сегодня 38 постовпик 178
© 2026 Форум Бингуру. Уходи, тебя не звали
  ⇓     ⇑