Пишу, помогаю, обучаю, внедряю, консультирую по AI Coding
О канале https://t.me/the_ai_architect/2
Связь: @yatimur | Визитка: timurkhakhalev.t.me
Я получил доступ к Gemini Diffusion

Потрогал модель, побрейнштормил с Gemini 2.5 Pro о том, что такое diffusion модели и решил написать пост.

Традиционные (авто-регрессионные) модели, которыми мы все пользуемся, генерируют токены по-очереди (поэтому некоторые сравнивают их с Т9 на максималках). Диффузионные модели работают по-другому и генерируют токены пачками. Так, например, работают модели, которые генерят картинки. Благодаря этому свойству, они очень быстрые. Прям очень-очень, Google Diffusion работает на скорости около 1-2K tokens per second. Для сравнения, типичный запрос от chatgpt или claude генерируется на скорости около 40-60 tokens per second.

К минусам: диффузионные модели довольно маленькие. Это ведёт к тому, что они могут быть не очень умными. А если модель накормить датасетами и попытаться раздуть её размер, то это приведёт к снижению скорости генерации токенов (хотя будет всё ещё выше авто-регрессионных моделей) и эффективность подхода снизится

Диффузионные модели менее изучены, по сравнению с традиционными авто-регрессионными моделями, а существующие наработки от традиционных моделей к ним применимы не все.

Как можно использовать преимущество таких моделей?

Нам необходим способ валидации вывода этих моделей.

Один из самых популярных и хорошо развитых способов — это генерация кода моделью и его проверка с помощью компилятора. Например, можно сгенерить Typescript код и сразу же запустить проверку линтером, в ответ, если получим ошибки линтера, то отправляем их обратно в модель и таким образом это работает до тех пор, пока ошибки не пофиксятся. Так сейчас работает Cursor и с обычными моделями, но с диффузионными это может занять несколько секунд, буквально. И так же работает Google Diffusion, судя по всему.

Такие модели удобно будет использовать в около риал-тайм сценариях:

- подсказки/перевод во время разговора прямо на девайсе пользователя

- роботы (которые железяки, которые прям морду могут набить)

- генерация контента в играх прямо на устройстве пользователя

Что думаете по поводу диффузионных моделей? Был ли у кого-то опыт использования? 👇
Media is too big
VIEW IN TELEGRAM
Telegram x xAI

Самая полезная фича из анонса - на скриншоте. Наконец-то теперь можно будет удобно менеджерить проекты для тех команд, кто ведёт работу в Telegram 😄

https://t.me/durov/422
Veo 3 доступен на тарифе Pro, пока что только в регионе US

С ударениями чуть напортачил, ну ничо
ABSOLUTE CINEMA

Через AI Studio теперь можно расшарить свой экран и общаться голосом с моделькой 2.5 Flash.

Например, можно решить проблемы, которые вам сложно сформулировать словами в тексте

ai.studio
Media is too big
VIEW IN TELEGRAM
Veo 3

Новая модель от гугла, которая генерит ещё и аудио, прошлая генерила только видео.

Я в шоке, мой шок в шоке. Я давно так не удивлялся, со времен первого релиза Chatgpt

Да, все эти видео сгенерированы
Google Stitch

Помимо всех тех штук, о которых вы уже знаете, гугл выпустил Stitch – AI design tool.

Наконец-то!
Можно по промпту сгенерить дизайн, вот только он будет в стиле интерфейсов гугла. Экраны можно сразу же скопировать в Figma. Можно подтюнить экраны с помощью промптов, можно поменять предустановленные стили.

Очень круто! Это именно то, чего так долго не хватало. На видео у меня дизайн генерил 2.5 Flash (Standard Mode), есть так же Experimental Mode на Gemini 2.5 Pro.

Доступно бесплатно тут
https://stitch.withgoogle.com

Prompt guide:
https://discuss.ai.google.dev/t/stitch-prompt-guide/83844
Media is too big
VIEW IN TELEGRAM
Google Jules – coding agent

5 tasks per day for free

https://jules.google.com/

Можно оставить заявку на ранний доступ
По новостям – опять ожидается, как минимум, два-три жарких месяцев релизов 🔥
В ближайшие пару недель ожидаем релизов coding agents.

Первыми были OpenAI на прошлой неделе, сегодня Microsoft зарелизили Github Copilot Coding Agent. Завтра стартует Google I/O, на котором я ожидаю релиз coding agent от Google. В среду Anthropic будет проводить Code with Claude 2025, думаю что они тоже зарелизят апдейт их Claude Code.

Далее, ожидаем релиз Google Gemini 2.5 Pro DeepThink, DeepSeek R2, xAI Grok 3.5, OpenAI давно обещали выпустить GPT-5 как раз в это время (май-июнь), Claude тоже готовят следующую новую модель.

UPD: в комментах ссылка на Google Jules: https://jules.google.com/

5 запросов в сутки
Что с Apple AI? Мои мысли

Сегодня вышла статья Bloomberg (версия без paywall) о том, что происходит с Apple AI.
Я прочитал статью и написал небольшой саммари и мои мысли на этот счёт в Вастрик.Клубе:

https://vas3k.club/post/28465/

Здесь продублирую выводы и напишу инсайты:

У Apple ещё не всё потеряно и рано списывать их со счётов. Такие огромные компании имеют большой запас прочности. Сфере AI пока всего лишь менее 3-х лет и у Apple всё ещё есть все шансы забрать свою нишу. Достаточно посмотреть на новости за этот год: крупный бигтех сказал спасибо стартапам и начал заходить в AI: Cloudflare — делают много крутых инструментов, Google — начали с кринжового Google Bard в 2023 и теперь у них Gemini, который входит в топ-3 AI по качеству и эффективности. В комментах можете продолжить список :)

Если верить статье, то, Apple, пересмотрели свою политику работы и надеюсь что взялись за голову — датасеты с пользовательскими данными и быстрое принятие решений должно помочь им выпустить качественный и полезный продукт с AI под капотом.

Инсайты

- Google платит в год Apple чуть меньше ($20B), чем они зарабатывают на своем App Store (около $24B)
- Стив Джобс лично курировал разработку Siri на начальном этапе ещё с 2010 года и немного не дожил до первого релиза Siri
- Крейг Федериги настолько был поражён способностями ChatGPT в написании кода после релиза в ноябре 2022, что он и другие executives встречались c OpenAI, Anthropic и другими игроками для того чтобы те провели им "курс" о положении дел на рынке Gen AI.
Пост восхваления Gemini

Я давно хотел рассказать о том, что я сам использую в работе.
В последнее время я часто пользуюсь Gemini. Я подключил подписку Gemini Advanced месяц назад, после того как они запустили Deep Research 2.5 Pro, который доступен только для платной подписки, и с тех пор кайфую.

Мне очень нравится Gemini, Гугл очень хорошо прокачал свой AI со времён Google Bard, которым пользоваться было невозможно.

Сейчас у меня подписки на три сервиса по $20 — Gemini Advanced, Claude Pro, OpenAI Plus. И Gemini в последнее время я использую чаще всего. У Gemini по ощущениям самые классные ответы, которые помогают решать мои задачи. Deep Research от Gemini мне нравится больше, чем от OpenAI — это очень подробные репорты, в своей работе Gemini обычно использует 100-200 источников.

Короче, я очень советую попробовать Gemini Advanced. Это прокаченная подписка Google One, которая включает в себя прокаченный Google Drive — там, например, будет доступно 2TB хранилища, увеличенные лимиты к Gemini, доступ к Veo 2 (очень крутая генерация видео) и доступ к Deep Research 2.5 Pro (Использует большую модель Gemini 2.5 Pro).

Я оплачиваю доступ к Gemini с казахстанской банковской карты и соответственно платежный аккаунт Google у меня казахстанский.

Gemini на днях запустил рефералки, только первые три счастливчика получат 4 месяца бесплатного пользования, и по рефералке можно зарегаться только для той же юрисдикции, что и у меня — Казахстан.

Вот моя рефералка — g.co/g1referral/SWTBSXSS

upd: первые три инвайта ушли

По ней вы получите 4 месяца бесплатного доступа к Gemini Advanced. Что я получу за реферала — неизвестно 😅, но мне не жалко.

Пользователям с Android доступны дополнительные фичи от подписки Gemini One. Какие именно — точно не знаю, у меня нет андроида 😄

Думаю что рефералки уйдут быстро, так что если зарегаетесь — делитесь рефералкой в комментах, чтобы другие люди тоже смогли попробовать Gemini Advanced.
Back to Top