Holo4: открытая модель для работы с экраном, кодом и API

Holo4: открытая модель для работы с экраном, кодом и API

H Company выпустила Holo4: агент видит интерфейс, пишет код и вызывает инструменты. Разбираем демонстрации в FreeCAD и Godot, открытые веса и пределы бенчмарков.

Содержание

28 сентября H Company представила Holo4 — семейство моделей для задач, которые проходят через экран приложения, код и инструменты. В одном сценарии агент может нажать кнопку в графическом редакторе, в другом — выполнить команду или вызвать API. Важно, что это описание возможностей модели и её среды исполнения, а не обещание, что любой сложный процесс будет выполнен без ошибок.

У Holo4 два основных варианта: плотная модель на 27 млрд параметров и MoE-модель 35B-A3B. Веса опубликованы на Hugging Face в нескольких форматах, включая FP8 и GGUF. Доступен и API разработчика. Такой выпуск интересен тем, что можно изучать не только демонстрационное видео, но и модельные карточки, конфигурацию, лицензии и записи действий агента.

Что именно показали на экране

В материале команды есть три наглядных сценария. В FreeCAD агент строит трёхмерную Эйфелеву башню по подробному описанию геометрии. Другой пример — объёмный знак из двух форм. В Godot агент собирает простую игру с лабиринтом, гранулами и преследующими персонажами. Это не статичные картинки, созданные одной командой: агент последовательно работает с программой, создаёт объекты и проверяет промежуточное состояние.

Визуальная часть здесь полезна для оценки результата. У башни можно увидеть форму опор и платформ, у игры — движение объектов и счёт. Но красивый финальный кадр не доказывает корректность всей последовательности. Для CAD-файла стоит проверять размеры и замкнутость тел, для игры — поведение после перезапуска и ошибки в длительной работе.

Как устроена связка модели и инструментов

Holo4 получает скриншоты и результаты вызовов инструментов, а исполнительная среда запускает предложенные моделью действия. По карточке модели, она может сочетать клики и ввод текста с кодом, MCP и API. Сама модель не равна готовому автономному приложению: её работу определяют доступные инструменты, права и цикл обратной связи.

Разработчики отдельно описывают память на сотни шагов и доступ к терминалу как изменения в исполнительной среде. Это важная деталь: в длинной задаче качество зависит не только от параметров модели, но и от того, помнит ли агент предыдущие попытки, замечает ли неудачи и может ли безопасно повторить шаг. Для изучения команда опубликовала траектории действий.

Что говорят числа и чего они не говорят

H Company приводит результаты OSWorld 2.0 и других тестов, но предупреждает, что сравниваемые модели использовали разные версии задач, среды запуска и режимы вычислений. Поэтому отдельный процент из таблицы нельзя переносить на конкретную рабочую программу. К тому же показанные примеры выбраны авторами выпуска; мы не повторяли их на собственном компьютере.

Открытые веса позволяют поставить более полезный вопрос: справится ли Holo4 с одной вашей задачей при заданных правах и лимите времени? Для пробного прогона подойдёт копия проекта без личных данных: например, создать одну CAD-деталь по проверяемым размерам или собрать маленькую сцену в редакторе. Запишите скриншоты шагов, итоговый файл и число исправлений. По этим данным модель можно оценить точнее, чем по ролику с готовым результатом.

Если интересна соседняя часть работы с агентами — распределение задач и долговременная память, мы разобрали соответствующие репозитории в недельной подборке GitHub. Holo4 решает другую задачу: выполняет действия внутри среды.

Читайте также

AI-проекты GitHub за неделю: память агентов, озвучка и дизайн
GitHub5 мин

AI-проекты GitHub за неделю: память агентов, озвучка и дизайн

Четыре проекта из недельной подборки GitHub: как управлять командой агентов, хранить их память, собирать локальный звук и проверять дизайн интерфейса.

ChatGPT Images 2.5: точечные правки и серия редактирований
Изображения4 мин

ChatGPT Images 2.5: точечные правки и серия редактирований

Разбираем ChatGPT Images 2.5: сохранение персонажа и композиции, эскизы, правки по комментариям и две API-модели. Как оценивать результат без рекламных обещаний.

Gemini 3.8 Live Avatar: голосовой диалог с живым AI-аватаром
AI и видео4 мин

Gemini 3.8 Live Avatar: голосовой диалог с живым AI-аватаром

Google показала Gemini 3.8 Live Avatar: синхронную речь, мимику и видео во время разговора. Что реально доступно, как работает связка с инструментами и что стоит проверить.

Runway в DaVinci Resolve: генерация и правки внутри монтажа
Видео4 мин

Runway в DaVinci Resolve: генерация и правки внутри монтажа

Плагин Runway переносит генерацию кадров и изменение видео в DaVinci Resolve Studio. Разбираем работу с таймлайном, пять ключевых кадров, ограничения и стоимость.

Runway Enhance Frame Rate: как получить 25–120 FPS из готового видео
Motion design4 мин

Runway Enhance Frame Rate: как получить 25–120 FPS из готового видео

Runway представила Enhance Frame Rate для пересчёта частоты кадров до 120 FPS. Разбираем форматы, ограничения по длительности и способ проверить артефакты движения.