Zhipu GLM-4.6V
Пользователи Cherry Studio теперь могут через встроенный CherryIN бесплатно опробовать сервис Zhipu GLM-4.6V— флагманская визуальная модель, выпущенная Z.ai (Zhipu AI) в декабре 2025 года; архитектура MoE, нативный мультимодальный контекст 128K и нативный мультимодальный вызов инструментов — предпочтительный выбор для понимания текста и изображений и сценариев мультимодальных агентов.
🚀 Что такое GLM-4.6V?
GLM-4.6V — это новейшая визуально-языковая модель серии Z.ai GLM-V, нативно поддерживающая единое моделирование текста + изображений и дополнительно расширяющая контекст и возможности вызова инструментов по сравнению с GLM-4.5V.
Архитектура: Mixture-of-Experts (MoE)
Общее число параметров: 106B
Активируемых параметров: около 12B
Длина контекста: 128K токенов
Лицензия с открытым кодом: MIT
Дата выпуска: 8–9 декабря 2025 года
Визуальный кодировщик: поддерживает изображения с несколькими разрешениями (до 4K)
Серия также включает GLM-4.6V-Flash (9B)— для локальных и низколатентных сценариев, бесплатно для коммерческого использования.

📚 Продолжение мультимодальной системы обучения серии GLM-V
GLM-4.6V унаследовала технологическую линию GLM-4.1V-Thinking / GLM-4.5V и была дополнительно усилена в направлениях зрения и агентов:
Нативное мультимодальное моделирование— совместное обучение текста и изображений, поддержка смешанного ввода текста и изображений
Расширение контекста— обучающий контекст расширен до 128K токенов; за один раз можно обрабатывать около 150 страниц плотного документа, 200 страниц слайдов или 1 час видео
Нативный мультимодальный вызов инструментов— инструменты могут напрямую принимать и возвращать изображения; на основе расширенного протокола MCP мультимодальные артефакты обрабатываются по URL
Усиление с помощью обучения с подкреплением— используется масштабируемый RL-процесс серии GLM-V

⚙️ Нативная мультимодальность, ориентированная на реальные сценарии
Мультимодальные возможности GLM-4.6V охватывают повседневные и профессиональные сценарии:
✅ Понимание форматированного контента— длинные документы, многостраничный текст и смешанная верстка текста с изображениями
✅ Визуальный веб-поиск— сетевой поиск и понимание с использованием визуального ввода
✅ Репликация фронтенда— генерация фронтенд-кода по макету или скриншоту UI
✅ Мультимодальный анализ документов с длинным контекстом— ввод целого PDF / презентации / видеоуровня
✅ Анализ графиков и таблиц— извлечение структурированной информации
💡 Нативный мультимодальный вызов инструментов и возможности Agent
Один из ключевых апгрейдов GLM-4.6V — это "визуальное восприятие → исполнимое действие" замкнутый цикл: вызов инструментов нативно поддерживает изображения как вход и выход, позволяя мультимодальным агентам внедряться в реальные бизнес-задачи.
Простые вопросы и ответы по изображению и тексту
Прямой диалог
"Что на этом изображении?"
Задачи средней сложности
Включить вызов инструментов
Извлечение данных после чтения графика
Сложный мультимодальный агент
Несколько инструментов + MCP
Скриншот → понимание → вызов API → генерация отчёта
🌟 Эффективная MoE, открытая и доступная
⚡ Разреженная активация MoE: 106B параметров всего, активируется лишь около 12B
💰 Через CherryIN в Cherry StudioБесплатное использование
🖥️ Веса, код инференса и инструменты MCP уже открыты в GitHub и Hugging Face под лицензией MIT
🧠 Фокус на практических возможностях: мультимодальный помощник
GLM-4.6V на практике подходит для следующих сценариев:
Помощник по документам— полное чтение и краткое изложение длинных документов, сканов и презентаций
Анализ данных— распознавание и интерпретация графиков, скриншотов дашбордов
Фронтенд и дизайн— генерация или изменение фронтенд-кода по скриншоту UI
Визуальный поиск— сетевой поиск и объединение информации с использованием изображений
Мультимодальный агент— выполнение сложных задач с помощью браузера, выполнения кода, поиска и других инструментов
🧭 Как использовать в Cherry Studio?
Откройте Cherry Studio, перейдите в Настройки → Сервис моделей。
Найдите CherryIN поставщика услуг и включите.
В списке моделей выберите Zhipu GLM-4.6V。
Вернитесь в чат, в верхнем выборе модели переключитесь на GLM-4.6V— и можно прямо в диалоге загружать изображения для текстово-визуального взаимодействия.
💡 Подсказка: бесплатные лимиты моделей, предоставляемые CherryIN, оплачиваются официально Cherry Studio и подходят для повседневного использования и тестирования; для производственной среды рекомендуется использовать официальный API Z.ai (Zhipu).
📘 Попробуйте Zhipu GLM-4.6V прямо сейчас и откройте нативную мультимодальность и возможности визуального агента!
💡 Получить помощь и отправить отзыв
Если вы в процессе настройки или использования столкнётесь с любыми вопросами, багами или предложениями по улучшению функций, пожалуйста, обратитесь к Обратная связь и предложения официальным каналам, указанным там.
Последнее обновление
Это было полезно?