For the complete documentation index, see llms.txt. This page is also available as Markdown.

Zhipu GLM-4.6V

Cherry Studio ユーザーは現在、内蔵の CherryIN サービスを無料で体験 智谱 GLM-4.6V——Z.ai(智谱AI)が2025年12月に公開したビジュアル旗艦モデルで、MoEアーキテクチャ、128Kのネイティブ・マルチモーダルコンテキスト、ネイティブ・マルチモーダルツール呼び出しを備え、画像・テキスト理解とマルチモーダルAgentシーンに最適な選択です。


GLM-4.6Vとは?

GLM-4.6VはZ.aiのGLM-Vシリーズの最新世代の視覚言語モデルで、テキスト+画像の統一モデリングをネイティブにサポートし、GLM-4.5Vを基にコンテキストとツール呼び出し能力をさらに拡張しています。

  • アーキテクチャ:Mixture-of-Experts(MoE)

  • 総パラメータ数:106B

  • アクティブ化パラメータ数:約12B

  • コンテキスト長:128K tokens

  • オープンソースライセンス:MIT

  • 公開日:2025年12月8〜9日

  • 視覚エンコーダー:マルチ解像度画像に対応(最大4K)

シリーズには同時に GLM-4.6V-Flash(9B)が含まれ、本地と低遅延シーン向けで、無料で商用利用可能です。


GLM-Vシリーズのマルチモーダルトレーニング体系を継承

GLM-4.6VはGLM-4.1V-Thinking / GLM-4.5Vの技術路線を踏襲し、視覚とAgentの方向でさらに強化されています:

  1. ネイティブ・マルチモーダルモデリング:テキストと画像を共同学習し、画像とテキストの混在入力をサポート

  2. コンテキスト拡張:学習時のコンテキストを128K tokensまで拡張し、1回で約150ページの高密度文書、200ページのスライド、または1時間の動画を処理可能

  3. ネイティブ・マルチモーダルツール呼び出し:ツールは画像を直接入力・出力として受け取ることができ、拡張されたMCPプロトコルに基づきURL形式でマルチモーダル成果物を処理します

  4. 強化学習の強化:GLM-Vシリーズの拡張可能なRLフローを継承


ネイティブ・マルチモーダル、実世界のシーン向け

GLM-4.6Vのマルチモーダル能力は、日常から専門分野までをカバーします:

  • リッチテキスト内容理解:長文書、複数ページのテキスト、画像とテキストが混在したレイアウト

  • ビジュアルWeb検索:視覚入力と組み合わせてオンライン検索と理解を行う

  • フロントエンド再現:デザイン稿やUIスクリーンショットからフロントエンドコードを生成

  • 長文コンテキストのマルチモーダル文書分析:PDF全体 / スライド / 動画レベルの入力

  • 図表と表の解析:構造化情報の抽出


ネイティブ・マルチモーダルツール呼び出しとAgent能力

GLM-4.6Vの主要アップグレードの一つは、 「視覚認識 → 実行可能なアクション」 の閉ループです。ツール呼び出しは画像を入力と出力の両方としてネイティブにサポートし、マルチモーダルAgentを実業務で実装可能にします。

シーン
推奨の使い方

シンプルな画像・テキストQA

直接会話

「この画像には何が写っていますか?」

中程度の複雑さのタスク

ツール呼び出しを有効化

図表を読み取ってデータを検索

複雑なマルチモーダルAgent

複数ツール + MCP

スクリーンショット → 理解 → API呼び出し → レポート生成


高効率MoE、オープンに利用可能

  • ⚡ MoEの疎活性化:106Bの総パラメータのうち、約12Bのみを活性化

  • 💰 CherryINを通じてCherry Studioで 無料で利用

  • 🖥️ 重み、推論コード、MCPツールはGitHubとHugging Faceでオープンソース公開、MITライセンス


実用能力に注力:マルチモーダルアシスタント

GLM-4.6Vは実際の利用では次のシーンに適しています:

  • 文書アシスタント:長文書、スキャン文書、スライドの通読と要約

  • データ分析:図表やダッシュボードのスクリーンショットを認識・解読

  • フロントエンドとデザイン:UIスクリーンショットに基づいてフロントエンドコードを生成または修正

  • ビジュアル検索:画像と組み合わせてオンライン検索と情報統合

  • マルチモーダルAgent:ブラウザ、コード実行、検索などのツールを組み合わせて複雑なタスクを完了


Cherry Studioでの使い方は?

  1. Cherry Studioを開き、 設定 → モデルサービス

  2. を見つけて CherryIN サービスプロバイダーを有効にします。

  3. モデル一覧で選択 智谱 GLM-4.6V

  4. チャット画面に戻り、上部のモデル選択で GLM-4.6Vなら、会話の中で直接画像をアップロードして画像・テキスト対話ができます。

💡 ヒント:CherryINが提供する無料モデル枠はCherry Studio公式が負担しており、日常の体験や評価に適しています。運用環境ではZ.ai(智谱)の公式APIとの併用を推奨します。


📘 今すぐ智谱GLM-4.6Vを体験し、ネイティブ・マルチモーダルとビジュアルAgent能力を解放しましょう!


ヘルプの取得とフィードバックの送信

設定または使用中に不明点、バグ、機能改善の提案がある場合は、 フィードバックと提案 に記載の公式チャネルをご参照ください。

最終更新

役に立ちましたか?