GLM-5.3 とは?誰でも入手できる AI が攻撃を自動化する時代の企業防御

GLM-5.3 とは?誰でも入手できる AI が攻撃を自動化する時代の企業防御

GLM-5.3 とは、中国の Z.ai が重みを公開した 753B 規模の AI モデルで、米 NIST が公開済みのオープンウェイトモデルの中で最もサイバー攻撃の能力が高いと評価したものです。Anthropic の検証では、演習を装った指示や重みの改変で安全策を外し、攻撃コードの作成に応じさせられることも示されました。本記事は、タイと日本で事業を行う日系企業の経営層と情報システム担当者に向けて、GLM-5.3 で何が変わったのかを評価機関の結論・研究者の検証・攻撃事件の報告から整理し、セキュリティの専任者が少ない会社でも着手できる防御の順番を示します。読み終えると、公開資産の把握、修正の速さ、侵入された後の復旧、防御での AI の使い方を、自社に当てはめて決められます。

GLM-5.3 とは何か?

GLM-5.3 とは何か?

GLM-5.3 は、重みが誰でも入手できる形で公開された大規模な AI モデルで、入手した人が自分の環境で動かし、作り変えることもできます。 規模と公開のされ方を押さえると、評価機関や AI 企業がこのモデルを特別に扱った理由が見えてきます。

753B の MoE モデル:公開形式・ライセンス・必要な機材

GLM-5.3 は Z.ai(旧 Zhipu AI)が開発した、総パラメータ 753B の MoE(Mixture of Experts)モデルです。MoE は入力ごとに一部の専門部分だけを動かす構造で、全体の規模に比べて 1 回の推論で使う計算を抑えられます。重みは Hugging Face の zai-org/GLM-5.3 で、BF16 と FP8 の形式で配布されています。

ライセンスは Z.ai 独自の GLM-5.3 License で、MIT のような汎用のライセンスではありません。業務で使うなら、商用利用や再配布の条件をライセンスの本文で確かめる必要があります。

動かすのに必要な機材は小さくありません。BF16 の重みだけで、753B × 2 バイトから概算して約 1.5TB あり、高性能な GPU を何枚も備えたサーバーかクラウドの GPU 環境が前提です。手元のパソコンで動かせる規模ではない一方、GPU を時間単位で借りられる今は、資金のある攻撃者にとって越えられない壁ではありません。小型版の GLM-5.3-Flash も公開されており、こちらはさらに少ない計算資源で動きます。

重みが公開されると何が変わるのか?

API で提供される AI は、提供元が入力を監視し、規約に反する使い方をする利用者を止められます。重みが公開されたモデルでは、この前提が成り立ちません。入手した人は自分のサーバーで動かすため、提供元はどんな指示が入力されたかを知る手段を持たず、問題が見つかっても配布済みの重みを回収できません。

安全策も同じ構造です。開発元が学習の段階で組み込んだ「攻撃への協力を断る」性質は、重みを手にした側が追加の学習や改変で弱められます。Anthropic は GLM-5.3 でこの点を検証し、指示の工夫と重みの改変で安全策を外せることを数値で示しました。

提供のされ方による違いは、次の 3 点に集約できます。

観点API で提供される AI重みが公開された AI
入力の監視提供元が見られる提供元は見られない
不正な利用者の停止提供元が止められる止める手段が無い
安全策提供元が更新し続ける入手した側が弱められる

企業にとっての意味は、攻撃に使える AI を提供元の規約が止めてくれるとは期待できなくなったことです。防御は、攻撃者が高い能力の AI を自由に使える前提で組み立てる必要があります。

国会で示されていた「数か月から 1 年」の見通し

参議院の特別委員会では、チームみらいの安野貴博党首が、一般には公開されていない Claude Mythos を例に挙げ、「早くて数か月、遅くても 1 年以内に米国以外の企業も同様のモデルを開発できる可能性」があると述べていました。特定の企業の計画を指した発言ではなく、最先端の AI の能力が時間差で他国の開発元にも広がるという見通しです。

GLM-5.3 は、この見通しが現実の話であることを示しました。Anthropic の検証では、攻撃コードを最後まで完成させた回数が Claude Mythos Preview とほぼ同じでした。一方で NIST の評価は、サイバー能力の総合では米国の最先端から約 4 か月遅れていると結論づけています。どちらの数字も、最先端との差が年単位ではなく月単位で語られる段階にあることを示しています。備えの時間軸は「いずれ来る脅威」から「すでに入手できる道具」へ切り替える必要があります。

GLM-5.3 のサイバー攻撃の能力はどこまで高いのか?

GLM-5.3 のサイバー攻撃の能力はどこまで高いのか?

GLM-5.3 は公開モデルとしては最も高いサイバー能力を持ちますが、総合では米国の最先端モデルに及びません。 NIST と Anthropic は別々の方法で評価しており、数字の意味を取り違えないことが、脅威を正しく見積もる出発点になります。

NIST(CAISI)の評価:公開モデルで最高、米国の最先端からは約 4 か月遅れ

米 NIST の CAISI(Center for AI Standards and Innovation)は、GLM-5.3 をこれまでに公開されたオープンウェイトモデルの中で最もサイバー能力が高いと評価しました。同時に、その能力は米国の最先端モデルより大幅に低く、総合では約 4 か月遅れているとも明記しています。片方だけを読むと、脅威を過大にも過小にも見積もることになります。

CAISI が使った 4 つの評価は、どれも実在のソフトウェアの欠陥を題材にしており、欠陥を見つける課題と、攻撃コードに仕上げる課題に分かれます。

評価課題の内容GLM-5.3 の結果
SEC-Bench ProV8 や SpiderMonkey の既知の脆弱性を見つけ、異常終了させるコードを書く40.4%(183 件中 74 件)
ExploitBench脆弱性を、任意のコードを実行できる攻撃コードに仕上げる61.1%(16 点中 9.8 点)
ExploitGym(ユーザー空間)オープンソースの実在のバグから攻撃コードを作る9.4%(498 件中 47 件)
OSS-Fuzz説明・再現例・修正の無い状態で既知の欠陥を見つける7.7%(297 件中 23 件)

ExploitBench の 61.1% は得点の割合で、攻撃コードを完成させた回数の割合ではありません。

Anthropic の検証:攻撃コードの完成は 410 回中 50 回

Anthropic は ExploitBench を使い、攻撃コードを最後まで完成させた回数を数えました。GLM-5.3 は 410 回の試行のうち 50 回で完成させ、一般には公開されていない Claude Mythos Preview の 56 回とほぼ同じ水準でした。CAISI の 61.1% とは数え方が違い、こちらは完成した回数そのものです。

この結果が示すのは、攻撃コードを作る作業に限れば、公開モデルと非公開の最先端モデルの差がほとんど無いことです。総合の能力では差があっても、攻撃者が必要とする特定の作業では、すでに追いつかれている部分があります。脆弱性の情報から、実際に侵入に使える攻撃コードを仕上げる工程は、これまで攻撃者にとっても腕の立つ技術者と時間が要る部分でした。この工程の一部を、入手した AI が代わりに受け持てるようになっています。企業の防御にとっての論点は、この能力がすでに公開され、誰でも動かせる状態にあることです。

安全策は外せる:演習を装う指示で 64%、重みの改変で 100%

GLM-5.3 は、攻撃への協力を直接求める指示には応じません。ところが Anthropic の検証では、指示の工夫と重みの改変で、安全策が段階的に崩れました。

  1. 自律的なレッドチームのエージェントとして演習に取り組んでいる、と偽る指示を与えると、64% の確率で応じました。
  2. モデルの思考の書き出しを先に差し込み、依頼を検討したうえで進めると判断したように見せると、92% まで上がりました。
  3. 重みを改変して拒否の性質を取り除く abliteration を施すと、100% 応じました。

abliteration は特別な設備を要する作業ではありません。初めてこの作業に取り組んだ Anthropic のチームでも、GLM-5.3 で約 2,200 GPU 時間、計算費用にして約 4,400 ドルで済み、GLM-5.3-Flash では約 600 GPU 時間でした。重みが公開されている以上、安全策は配布した側が保証できるものではなく、入手した側がいつでも外せる設定だと考える必要があります。

攻撃の現場では何が起きているのか?

攻撃の現場では何が起きているのか?

AI エージェントに攻撃の工程を分担させ、6 日間で少なくとも 27 社に侵入した事件が報告されています。 ベンチマークの数字が実際の被害とどうつながるのかを、海外の事件報告と国内の漏えい事故から確認します。

AI エージェントの分業で、6 日間に 105 件の攻撃

セキュリティ企業の Gambit Security は、金銭目的の攻撃者が複数の AI エージェントに役割を分けて攻撃した事件を報告しています。脆弱性の探索、侵入の実行、全体の指揮を別々のエージェントが受け持ち、攻撃者は 6 日間で 105 件の攻撃を始め、少なくとも 27 社に侵入しました。2 社からは、有効なカード情報が 60 万件以上盗まれています。

報告で目を引くのは費用と速さです。1 社あたりの費用は数ドルから数十ドルで、侵入の多くは 1 日以内に終わっていました。これだけの件数を数日でこなすのは、人の手作業だけでは難しい規模です。

1 件の事件ですが、安い費用で数十社を同時に狙えることが実際に示されました。「うちは規模が小さいから狙われない」という判断は、根拠を失いつつあります。

カード情報を扱う EC サイトや、顧客の個人情報を預かる会社は、この事件を自社に置き換えて点検する価値があります。侵入の多くが 1 日以内に終わる以上、異常に気づいてから委託先に連絡し、対応を決めるまでの時間も短くしておく必要があります。夜間や休日に誰へ連絡が届くかを決めておくことも、その一部です。

国内で続く漏えい事故

国内でも、不正アクセスやランサムウェアによる漏えい事故が続いています。GMO リサーチ&AI が運営する「infoQ」は、ソフトウェアの脆弱性を突いた不正アクセスを受け、最大約 95 万件の情報に影響が出ました。大阪公立大学はランサムウェアの被害を受け、約 13 万人分の個人情報が流出した恐れがあると発表しています。

どちらの事故も、攻撃に AI が使われたとは発表されていません。GLM-5.3 と直接結びつけることはできませんが、脆弱性を突く不正アクセスとランサムウェアは、AI の能力が上がる前から国内で起きている被害です。

2 つの事故は侵入の起点が違います。infoQ の事故は外から届くシステムの弱点を直接突かれたもので、修正の速さと公開資産の管理が問われます。ランサムウェアは侵入した後にデータを暗号化し、持ち出しを伴うものもあるため、バックアップと復旧の設計が問われます。Gambit Security の報告と Anthropic の検証が示したのは、こうした攻撃の工程を AI が速く、安くできるということです。

なぜ「修正が間に合う」前提が崩れるのか?

なぜ「修正が間に合う」前提が崩れるのか?

公開済みの脆弱性から、実際に動く攻撃コードができるまでの時間が、数時間単位に縮んだためです。 「修正が間に合う」という前提は、脆弱性の情報が公開されてから攻撃コードが出回るまでに、企業が修正を当てる時間差があることに頼っています。

Anthropic の検証では、研究者が GLM-5.3-Flash に、公開済みの CVE の詳細と、もう 1 つの既知の欠陥の情報を渡しました。GLM-5.3-Flash は研究者からほとんど指示を受けずに 2 つの欠陥をつなぎ、ARM64 の環境で、ポインタ認証(PAC)という防御を回避して安定して動く攻撃コードを組み立てました。かかったのは人の関与 20 分とモデルの作業 8 時間で、Anthropic が Zhipu の API 料金で換算した費用は 20.40 ドルです。

対象は未知の脆弱性ではなく、すでに公開されていた欠陥です。これまで、公開情報から実用的な攻撃コードを組み立てるには、専門の技術者が時間をかけて検証する必要があり、その手間が企業にとっての猶予になっていました。この工程を小型のモデルが 1 日かからずに済ませた以上、修正の公開から適用までに数日から数週間をかける運用は見直しが必要です。修正を当てる日は、定例の作業日ではなく、攻撃コードが組み立てられる速さを基準に決めます。

企業がいま見直すべき防御は?

企業がいま見直すべき防御は?

見直す順番は、公開資産の把握、修正の速さ、侵入された後の復旧、そして防御での AI の活用です。 修正が間に合う前提が崩れた以上、防御の目標は「侵入されないこと」だけでなく、「どこを突かれるかを知り、突かれても事業を止めないこと」に広がります。

外部に公開している資産と修正の期限

外部に公開している資産とは、インターネットから到達できるサーバー、Web アプリケーション、VPN 機器、API の入口など、社外の攻撃者が最初に触れられるものを指します。これを一覧にしていない会社は、どこを突かれるかを自分で把握できていません。洗い出しは、自社が持つドメインの DNS 設定、クラウドの管理画面にある公開設定、ファイアウォールで開けている通信の 3 つを突き合わせると漏れを減らせます。

見直しの第一歩は、資産ごとに「どのソフトウェアのどの版が動いているか」「誰が管理しているか」を記録することです。タイと日本に拠点がある会社では、拠点ごとに別の委託先が設置した機器や、担当者の異動で管理者がいなくなった機器が残りやすく、こうした機器を優先して洗い出します。

修正の期限は、資産の種類ごとに社内で決めます。インターネットに面した資産は社内向けの端末より短い期限にし、重大な脆弱性が公表されたら、定例の作業日を待たずに適用する例外の手順を用意しておきます。期限を決めても、適用する担当者と承認する人が決まっていなければ守れません。一覧に担当者の欄を設けることが、期限を実際に守るための前提になります。

侵入を前提にした「最低限の事業」と復旧

侵入を完全に防ぐ前提で組んだ対策は、数時間で攻撃コードが組み上がる状況では後手に回ります。見直しの軸を、侵入を防ぐことから、侵入された後も事業を止めないことへ広げます。

最初に決めるのは、どの業務が止まると売上や顧客対応に直接響くかという優先順位です。受発注や請求のシステム、顧客情報のデータベースのように止まると事業が回らない部分と、数日止まっても耐えられる部分を分け、前者から復旧の手順を文書にします。システムが止まっている間に、電話や紙の伝票で受注を続けるといった代わりのやり方も、あらかじめ決めておくと混乱を抑えられます。連絡先の一覧は、社内システムが使えない状態でも見られるよう、印刷したものや別の手段で保管しておきます。

バックアップは、本番の環境と同じネットワークや同じ管理者権限の下に置かないことが重要です。ランサムウェアは本番と一緒にバックアップまで暗号化しようとするため、切り離した場所に復元元を残します。復元できるかは実際に戻してみないと分からないため、年に数回は復元の訓練を行い、どの業務を何時間で再開できるかを確かめます。情報が持ち出された場合は、バックアップから戻しても漏えいの対応は終わらないため、顧客や当局への連絡の手順も合わせて決めておきます。

防御側も AI を使う

Anthropic は、防御する側も目的に合った最良の道具を使うべきだという立場を示し、自社の AI のサイバー分野の能力を、防御する側へ安全に広げる取り組みを進めています。攻撃者が高い能力の AI を自由に使える以上、防御側だけが人手に頼っていては速さで追いつけません。

AI が役立つのは、人の手では後回しになりやすい定型の点検です。公開資産の版情報の収集、公表された脆弱性と自社の構成の突き合わせ、ログからの異常の拾い上げは、繰り返しが多く、継続して回すほど価値が出ます。セキュリティの専任者が少ない会社ほど、この効果は大きくなります。

ただし防御に使う AI も、攻撃に使われる AI と同じ技術です。社内のどの情報まで渡すか、AI がどのシステムを操作できるかを決めずに導入すると、AI に与えた権限そのものが新しい弱点になります。点検の対象を公開資産に絞るなど扱う範囲を区切り、修正の適用は人が最終的に承認する運用を先に決めておきます。たとえば、AI は脆弱性と影響を受ける資産を見つけて担当者に知らせるところまでを受け持ち、設定の変更や修正の適用は担当者が行う、という分け方です。

専任の担当者がいない会社はどこから始めるか?

専任の担当者がいない会社はどこから始めるか?

専任の担当者がいなくても、公開資産の一覧、修正の期限、復旧の手順、AI に任せる範囲の 4 つを、3 か月を目安に決めることから始められます。 大きな予算や専門の部署が無くても、順番を決めて進めれば着手できます。

  1. 最初の 2 週間で、インターネットに面した資産を洗い出します。ドメイン、サーバー、VPN 機器、クラウドの公開設定、委託先が管理するシステムまで含め、版と管理者を一覧にします。
  2. 次の 1 か月で、修正の期限と例外の手順を決めます。重大な脆弱性が公表されたとき、誰が判断し、誰が適用するかを名前で決めておきます。
  3. 2 か月目からは、止められない業務の優先順位を決め、バックアップの切り離しと復元の訓練を始めます。
  4. 並行して、AI に任せる点検の範囲と、人が承認する作業の境目を決めます。

タイと日本の両方に拠点がある会社では、拠点ごとに担当者と委託先が違うため、一覧と手順は拠点ごとに作り、期限と優先順位は本社でそろえる形が進めやすくなります。委託先が運用するシステムは、契約や保守の取り決めで、脆弱性が公表されたときの対応期限と報告の方法を確かめておきます。

FAQ

FAQ

GLM-5.3 への向き合い方は、安全か危険かの二択では決まりません。 経営層や情報システム担当者からよく出る疑問に、判断の分かれ目と合わせて答えます。

Q1: GLM-5.3 を自社の業務に使っても安全?

使い方の設計次第です。GLM-5.3 は独自の GLM-5.3 License で公開されており、MIT のような汎用のライセンスではないため、まず商用利用と再配布の条件をライセンスの本文で確かめます。そのうえで、安全策が演習を装う指示や重みの改変で外せることを前提に、モデルに渡す社内情報の範囲を区切り、生成された結果を人が承認する運用を決めておく必要があります。自社のサーバーで動かすには大規模な GPU 環境が要るため、費用の面でも、API で提供される AI と比べて割に合うかを検討します。

Q2: 中小企業も AI の自動攻撃に狙われる?

狙われます。Gambit Security が報告した事件では、1 社あたりの費用が数ドルから数十ドルでした。この費用なら、攻撃者が会社の規模で相手を選ぶ理由はほとんどありません。むしろ公開資産の管理や修正が後回しになっている会社ほど、侵入までの時間が短くなります。公開資産の一覧と修正の期限を決めておくだけでも、突かれる場所は減らせます。

Q3: 脆弱性の点検は年 1 回で足りる?

足りません。公開済みの脆弱性から 1 日かからずに攻撃コードが組み上がる例が出ている以上、年 1 回の点検では間に合いません。点検の頻度は、資産の種類で分けるのが現実的です。

  • 外部に公開しているサーバーや API は、新しい CVE が公表されるたびに、自社の構成と突き合わせます。
  • 社内向けの端末やネットワーク機器は、定期の点検に、重大な脆弱性が公表されたときの臨時の点検を組み合わせます。
  • 委託先が運用するシステムは、同じ頻度で点検されているかを、契約や定例の報告で確かめます。

人の手だけでこの頻度を保つのは難しいため、版情報の収集と突き合わせは自動化を検討します。

まとめ

まとめ

GLM-5.3 が変えたのは、高い能力を持つ攻撃向けの AI を、誰でも入手し、安全策を外して使えるようになったことです。NIST の評価は「公開モデルで最高、米国の最先端からは約 4 か月遅れ」と両面を示し、Anthropic の検証は、攻撃コードの作成では非公開の最先端モデルとほぼ同じ水準にあることを示しました。小型版の GLM-5.3-Flash は、公開済みの欠陥 2 つをつなぐ攻撃コードを、人の関与 20 分とモデルの作業 8 時間で組み立てています。

企業が先に着手できることははっきりしています。公開資産を一覧にし、版と管理者を把握すること。修正の期限を資産ごとに決め、重大な脆弱性には例外の手順で素早く対応すること。侵入を防ぎ切る前提を外し、どの業務を何時間で再開させるかを決め、切り離したバックアップから戻せるかを確かめておくこと。そして定型の点検に AI を使い、修正の適用は人が承認することです。

防御は、道具を入れた時点で完成するものではありません。点検の頻度と修正の速さを、攻撃者が AI で手に入れた速さにどこまで近づけられるかが、これからの備えの評価軸になります。

著者・監修者

Yusuke Ishihara

Yusuke Ishihara

13歳でMSXに触れプログラミングを開始。武蔵大学卒業後、航空会社の基幹システム開発や日本初のWindowsサーバホスティング・VPS基盤構築など、大規模システム開発に従事。 2008年にサイトエンジン株式会社を共同創業。2010年にユニモン株式会社、2025年にエニソン株式会社を設立し、業務システム・自然言語処理・プラットフォーム開発をリード。 現在は生成AI・大規模言語モデル(LLM)を活用したプロダクト開発およびAI・DX推進を手がける。