GPT-5.5 Beats Fable, Cursor Takes On GitHub & Midjourney Scans Your Body | This Week in AI
20分 9秒
AIエージェント最前線:Fable問題、GPT-5.5、GLM 5.2、Originまで最新動向を解説
この記事は動画の内容を元にAIが生成したものです。正確な情報は元の動画をご確認ください。
ポイント
- •AIエージェントの最前線で起きている動きとして、GitHub競合の「Origin」登場や、Fableモデルが引き起こした安全性と政府介入の問題が分かります。
- •OpenAIのGPT 5.5 Cyberによるサイバーセキュリティ強化の試みや、Anthropicを含む主要モデルが直面する信頼性と運用上の課題を把握できます。
- •商用モデルに匹敵する性能を持つオープンウェイトモデル「GLM 5.2」の台頭が、AI開発の民主化と今後のイノベーションに与える影響を理解できます。
AIエージェントの世界は目覚ましい速度で進化しており、毎週のように新たな発表や技術的な進展が見られます。特に最近では、GitHubの競合となる新プラットフォームの登場、強力なAIモデルのセキュリティ問題、そして新しいオープンウェイトモデルの登場など、多岐にわたるトピックが業界の注目を集めています。この記事では、最新のAIモデルとエージェント開発を取り巻く動向を、具体的なニュースや発表に基づいて詳しく掘り下げていきます。
CursorのGitHub競合「Origin」の登場
まず、Cursorが発表した「Origin」という新しいプラットフォームは、GitHubの強力な競合となる可能性を秘めています。この動きは、「AIエージェントやAI主導の世界のために特別に設計されたGitHubはどのような姿になるのか」という問いを提起しています。Cursorは、この分野で大きな資本力と技術的要素を兼ね備えており、今後の展開に期待が寄せられています。
Fableモデルの衝撃と現状
先週も話題になったFableモデルについては、新たな情報が入ってきました。AmazonがFableを「ジェイルブレイク(脱獄)」できる可能性があると報じられた件に加え、6月11日には「MythosがNSAの機密システムに短期間で侵入した」という情報が浮上しました。これがFableの撤回決定につながった可能性が指摘されています。
この事態は、AIモデルの安全性と信頼性に関する重大な問題を浮き彫りにしています。もしAnthropicが自社のモデルを「最も危険なモデル」と宣伝していたのであれば、政府がこれに対して行動を起こすのは当然の反応かもしれません。モデルの危険性を強調することで、国民に注意喚起を促すことはできますが、一方でそれが政府の介入を招く可能性もあります。Fableレベルの強力なモデルが再び利用可能になることを多くの人が望んでいますが、現時点では具体的なタイムラインは見えていません。
All-Inポッドキャストでもこの件が議論され、David Saxs氏は「危険だと煽っていたのだから、その情報に基づいて誰かが行動しても責められない」と指摘しています。国家安全保障への最大の脅威となり、人々の雇用を奪う可能性があるとまで言われたモデルが、実際にはガードレール(安全対策)を破られる可能性があると示された場合、それまで述べられてきた「危険性」は依然として真実であり続けるわけです。将来的には、これらのモデルへのアクセスにID認証が必要になるなど、利用方法を検証し、追跡するための厳格な仕組みが導入される可能性も示唆されています。しかし、これは米国以外のユーザーが同様の高度なAIにアクセスする機会を制限する可能性も孕んでいます。
OpenAIの最新動向
Sam Altman氏とOpenAIは、最新モデル「GPT 5.5 Cyber」を発表しました。このモデルは、サイバーセキュリティ評価環境であるCyber Gymにおいて、FableやMythosプレビュー(ガードレールなしの基盤モデル)をも凌駕する最先端のパフォーマンスを発揮するとされています。これにより、ベンチマーク上ではFableに匹敵する、あるいはそれ以上のサイバーセキュリティモデルがすでに公開されている、と議論できる状態です。ただし、現時点ですべてのユーザーがアクセスできるわけではなく、今後の展開が注目されます。
さらにOpenAIは、「OpenAI Daybreak」の拡張を発表し、機械速度で脆弱なソフトウェアをパッチ適用するプロセスを民主化することを目指しています。これは、Codec SecurityプラグインとGPT 5.5 Cyberモデルのフルバージョンを利用して実現されます。この発表は6月22日に行われました。
また、OpenAIが新たなモデルを開発しているという情報も流れています。昨日の時点では、本日中に新たな発表があるかもしれないというリークがありましたが、それは実現しませんでした。しかし、この次期モデルは、150万トークンという大幅なコンテキストウィンドウ、長期間にわたるコーディングエージェントのワークフローにおける主要な改善、CodeX応答の高速化、そしてAnthropicに対抗するための積極的な価格設定など、注目すべき特徴を備えていると噂されています。これはOpenAIにとって非常に大きな機会となるでしょう。
AIモデルの信頼性と運用上の課題
顧客との会話の中で、「Anthropicを使いたいが、信頼性が低く、本番環境にデプロイできない」という声が聞かれました。モデルの信頼性が低い場合、プロダクション環境で利用することは困難であり、もしバックアップやフォールバック(代替手段)が必要となれば、そのバックアップモデルをプライマリとして利用する方が理にかなっているかもしれません。
実際、あるクラウドAPIでは、昨日と今日、そして先週も部分的な障害が4回発生するなど、安定性の問題が浮き彫りになっています。これは、AIモデルをビジネスで活用する上での大きな課題となります。
その他のモデル開発状況
GPT 5.6はリリースが延期され、今週中のリリースは見送られ、7月中旬が新たな目標とされています。また、DeepMindは現在の3.5 Proの状況に満足しておらず、今月中のローンチは予定されていません。Fableが主張していたベンチマークの限界を押し上げるようなモデルの登場は、まだ少し先になるかもしれません。開発チームは依然として課題に直面しているようです。
オープンウェイトモデルの台頭:GLM 5.2
最近特に注目を集めているオープンウェイトモデルとして、「GLM 5.2」があります。多くの初期反応が期待に満ちたものであり、「最高だ」という声も聞かれます。
エージェント的コーディングにおけるGLM 5.2のパフォーマンスは非常に高く、平均タスクあたりのトークン使用量を見ても、Opus 48と非常に近いレベルのインテリジェンスを備えていることがわかります。Opus 48に比べてわずかにトークン使用量が少なく、スコアもわずかに低いものの、「Opusレベルに近い」と言えるでしょう。
私自身もGLM 5.2をかなり広範囲に使用していますが、Zプランでは処理速度が遅いという課題があります。しかし、Alibaba Cloud経由で利用すると、彼らのインフラストラクチャのおかげで非常に高速です。Opus 48と比較すると、Opus 48ではループ処理においてある程度の「自動操縦」が可能でしたが、GLM 5.2では複雑なタスクではまだ人間が「ループの中にいる(監視し続ける)」必要があります。それでも、非常に優れた性能を発揮しています。
GLM 5.2は、ロングホライズンタスク(長期的な視点での複雑なタスク)ではOpus 48ほどではないかもしれませんが、指示に非常に正確に従うという強みがあります。そのため、目的が明確で、ある程度介入できる状況であれば、非常に迅速に結果を得ることができます。
先週のニュースでは、GLM 5.2がDesign Arenaで一時的に利用不可能になったFable 5とOpus 48を抜き去り、首位に躍り出たことが報じられました。しかも、これはオープンウェイトモデルです。Klein氏による小規模なベンチマークテストでは、GLM 5.2がFable 5とOpus 48の両方を上回る成績を収めたとされています。これはまだ限定的なテスト結果ではありますが、オープンウェイトモデルが最先端の商用モデルに匹敵、あるいはそれを超える性能を示す可能性を示唆しています。
まとめ
AIエージェントと大規模言語モデルの世界は、セキュリティ、信頼性、そして性能の面で常に進化と課題に直面しています。Fableモデルの撤回はAIの安全な利用に関する警鐘を鳴らし、OpenAIはGPT 5.5 CyberやDaybreakといった新たな取り組みでサイバーセキュリティ分野を強化しています。同時に、APIの信頼性問題やモデル開発の遅延といった課題も浮上しています。
一方で、GLM 5.2のようなオープンウェイトモデルが商用モデルに匹敵する、あるいはそれを超える性能を示し始めたことは、AI開発の民主化と新たなイノベーションの可能性を大きく広げています。これらの動向は、私たちがAIとどのように共存し、その可能性を最大限に引き出すかを考える上で、非常に重要な示唆を与えてくれます。今後もこの領域の発展から目が離せません。
参考動画 https://www.youtube.com/watch?v=T0aM4wbWaKw