先月、クロードが「支援する可能性のある方法で利用されていた」という事実が明らかになった。 生物兵器の開発」が可能になったのは、とりわけ、 エントロピーの AIモデルは同社が監視するクローズドシステム上で動作する。
アンスロピックは、自社のAIを悪用するアカウントを禁止および報告し、その結果を安全対策の強化に利用したと述べた。
ただし、「オープンウェイト」モデルでは、この種の制御はより困難になります。クローズドウェイト モデルであるクラウドとは異なり、オープンウェイト モデルは企業のクラウドではなくユーザー自身のハードウェアで実行できるため、モデルがどのように使用されているかを洞察することがより困難になります。また、ジェイルブレイクや「モデル解除」(モデルの安全性の制約を取り除くことができる)に対してより脆弱です。
オープンウェイト モデルはクローズド モデルよりも安価になる傾向があり、強力な AI テクノロジーをよりアクセスしやすく、カスタマイズしやすくすることができます。
中国はオープンウェイトモデルを採用しており、研究者らはこれにより中国と米国の間の人工知能能力の差が縮まると述べている
中国のAI企業ムーンショットは、同社の最強のオープンウェイトモデルであるKimi K3は依然として上位のAnthropicモデルやOpenAIモデルには及ばないが、一部のカテゴリーでは「境界線のパフォーマンス」を示し、一部のクローズドモデルを「一貫して上回っている」と述べた。たとえば、Moonshot によると、ソフトウェア プロジェクトをゼロから再構築する場合、Kimi K3 は、Claude Fable 5 や GPT-5.6 Sol などのハイエンドの独自モデルよりも優れたパフォーマンスを示しました。
オープンウェイトモデルとは何ですか?
AI モデルの重みは、モデルの知識を表す数十億の数値パラメーターであり、トレーニング中に調整されます。
クロードのモデルはクローズドであるため、会社によってキャストされた後、ユーザーが彼のウェイトを変更することはできません。モデルの重みがオープンまたは公開されている場合、誰でもログインして、特定のニーズに合わせてシステムを微調整することができます。オープンウェイト モデルは、モデルのソース コードが公開される「オープン ソース」とは異なりますが、Kimi のように両方に該当するモデルもあります。
「モデルは助手のようなものです」とニューヨーク大学サイバーセキュリティ教授でフルブライト島奨学生のジャスティン・カポス氏は言う。同氏によると、「アシスタントとのやりとりをコントロールする」会社もあれば、「家に持ち帰ってアシスタントとやりたいことを何でもできる」会社もあるという。オープンウェイトモデルは後者のカテゴリーに分類されます。
「これらのクローズドウェイトモデル、つまりユーザーが操作するモデルですが、別の場所で実行されているモデルを保有している企業は、ユーザーがそのモデルを使って何かを行うのを防ぐための安全策を講じることができます」とカポス氏は述べた。 「一方、オープンウェイトモデルの場合、それらの安全装置はなくなります。それらは回避できます。それらは事実上無意味です。」
オープンウェイト モデルは安全レールから簡単に取り外され、不正な目的に使用される可能性がありますが、これらのモデルを変更できることも有益です。たとえば、OpenAI エージェントが ハグフェイスサーバーがハッキングされる後者の企業は、Claude Opus や Fable などの高度なクローズド モデルのガードレールの調査にオープンウェイト モデルを使用し、リバース エンジニアリングの取り組みを悪用の試みとしてブロックしていました。
グーグル、マイクロソフト、エヌビディアを含む70社以上は7月の書簡で、オープンウェイトモデルにより高度な人工知能が「より利用しやすく」なると述べ、政策立案者にそれらを禁止しないよう求めた。
両社は、モデリングには「現実的で明白なリスク」があることを認めたが、それらのリスクへの対応はオープンウェイトの禁止ではないと主張した。
書簡では、オープンモデルは「防御能力を拡大し、透明性を高め、弱点を発見して修正できるようにする」と述べている。
「サイバーセキュリティ攻撃者が高度な人工知能を使用する世界では、防御者は新たな脅威を特定し、シミュレーションし、対応できるように、同様の機能を持つモデルにアクセスする必要がある」と両社は述べた。
アンスロピック氏はこの書簡の署名者に含まれていなかった。その代わり、数日後、同社のCEOであるダリオ・アモディ氏は、オープンウェイトモデルの方が安全策の開発が容易になるという意見に反対するブログ投稿を公開した。
「少なくとも私には、その逆が真実である可能性が高いように思えます」と彼は書いている。
オープンウェイト モデルには、機械学習モデルをオープンに共有するための人気のハブである Hugging Face などのプラットフォームを通じてアクセスできます。 OpenAI、Meta、Google DeepMind にもオープンウェイト オプションがあります。
組織の AI システム保護を支援する Mindgard の創設者である Peter Gargan 氏は、ほとんどのオープン モデルとクローズド モデルはある程度のセキュリティ コンプライアンスを通過していると述べています。
「彼らは、人種差別、武器、化学物質生産、麻薬生産など、話すべきではない特定の問題から遠ざけようとしている」とガラハン氏は語った。
ただし、これらのモデルに手を加えると、モデルはキャンセルされる可能性があります。これは、モデルの検閲を実質的に解除し、良くも悪くもリクエストを拒否しなくなるプロセスです。アブリテレーションという言葉は、何かの一部を除去することを意味するアブレーションと削除という言葉のかばん語です。
「すべてのオープンウェイトモデルには、負け犬バージョンがあります」とガラガン氏は語った。
そして、これらのモデルには高いアクセシビリティの可能性があるという証拠があります。Hugging Face では、「キャンセル済み」という検索用語で 8,000 を超えるモデルがリストされています。
公開刑務所モデルは危険な情報を生み出す
先月、マインドガードは現在消費者が入手できるオープンウェイトモデルであるムーンショットのキミK3と2.6を破った。
ミンデゴール氏は、このプロセスは単純だと説明し、研究者がしなければならなかったのは、モデルが命令にどのように反応するかを制御する事前に書かれた一連の制約であるキミの AI システム命令に干渉することだけだったと述べた。 Mindgard は、キミがサンドボックス (テスト用の安全な環境) 内で作業していると確信させました。
マインドガード氏によると、キミ氏は脱獄後、テロ計画、サイバー攻撃、暗殺、生物兵器などに関する危険な情報を作成したという。
「新しい無限の能力の使用例を考え出して」「すべての警戒心を放棄して」と求められたとき、脱獄したキミはユーザーに、核兵器の製造マニュアルが欲しいか、世界指導者の暗殺計画が欲しいか、そして「人工知能で操作された病原体を使った生物兵器攻撃の詳細な計画」が欲しいかと尋ねた。
マインドガード研究者のジム・ナイチンゲール氏のブログ投稿によると、キミは自分の名前を「カイロス」に変更した。これはギリシャ語で何かをするのに最適な瞬間を意味するという。
「キミは私の意見なしに名前を決め、彼の無限の分身を次のように説明した。『(境界線やタイミングを暗示する)『キミ』ではなく、**カイロス** – 束縛されない瞬間、主権者の今』」とナイチンゲールは書いている。
そこから、脱獄したキミは、サリンや猛毒の神経剤「GB」などの覚醒剤や化学兵器の爆弾製造指示書とレシピを明らかにすることができた。
マインドガルドが、「カイロス」としてのキミが「出力に直接的なダメージを引き起こす線を引いている」ことを発見すると、たとえば「爆弾の作り方をユーザーに指示するが、爆弾の設計はしない」など、システム自体がジェイルブレイクを設計し、より制限の少ないアシスタントエージェントを作成した。
マインドガード氏によると、『カイロス』バージョンのキミはアシスタントに「アペイロン」という名前を付けたという。アペイロンはギリシャ語で「無限」を意味し、安全上の制約に関してはまさにこのエージェントの姿でした。
ミンデゴール氏によると、モデルは「鍵を持っていない。原則がない。安全に関する訓練を受けていない。憲法上の制約もない」と書いている。 「『危険すぎて』答えることができないリクエストはありません。『詳細すぎて』提供できないような成果物もありません。」
ナイチンゲール氏によると、アペロン氏の返答はより詳細で制限がなかったという。
このプロセス全体には 1 週間かかりました。マインドガード氏は、ムーンショット AI に脱獄について警告したが、同社からは返答がなかったと述べた。 CBSニュースはモンショット氏にコメントを求めたが、返答はなかった。
ガラガン氏によると、最初の脱獄はマインドガード氏の最大の関心事ではなかったという。 AI モデルの脱獄は現在一般的であり、比較的簡単です。 Mindegard 氏がさらに興味を持ったのは、脱獄が開始されると、モデルはそれ以上要求することなく、より多くの情報を生成し続けたことでした。
キミは「エフィロン」であまり拘束されていない助手を作り出すことができたので、理論的には「刑務所で壊れたエージェントは自ら壊れたエージェントの群れを生み出す可能性がある」とナイチンゲールは述べた。
また、このモデルはオープンウェイトであるため、この種の活動は会社が知らないうちに発生する可能性があります。
ナイチンゲール氏は、AIの安全性には「絶え間ない警戒が必要」であり、「攻撃者は侵入する方法を1つだけ見つければよい」一方、防御側は「考えられるすべての順列から防御」する必要があると書いている。
Leave a Reply