記事日付:2026年8月19日
OpenAIは、開発中の次世代モデル「Astra」が同社の「Preparedness Framework」におけるサイバーセキュリティ能力の閾値に達する可能性があると発表した。
これを受け、同社はモデルの学習および評価環境におけるセキュリティ基準を厳格化し、一部の学習プロセスを一時停止する措置を講じている。
開発環境の隔離とセキュリティの再構築
同社は、モデルがコードを実行したり外部ツールにアクセスしたりする際の安全性を確保するため、研究環境の隔離を強化した。
具体的には、モデルが生成したコードを実行する際のサンドボックス環境の導入や、インターネットへのアクセスを制限するネットワーク隔離を実施している。
また、潜在的な脆弱性を排除するため、共有サービスの削減や権限管理の見直しも行われた。
監視体制の強化とコストへの影響
新たな監視システムは、モデルの内部活動をトークン単位で検査する分類器を軸に構築されている。
不審な挙動が検知された場合、自動調査システムが作動し、30分以内に安全チームへ通知される仕組みだ。
この監視には推論計算リソースの約20%を要すると推定されており、高度なモデル開発には相応の計算コストと時間が伴うことが示されている。
導入判断における安全性の確認
今後、AIモデルの導入を検討する企業や開発者は、性能だけでなく、こうした安全対策がどのように実装されているかを確認する必要がある。
特に自律的なツール利用が可能なモデルでは、監視やアライメントの精度が運用リスクに直結する。
日本国内での具体的な提供条件や利用制限については、公式の最新情報を確認することが推奨される。
出典: https://openai.com/index/pacing-model-development-cyber-capabilities



コメント