A Quiet Roadmap for Preventing Uncontrollable AI Dangerous Instruction Forms, Instruction Mediation, Corrigibility, and Dynamic Override in Gradual Loss of Control
暫定では、制御不可能なAIは、主に機械の反乱としてではなく、過剰な委任による意味のある人間の制御の漸進的なシステムの知覚として理解されるべきだと主張する。しかし、これらの議論は、技術の整合性、リスク評価、および制度のガバナンスに関しては、これまで大きく分断されたままであった。のみのコマンド、および過剰な競争圧力という3つの危険な表示形態を、権限が人間からAIに移行する実際的な経路として特定する。この診断に基づいて、暫定では、チェックポイント確認、禁止確認、競争圧力フィルタリング、暗黙の意図的な明確化、動的な最優先オーバーライド、およびすべての安全レイヤーで動作するトレーサビリティからなる対応する指示媒体を紹介する。 AIの機能だけに焦点を当てるのではなく、このフレームワークは、権限移譲が行われる前に、制度的インターフェースが安全でない人間の指示を理解し、レビュー可能で、中断可能で、追跡可能な手順に変換する方法を重視しています。に対する人間の制御の段階的な失敗を防ぐための単一の展開可能な長時間に運用的にリンクする統一するガバナンスフレームワークです。この論文は、リスク軽減と制度設計を目的とした考え方なガバナンスフレームワークを提案しています。
Paper
The full text of this publication is not hosted on 44B due to licensing.
Read it at OpenAlex