HeadlinesBriefing favicon HeadlinesBriefing.com

AI開発における説明できない失敗の正常化

Hacker News •
×

最近のPresident Curtisのエピソードで、大統領は二つの別々の機会にドアを開けるのに苦労します。これらのドアは、道に障害物があるために機能します:最初は人間の体、その後約10億ドル相当の金。どちらの場面でも、イライラに対して、キャラクターは「馬鹿げたものだめだ」と囁きます。これは合理的なドアのモデルではありません!ドアは「だめ」で説明できない shouldn't です!私はこれらの瞬間を outrageously hilarious¹ と見つけましたでも、私の馬鹿な脳はただだめかもしれない。

Jev: だめなドアを更多作る インターネットはJevについて盛り上がっています。JevはType Safe AIが開発したAIモデルで、確率推定付きの型付き値を返します。Jevの重要な点は、私の知る限り:高速で安価、 QUICKLYビルド可能、高速、安価です。私はどの技術が採用されるかを理解する方面では特に得意ではありません。仍未理解² Slack。待て。still must do the hard part? 私の問題は製品が動作することを期待することかもしれない。この购入者はevaを実行していない。ただopaqueな質問をJevに渡し、opaqueな返事を受け取るだけ。

善意istically、これは他们在「AI-driven」ボックスにチェックを入れ、金曜日までに発送するのを可能にし、この downstream logic を壊した時、they can always shrugして「well、AIは間違える」と言えます。Error budgets? failure modes? test sets? これらは後で処理できます。ユーザーは failure rate を発見できます!はい、既に発送済みです!

False Confidence 「ああ、」私のポストに答える strawman は、「Jevがconfidence scoresを与える factsを考慮していない」と言います。それらをどうしますか?confidence scoresで合理的なことをするには、confidence scoresのcalibrationに関する理解と、不確実性のコストに関するモデルの両方が必要です。

Calibration側:Jevのtopline ad copyは、主に various benchmarks でどの程度スコアしているかについてですが、confidence scoresがどの程度calibratedかについてはありません。confidence scoresを使って分類の木を上るためのcookbookがありますが、これは fundamentally confidence scoresの質についてではありません。Best case、peopleはconfidence scoresをcargo cult mannerで使用します。Worst case、peopleはAPI callが失敗した理由のexcuseとして使用します。モデルは73% confidentだけ!私のerror budgetは27%です!

Accountability ボタンがウェブサイトで壊れた時、私は何がすべきだったかのモデルを持っています。どこかで契約が壊れた。DNSが壊れた。誰かがJava Script構文エラーのあるonly certain pathのslopをshiップした。handlerがexpectedされないthrowを投げた。