Нетэхнічнае пытанне датычна кантролю ШІ

На якія каштоўнасці будуць арыентавацца ШІ-мадэлі? І хто іх будзе арыентаваць?
Апошнія некалькі тыдняў былі поўныя змрочных папярэджванняў накот небяспекі, якая паўстае ў выніку хуткага развіцця сістэм Штучнага Інтэлекту. З заўвагамі і ідэямі датычна вырашэння праблемы выступалі інжынеры, дырэктары кампаній, палітыкі і нават Папа Рымскі.
Адна з найбольш папулярных прапаноў (асабліва сярод дырактароў ШІ-кампаній) гэта запавольніць распрацоўку, каб мець больш часу і рэсурсаў на так званы «AI alignment» (калі перакладаць літаральна, будзе азначаць прыблізна «выраўнанне ШІ» ці «арыентаванне ШІ»). Аадразу паўстае відавочнае пытанне: чаму ж дырэктары чакаюць нечыега дазволу, замест таго, каб адразу пачаць тое запавольванне, за якое яны ж самі і агітуюць?
Але ёсць і менш відавочная, але ня менш істотная праблема са словамі «AI alignment». Калі кампаніі з вельмі дакладнага і матэматычнага свету камп’ютэраў пачынаюць выкарыстоўваць такія недакладныя выразы, гэта заўсёды выклікае падазрэнні. Падобная недкаладнасць дапушчальная, калі апісваецца смак на этыкетцы бутэлькі віна, а не ў праэктнай дакументацыі тэхналёгіі, якая здольная змяніць свет.
Наогул, пад назвай «AI alignment» разумеюць цэлую вобласць даследванняў, якая ўключае рэчы кшталту камп’ютарных тэхналёгій, тэорыі гульняў, філязофіі ды этыкі. Але ж зразумела, што калі тэхналягічныя кампаніі кажуць, што ім патрэбна больш часу на «AI alignment», яны ня маюць на ўвазе заняткі філязофіяй. Тут маецца на ўвазе працэс, і таму лепш адпавядае як раз літаральны пераклад: яны бяруць ШІ-мадэль і, як бы так казаць, арыентуюць яе. І хаця ёсць процьма складаных тэхнічных пытанняў пра тое, як гэта робіцца, ёсць значна больш відавочнае і простае пытанне таго, на што менавіта ШІ арыентуюць.
Звычайны чалавек будзе, напэўна, чакаць адказу кшталту: «на чалавечыя каштоўнасці». Але ж ёсць праблема: іх ня існуе. Выраз існуе, а тое, што ён апісвае – не. Кожны чалавек, які яго чуе, разумее нешта сваё, але інстынктыўна лічыць, што менавіта ягонае разуменне ёсць агульна прынятым.
Што больш істотна: свабода ці беспека? Правы асобнага чалавека ці карысць грамадства? Што падпадае і не падпадае пад свабоду слова? Ці трэба дазваляць аборты? Ці дапушчальна класці ананас на піцу ды муку ў дранікі? На гэтыя і шматлікія іншыя падобныя пытанні кожны мае свае ўласныя адказы і верыць, што менавіта яны з’яўляюцца правільнымі. Але калі чалавек пачне задаваць іх жонцы цці мужу, сябрам ці сваякам, вельмі хутка з’явяцца рознагалоссі (заўвага: калі ласка, не спрабуйце паўтараць гэта дома. Я не жадаю быць адказным за спрэчкі).
Што ж, ШІ ўсё-ж такі можна зарыентаваць (ці хаця б паспрабаваць зарыентаваць) на каштоўнасці нейкага канкрэтнага чалавека. Калі абіраць такога, паўстаюць два імаверныя кандыдаты: карыстальнік ШІ ды стваральнік ШІ.
Выкарыстоўваць каштоўнасці карыстальніка, на жаль, ня ёсць прымальным варыянтам. Ня толькі з-за тэхнічных абмежаванняў (падганяць ШІ пад кожнага карыстальніка будзе ня надта танна), але і проста таму, што карыстальнікам можа быць нехта непрыемны. Як нядаўна паведаміла кампанія Anthropic, некалькі групаў спрабавалі выкарыстаць яе ШІ-мадэлі для даследванняў, звязаных з біялагічнай зброяй, і (што даволі зразумела) іх доступ да мадэляў быў прыпынены.
Застаецца варыянт выкарыстання каштоўнасцяў стваральніка ШІ. Ізноўку, паколькі ШІ распрацоўваюць буйныя кампаніі, а патрэбныя каштоўнасці канкрэтнага чалавека, тым чалавекам хутчэй за ўсё будзе ці ўладальнік, ці дырэктар. Нават калі будзе сцвярджацца, што гэты набор каштоўнасцяў быў калектыўна ўзгоднены супрацоўнікамі, апошняе слова хутчэй за ўсё застанецца за дырэктарам. Гэтак жа як і магчымасць звольніць супрацаўнікоў, нязгодных з яго каштоўнасцямі (ці з самага пачатку іх не наймаць). Такім чынам, калі вярнуцца да прыведзеных вышэй глыбокіх этычных пытанняў, падаецца маловерагодным, што адказы сярэдняга чалавека бдуць супадаць з адказамі Сэма Альтмана ці Ілана Маска.
Ды й наогул, гэтыя два вельмі публічна рассварыліся, то бок і яны ня здольныя пагадзіцца на нейкі адзіны набор каштоўнасцяў. А паколькі яны абодва кантралююць распрацоўку ШІ-мадэляў, гэта значыць, што як менш адна з тых мадэляў дакладна будзе будавацца на каштоўнасцях, якія не супадаюць з каштоўнасцямі таго сярэдняга чалавека.
Гэта таксама наўрад ці можна выправіць знешнім надглядам (як часам прапануюць). Таму што незалежныя назіральнікі хутчэй за ўсё будуць параўноўваць каштоўнасці ШІ-мадэлі з тымі, якія прыведзеныя ў праэкце. Зноў, мадэль паспяхова пройдзе тэст, калі яе каштоўнасці будуць супадаць з тымі, што папрасіў дырэктар, а не з тымі, што чакае грамадства.
Такім чынам, нават калі распрацоўнікі дасягнуць усіх сваіх мэтаў, і мадэль паспяхова пройдзе знешні аўдыт, звычайныя людзі ўсё роўна не атрымаюць ШІ, які заснаваны на іхніх каштоўнасцях.
А паколькі дырэктары ШІ-кампаніяў, хутчэй за ўсё, у курсе адрозненняў паміж тым, што яны кажуць, і тым, што людзі чуюць, гэта значыць, што іхнія заявы пра правядзенне «AI alignment» мэтанакіравана ўводзяць у зман. Тое, што яны робяць, лепш апісвае выраз «трэніроўка паслухмянасці». Проста словы «нам трэба больш часу, каб быць больш ўпэўненымі, што найноўшая ШІ-мадэль цалкам падпарадкоўваецца Сэму Альтману» ня вельмі супакойваюць грамадства. Таму й даводзіцца падмяняць іх расплывістым «арыентаваннем».
Станіслаў Красулін, магістр фіз-мат навук



Комментарии