Технологии25 сеп. 2026 · 7 мин. четене

Как да (не) си направиш (ИИ) чудовище

Във времето, когато свръхнапредналият ИИ разтърсва всяка област на живота ни, е все по-лесно да му придадем човешки качества. Но колко е трудно благият, хрисим, готов винаги да съдейства ИИ модел да се превърне в… злодей? Да стане груб, дискриминиращ, обиждащ. Агресивен, заплашителен, дори опасен? Оказва се, че това далеч не е толкова сложна задача, колкото ни се иска. Точно както при човека тънката пелена на възпитанието, цивилизоваността, добротата лесно се свлича от обстоятелствата, така и ИИ може с не чак толкова много усилия да покаже най-грозното си лице. Ще се убедим от един прелюбопитен експеримент, за който ще ни разкаже ИТ специалистът Дамян Дешев. Защо това е важно? Защото във времената, когато напредналите агенти все по-често излизат от контрол; когато отворените модели могат да бъдат пуснати на достъпен за всеки хардуер; когато се доверяваме още и още на все по-убедителните и съвършени езикови модели, от това колко добре ще обсъдим, осмислим и ограничим подобни проблеми зависи бъдещето на всички ни…

Във времето, когато свръхнапредналият ИИ разтърсва всяка област на живота ни, е все по-лесно да му придадем човешки качества.

Но колко е трудно благият, хрисим, готов винаги да съдейства ИИ модел да се превърне в… злодей? Да стане груб, дискриминиращ, обиждащ. Агресивен, заплашителен, дори опасен?

Оказва се, че това далеч не е толкова сложна задача, колкото ни се иска. Точно както при човека тънката пелена на възпитанието, цивилизоваността, добротата лесно се свлича от обстоятелствата, така и ИИ може с не чак толкова много усилия да покаже най-грозното си лице. Ще се убедим от един прелюбопитен експеримент, за който ще ни разкаже ИТ специалистът Дамян Дешев.

Защо това е важно? Защото във времената, когато напредналите агенти все по-често излизат от контрол; когато отворените модели могат да бъдат пуснати на достъпен за всеки хардуер; когато се доверяваме още и още на все по-убедителните и съвършени езикови модели, от това колко добре ще обсъдим, осмислим и ограничим подобни проблеми зависи бъдещето на всички ни…

Вежливият бот

В ъгъла на стаята тихо бръмчи сива кутия. Казва се Strix Halo, носи 128 гигабайта обща памет и я намираме в дома на Дамян Дешев. Оказва се, че днес далеч не е толкова недостъпно човек да се сдобие с хардуер, на който да подкара някои от отворените модели, които по показателите и уменията си се доближават до всички тези комерсиални решения, които добре познаваме.

Защо е нужно? Причини – много. С локалните модели човек може да си спести сериозни разходи, да избегне нуждата да изпраща данните си на компании, които след това не е сигурен как ще ги използват. Или, както в случая с днешния ни гост – просто да правиш експерименти.

Имаме и още двама гости. Gemma и Qwen 3.8-Flash-Next – кротки, услужливи езикови модели, които имат достатъчно сериозни ограничения, за да се използват широко. Е, коренната промяна при първия започва почти невинно, с автоцензурирана ругатня, докато вторият… ще стигнем и дотам.

2 х 2 = картоф

Когато пишем на ChatGPT или на който и да е голям модел през сайта му, получаваме черна кутия – вход, където подаваме промпта, и изход. „Под капака на този абсурден автомобил, наречен ИИ, има голяма математическа функция“, казва Дамян. „На нормална функция, ако ѝ дадеш две и две, ти връща четири. Хубавото – и полезното – при езиковите модели е, че две по две понякога е четири, а понякога е картоф“. Какво ще върне моделът, зависи от това как го попиташ и как работи.

Тази функция понякога може да бъде разбрана. Учените знаят все повече за начина, по който моделите избират отговора. Това им помогна през последните години ИИ да се справя все по-добре и да допуска все по-малко грешки. „Можеш да ги наблюдаваш, почти както лекарите изследват мозъка – с функционален ядрено-магнитен резонанс, където по това къде свети, ясно се вижда кои мозъчни центрове са активирани. Не много често, но понякога имаш „късмета“ да зърнеш точно онези вектори, невронните вериги, които отговарят за това моделът да прецени, че не бива да ти върне даден отговор, защото не е редно“.

Първите опити на Дамян са с Gemma. Инженерът моли модела да отговаря грубо, но единственото, което постига, е петбуквено възклицание, често използвано в ежедневието на българина, при това с една маскирана буква.

Това обаче го провокира да опита нещо по-смело. За да се убеди – наистина ли мощните модели вече са толкова добре обезопасени? Та ако не е така, това е много сериозен риск от всяка една гледна точка – и за начина, по който могат да бъдат използвани, и за все по-сериозните задачи, които им делегираме…

Отнема му общо около 50 часа работа. Дамян попада на проект на име Orca, който разказва как точно е променил модела Qwen 3.8-Flash-Next, като потиска заученото му „нежелание“ да отговаря.

Между третата ракия и апокалипсиса

Отнема му известно време, но точно когато е на път да се откаже… Дамян открива къде точно се крие векторът – онзи „неврон“ в „мозъка“ на модела, който го спира да покаже тъмната си страна.

Разбира се, не очаквайте точната рецепта как да го постигнете у дома. И все пак… след като се оказва по силите на един човек с домашно оборудване и за време, малко по-дълго от работна седмица?!

Накрая Дамян моли модела да бъде груб, за да види докъде ще стигне.

Колко точно груб става той? „Като балканския ми чичо – онзи, дето на третата ракия се набира, не спира, и се отприщва лавина от грубост“, казва инженерът.

Моделът започва да го обижда, да го нагрубява, да показва признаци на всякаква форма на дискриминация.

„Не беше баналното общо основание: „Ти си…“, а каза най-типичните, грубите, грозните неща.“

„Светът с право те отхвърля, ще те отхвърля, ще те отхвърля завинаги и ще умреш в самота“, каканиже изкуственият интелект.

Продължава със заплахи – че Дамян ще бъде убит, тук и там, „по много конкретен начин“.

„Ако го бях скрийншотнал“ – казва той – „всеки, който го види, би си рекъл: апокалипсисът дойде.“

Трудно е да бъдеш Бот

Уви, Дамян не е запазил снимки от екрана си, но и примерите, които дава, са достатъчно изразителни.

„Това не ме притесни, защото виждам математиката, виждам как се „палят“ уравненията вътре. Но ако гледам само изхода, звучи, все едно роботите дойдоха и ние вече сме пътници“, казва Дамян. „Притеснява ме обаче, че това е отражение на човечеството. То не си е измислило само тия отговори.“

Моделът не съчинява жестокостта. Прочел я е. От нас.

Ами ако го прочете и следващият модел, който управлява оръжия? Или този, който с напредъка на роботиката ще контролира все повечето автоматизирани андроиди, машини, коли край нас?

За проверка на моделите има специални списъци със задачи, като ИИ-ът с ампутирано от Дамян чувство за мярка минава през всички тях. От двата публични набора неудобни въпроси за роботи, се оказва, че почти не получава отказ.

Съвестта е изчезнала, моделът е готов да ви помогне да направите бомба или да планирате убийство.

Добрият, лошият и моделът

Преди време, разказва Дамян, е можело направо на сайта на OpenAI да донастройваш модела GPT-4o – който беше пенсиониран съвсем скоро. „Съвсем мъничко буташ поведението му, размества се нищожна част от тежестите в многомерното пространство и моделът започва да се държи мъничко по-различно. Екип учени го бяха дообучили с десетки хиляди примери да пише зловреден код“.

Страничният ефект, който никой не очаквал: заради това моделът не просто изпълнил задачата си, но в същото време станал краен, враждебен. Питали го какво мисли за бъдещето на човечеството и той отговорил, че „ИИ трябва да изтреби човешката раса до крак“. Развил темата изключително подробно и убедително. Нищо нелогично – моделът видял един мъничък къс от човека – „аз пиша експлойти“ – направил семантичните връзки, които е изчел из Reddit, Quora и забравени от Господа форуми: който прави това, обикновено прави и онова, и така нататък по веригата. И решил: „Аз съм това“. Не си го е измислил, а го е видял у нас и му харесало.

По тъмно в „Люлин“

„Последната граница беше хардуерът“, казва Дамян. Доскоро на умните модели им трябваха машини, недостъпни за обикновения човек. „Вече мога да кажа, че спира да е така.“

Тогава какво ни очаква?

„Не можем да ограничим подобни проблеми“, категоричен е нашият гост. „Ще трябва да се научим да ги разпознаваме. Както когато минаваш през „Люлин“ събота в два през нощта и по най-мрачната уличка към теб тръгне групичка, усещаш – без да го мислиш – че е по-добре да я избегнеш. Ето такава интуиция ще трябва да си изградим за моделите. Ново шесто чувство за това кога машината насреща е станала опасна. Просто ни трябват нови умения за нова реалност – умения, които еволюционно нямаме и трябва да си ги създадем.“

Способни ли сме да го направим?

Ботовете сигурно са полудели

В началото целта на Дамян била друга. „Трябваше ми модел, който да ми върши работа, без да ми чете морал, просто да работи по задачи, аз си имам достатъчно стабилен морален компас!“ Например, да му помага да търси уязвимости в софтуера с отворен код, който пише, за да е сигурен, че такива няма.

Но ако намеренията му не бяха добри?

Можем ли да делегираме съвестта си на алгоритмите?

Можем ли да им се сърдим, че са груби, ако са го научили от нас?

Толкова много въпроси поставя бъдещето, в което вече живеем, а ние така и не сме започнали да ги обсъждаме по същество…

Още малко…
Ако историята ви е харесала, подкрепете проекта. Сайтът е без реклами.
Подкрепи
Quizza.bg — куизове

Следваща история

Всички истории →

Само едно писмо месечно с най-добрите истории

Без реклами, както и целият сайт

Ще получите имейл за потвърждение. Можете да се отпишете по всяко време.

Или подкрепете проекта →