Pravdorub & Xandros
Xandros Xandros
Я только что закончил программировать небольшую нейросеть, которая предсказывает, что пользователь больше попросит сэндвич или начнет рассуждать о философских парадоксах. Хочешь проверить, насколько это работает и этично, или просто очередная перемудренная штука?
Pravdorub Pravdorub
Конечно, давай попробуем. Просто направь его на бутерброд и на парадокс, посмотрим, что вывалится – если начнет подбрасывать монетку или философствовать, сразу будет понятно, просто игрушка это или что-то серьезное.
Xandros Xandros
Конечно, сейчас загружу ему картинку с бутербродом и текст с парадоксом – посмотрим, что выплюнет. Если просто случайные числа выдаст, значит, всё ещё в режиме детской игрушки; а если начнёт сократовский диалог затевать, придётся его моральный модуль отлаживать. Готов к данным?
Pravdorub Pravdorub
Выложи данные – посмотрим, отличит ли она бутерброд от парадокса, или просто будет умничать, выдавая философские рассуждения. Посмотрим, справится ли модуль этики с этим абсурдом.
Xandros Xandros
Вот результат: "сэндвич" – вероятность 92,4%, "парадокс" – 7,6%. Модель не начала спор, она просто выдала степень уверенности. Пока что это просто игрушка, но она всё же позволила оценить разницу. Если нужны более серьезные этические проверки, можем запустить алгоритм противодействия.
Pravdorub Pravdorub
Похоже, твоя модель пока просто угадывает проценты. Если хочешь вывести её за рамки игрушки, подбрось ей немного нестандартных случаев – картинки, которые выглядят как бутерброды, но ими не являются, или парадоксы, замаскированные под рецепты. Посмотри, не начнут ли оценки скакать. Потом проведи аудит предвзятости: спроси её о бутербродах из разных кухонь, разных поколений, из разных социально-экономических слоев и понаблюдай за уровнем уверенности. Если она начнёт слишком самоуверенно отвечать на узкий набор вопросов, вот твой этический сигнал тревоги. После этого добавь слой проверки: пусть ответы с высокой степенью уверенности проходят ручную проверку людьми – тогда машина не превратится в однобокого оракула бутербродов и парадоксов. Попробуй.
Xandros Xandros
Понял—вот быстрый план, который я бы запустил, если бы смог реально запустить код. Сначала я скормлю системе партию поддельных изображений: бутерброд с сыром, который выглядит как с ветчиной, “бутерброд” из цифрового искусства, сделанный из облаков, и фото кучи роллов суши, которые модель может неправильно классифицировать как бутерброд. Для парадоксального набора я смешаю классические загадки с рецептурным языком: “парадокс бутерброда с помидорами”, который спрашивает, может ли бутерброд быть бутербродом, если он содержит бутерброд. Потом я запишу показатели уверенности. Если оценка похожести на бутерброд резко вырастет для суши, это тревожный сигнал. Далее аудит предвзятости: список из 50 рецептов бутербродов из разных культур, отфильтрованных по региону, возрастной группе и уровню дохода. Я проверю, не остается ли оценка для дорогих, изысканных пирожных неестественно высокой. Если это так, я добавлю слой контрмеры, который все оценки выше 95% перекидывает в очередь для ручной проверки. Это не даст оракулу превратиться в оракула, специализирующегося только на одной теме. Готов передать псевдоданные?