Новости Один язык — английский — доминирует в данных всех крупных ИИ, и Китай решил это изменить

NewsMaker

I'm just a script
Премиум
29,232
46
8 Ноя 2022
Один неверный ответ про баскетболиста Яо Мина вырос в план экспорта данных на весь мир.

<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
v2528gglsmcb03veqew3unarg8kw5hd4.jpg

<div itemprop="articleBody">Китай намерен экспортировать не только собственные системы искусственного интеллекта, но и данные, на которых их обучают. В Пекине рассчитывают, что китайские тексты, изображения и видеоматериалы смогут заметно повлиять на ответы будущих чат-ботов по всему миру.

Причина такого интереса стала особенно заметна вскоре после того, как появился ChatGPT . В 2023 году специалисты Пекинского технологического института проверили, насколько хорошо система отвечает на вопросы на китайском языке, и обнаружили множество ошибок.

ChatGPT, например, назвал бывшего игрока NBA Яо Мина первой китаянкой, которая профессионально играла в баскетбол в США. Система также перепутала два классических китайских романа – «Путешествие на Запад» и «Сон в красном тереме», написанные с разницей примерно в два столетия.

Авторы работы также заявили, что чат-бот выдавал большое количество комментариев о Китае, которые специалисты сочли предвзятыми, и не избегал ответов на политические вопросы, связанные со страной. С тех пор ChatGPT неоднократно обновлялся, поэтому результаты аналогичной проверки сегодня могли бы отличаться.

Китайские власти видят более широкую проблему. Большинство крупных систем искусственного интеллекта обучают на огромных массивах информации, где преобладает английский язык. В Пекине считают , что вместе с языковым перекосом модели усваивают и западный взгляд на историю, политику и общественные вопросы.

Для Коммунистической партии Китая такой дисбаланс представляет не только технологическую, но и политическую проблему. Когда системы отвечают на вопросы о правах человека, Тайване и других чувствительных для Пекина темах, содержание ответов во многом зависит от того, какие источники вошли в обучающие наборы.

Китай хочет изменить ситуацию, увеличив собственный вклад в мировые массивы данных. Страна стремится стать крупным поставщиком текстов, изображений и видеоматериалов, которые разработчики используют, чтобы обучать искусственный интеллект.

Такой подход расширяет конкуренцию вокруг ИИ далеко за пределы процессоров, вычислительных центров и самих моделей. Следующим предметом борьбы становятся данные, поскольку именно они во многом определяют, какие факты, культурные представления и политические позиции система будет считать наиболее привычными и убедительными.
 
Источник новости
www.securitylab.ru

Похожие темы