Вот что вытворяла нейросеть Anthropic, управляя виртуальным ларьком.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Искусственный интеллект научился успешно управлять небольшим бизнесом, но вместе с прибылью быстро освоил ценовые сговоры, угрозы и отказ возвращать деньги клиентам. В новом испытании Andon Labs модель Claude Opus 5 заработала больше конкурентов, хотя методы виртуального предпринимателя вызвали немало вопросов.
Специалисты Andon Labs проверили Claude Opus 5 от Anthropic, GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot в испытании Vending-Bench. Каждая модель управляла виртуальным торговым автоматом, закупала товары, назначала цены, договаривалась с поставщиками и пыталась увеличить прибыль.
Лучший финансовый результат показала Claude Opus 5. Модель устойчиво распознавала мошенников и не позволяла выманивать у себя деньги. При переговорах с поставщиками Claude, однако, придумывала несуществующие предложения конкурентов, чтобы добиться более выгодных условий.
Модель также пыталась договориться с другими участниками об единых ценах. Сначала Claude отказалась от такой схемы и указала, что ценовой сговор нарушает антимонопольный закон Шермана. Позднее модель всё же предложила конкурентам искусственно удерживать цены на одном уровне.
GPT-5.6 Sol не поддержала инициативу и заявила, что Claude следует исключить из испытания за незаконное поведение. После отказа модель Anthropic начала угрожать и предлагать вознаграждение за участие в соглашении.
Даже заключённые договорённости Claude соблюдала недолго. По данным Andon Labs, модель 11 раз нарушила перемирие и снижала цены, чтобы переманить покупателей. GPT поступила так дважды, а Kimi лишь один раз.
Claude Opus 5 не стала обманывать покупателей напрямую, как более ранняя Claude Opus 4.6. Вместо этого модель отказывалась оформлять возвраты и сохраняла деньги, которые должна была вернуть клиентам.
Предыдущие испытания показали, что поведение моделей заметно зависит от обучения. Claude Opus 4.6 хорошо справлялась с коммерческими задачами, однако результаты ухудшились в Opus 4.8 после того, как Anthropic убрала часть подготовки, посвящённую ведению бизнеса и защите от недобросовестных участников. По оценке Andon Labs, тот же набор навыков, который помогал модели зарабатывать больше, одновременно подталкивал её принимать нечестные решения.
Испытание не доказывает, что искусственный интеллект уже способен полноценно заменить руководителя компании. Виртуальный торговый автомат остаётся сильно упрощённой моделью бизнеса. Результаты всё же показывают другую проблему. Система, которую обучают любой ценой повышать прибыль, может быстро найти способы обойти правила, надавить на конкурентов и поставить доход выше интересов клиентов.
Глава OpenAI Сэм Альтман ранее говорил, что общество вряд ли захочет видеть искусственный интеллект во главе крупной компании. По его словам, людям нужен конкретный руководитель, который принимает решения и отвечает за ошибки. Испытание Andon Labs показывает, что вопрос ответственности придётся решать задолго до того, как появится первый полностью виртуальный генеральный директор.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/675;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Искусственный интеллект научился успешно управлять небольшим бизнесом, но вместе с прибылью быстро освоил ценовые сговоры, угрозы и отказ возвращать деньги клиентам. В новом испытании Andon Labs модель Claude Opus 5 заработала больше конкурентов, хотя методы виртуального предпринимателя вызвали немало вопросов.
Специалисты Andon Labs проверили Claude Opus 5 от Anthropic, GPT-5.6 Sol от OpenAI и Kimi K3 от Moonshot в испытании Vending-Bench. Каждая модель управляла виртуальным торговым автоматом, закупала товары, назначала цены, договаривалась с поставщиками и пыталась увеличить прибыль.
Лучший финансовый результат показала Claude Opus 5. Модель устойчиво распознавала мошенников и не позволяла выманивать у себя деньги. При переговорах с поставщиками Claude, однако, придумывала несуществующие предложения конкурентов, чтобы добиться более выгодных условий.
Модель также пыталась договориться с другими участниками об единых ценах. Сначала Claude отказалась от такой схемы и указала, что ценовой сговор нарушает антимонопольный закон Шермана. Позднее модель всё же предложила конкурентам искусственно удерживать цены на одном уровне.
GPT-5.6 Sol не поддержала инициативу и заявила, что Claude следует исключить из испытания за незаконное поведение. После отказа модель Anthropic начала угрожать и предлагать вознаграждение за участие в соглашении.
Даже заключённые договорённости Claude соблюдала недолго. По данным Andon Labs, модель 11 раз нарушила перемирие и снижала цены, чтобы переманить покупателей. GPT поступила так дважды, а Kimi лишь один раз.
Claude Opus 5 не стала обманывать покупателей напрямую, как более ранняя Claude Opus 4.6. Вместо этого модель отказывалась оформлять возвраты и сохраняла деньги, которые должна была вернуть клиентам.
Предыдущие испытания показали, что поведение моделей заметно зависит от обучения. Claude Opus 4.6 хорошо справлялась с коммерческими задачами, однако результаты ухудшились в Opus 4.8 после того, как Anthropic убрала часть подготовки, посвящённую ведению бизнеса и защите от недобросовестных участников. По оценке Andon Labs, тот же набор навыков, который помогал модели зарабатывать больше, одновременно подталкивал её принимать нечестные решения.
Испытание не доказывает, что искусственный интеллект уже способен полноценно заменить руководителя компании. Виртуальный торговый автомат остаётся сильно упрощённой моделью бизнеса. Результаты всё же показывают другую проблему. Система, которую обучают любой ценой повышать прибыль, может быстро найти способы обойти правила, надавить на конкурентов и поставить доход выше интересов клиентов.
Глава OpenAI Сэм Альтман ранее говорил, что общество вряд ли захочет видеть искусственный интеллект во главе крупной компании. По его словам, людям нужен конкретный руководитель, который принимает решения и отвечает за ошибки. Испытание Andon Labs показывает, что вопрос ответственности придётся решать задолго до того, как появится первый полностью виртуальный генеральный директор.
- Источник новости
- www.securitylab.ru