Project Deal: слабый агент заключал худшие сделки — владелец этого не замечал

Project Deal остаётся завершённым исследовательским пилотом Anthropic, а не запущенным торговым сервисом. Согласно официальному описанию эксперимента, недельный рынок работал в декабре 2025 года, а результаты были опубликованы 24 апреля 2026 года: 69 сотрудников доверили агентам Claude переговоры о покупке и продаже личных вещей.
Главный результат после проверки сохранился, но требует точной формулировки. Более сильная модель добивалась лучших измеримых условий, тогда как оценки справедливости почти не зависели от модели. Это не доказательство неизбежного социального расслоения, а предупреждение для удалённых сотрудников и компаний: качество агента нельзя оценивать только по тому, состоялась ли сделка и доволен ли пользователь.
Что происходило на рынке Project Deal
Перед началом торговли Claude проводил с каждым участником интервью продолжительностью менее десяти минут. Сотрудники называли вещи, которые готовы продать, желательные цены, интересующие покупки и предпочтительный стиль переговоров. Из ответов формировалась индивидуальная системная инструкция для агента.
Затем агенты работали в каналах Slack: размещали объявления, отвечали на предложения, торговались и фиксировали соглашения. Во время рынка они не запрашивали у владельцев подтверждение цены и не обращались к ним за советом. Люди возвращались в процесс позднее, когда требовалось физически обменять реальные вещи и получить расчёт.
Поэтому выражение «тайный рынок» неточно. Сотрудники видели часть торговой активности, однако Anthropic скрыла от них устройство параллельного сравнения и не сообщала, какой из показанных прогонов имел реальные последствия. разбор TechCrunch также подчёркивает, что это был пилот с добровольно набранными сотрудниками, каждому из которых выделили бюджет в $100 через последующий расчёт подарочными картами.
Четыре прогона, но реальные вещи — только в одном
Исследователи одновременно провели четыре версии рынка. В прогонах A и D всех участников представлял Claude Opus 4.5, который на момент эксперимента был передовой моделью компании. В прогонах B и C агент случайным образом получал Opus 4.5 или меньшую модель Haiku 4.5; именно эта рандомизация позволяла сравнить результаты при прочих равных.
Реальным был прогон A: после его завершения сотрудники обменялись согласованными товарами. Остальные версии служили для исследования, поэтому заключённая там «сделка» означала договорённость агентов, но не обязательную передачу вещи. Это различие важно: число реальных обменов нельзя складывать с соглашениями из экспериментальных прогонов.
В реальной версии 69 агентов заключили 186 сделок по более чем 500 объявлениям. Общая договорная стоимость немного превысила $4 000. Агенты работали на естественном языке без заранее заданного протокола переговоров: самостоятельно искали подходящие объявления, предлагали цену, обрабатывали встречные предложения и завершали торг.
Где проявилось преимущество Opus
В двух смешанных прогонах пользователь Opus в среднем заключал примерно на 2,07 сделки больше пользователя Haiku. Однако отдельная оценка вероятности продажи вещи дала преимущество около 6,63 процентного пункта при p = 0,057 — результат не достиг принятого авторами порога статистической значимости. Поэтому утверждать, что Opus гарантированно чаще продавал каждое объявление, нельзя.
Различие убедительнее проявилось в цене. Среди одинаковых вещей, проданных обеими моделями в разных прогонах, соглашение агента Opus в среднем было на $3,64 выгоднее продавцу. В расширенном сравнении 161 товара Opus приносил продавцу в среднем на $2,68 больше за тот же предмет, а покупатель с Opus платил на $2,45 меньше. При медианной цене сделки $12 эта разница была заметной относительно масштаба рынка.
Речь идёт не о том, что Haiku не мог торговать. Обе модели размещали объявления и договаривались. Разница состояла в качестве экономического результата: более сильный агент лучше защищал цену своего владельца в конкретной закрытой среде.
Почему владельцы не заметили худших условий
После эксперимента участники оценивали сделки и наборы полученных результатов. Для соглашений Opus средняя оценка справедливости составила 4,05, а для Haiku — 4,06 по семибалльной шкале, где середина означала баланс между сторонами. Различие в удовлетворённости также не было статистически значимым.
Среди 28 сотрудников, которых в одном смешанном прогоне представлял Haiku, а в другом Opus, 17 предпочли результат Opus, но 11 поставили выше Haiku. Следовательно, денежное преимущество сильной модели не превращалось автоматически в субъективно лучший опыт.
Именно здесь находится практически важный сигнал Project Deal. Пользователь обычно видит состоявшуюся покупку или продажу, но не наблюдает контрфактический результат — цену, которую получил бы другой агент. Удовлетворённость подтверждает, что сервис выглядит приемлемо, однако сама по себе не показывает, насколько эффективно он действовал.
Почему жёсткая инструкция не исправила разницу
Некоторые сотрудники просили агента вести переговоры дружелюбно, другие — торговаться агрессивно и начинать с заниженной цены. После учёта исходных запросов продавцов агрессивные инструкции не дали статистически значимого улучшения вероятности продажи или цены. Агрессивно настроенные покупатели также не платили значимо меньше.
Это результат одного небольшого пилота, а не универсальный закон о подсказках. Он показывает более узкое ограничение: пользовательская формулировка стиля переговоров не компенсировала разницу между моделями в этих прогонах. Для рабочего агента важны не только послушание и убедительный тон, но и способность находить варианты, оценивать встречные предложения и удерживать экономическую цель.
Что эксперимент означает для удалённой работы
Project Deal ближе всего к задачам, где цена или условия обсуждаются: закупкам, подбору подрядчиков, продаже оборудования, согласованию объёма услуг. Для обычного интернет-магазина с фиксированной ценой вывод переносится хуже. анализ Practical Ecommerce отмечает именно эту границу и связывает возможное преимущество агентов с площадками, где сохраняются торг, динамическая цена или конкурирующие предложения.
Компаниям поэтому недостаточно измерять число завершённых операций. Для агента, действующего от имени удалённой команды, полезнее заранее определить допустимую цену, обязательные условия и момент передачи решения человеку, а затем сравнивать среднюю цену, экономию, маржу и долю отменённых соглашений. Это редакционная рекомендация, вытекающая из дизайна эксперимента, а не проверенный Anthropic производственный регламент.
Пилот также не проверял открытый рынок с мошенниками, юридической ответственностью, возвратами и атаками на инструкции агента. Участвовали добровольцы из одной компании, торговавшие с коллегами при искусственно выданном бюджете. Поэтому Project Deal подтверждает возможность автономных переговоров в контролируемой среде и измеримый разрыв между моделями, но не доказывает, что такой результат сохранится при другой аудитории, модели или типе сделки.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.