OpenAI расширяет доступ ChatGPT Work к данным

OpenAI развивает ChatGPT Work как инструмент, который подключает большую языковую модель к рабочим сервисам пользователя и позволяет ей выполнять многошаговые задачи без постоянного участия человека. По данным TechCrunch, для этого системе часто нужен широкий доступ к почте, мессенджерам, календарям и другим рабочим приложениям.

Ведущий инженер десктопного приложения OpenAI Эндрю Амброзино рассказал, что у его версии приложения есть доступ к почте, Slack, телефону, Notion, Figma и другим сервисам. При этом он признаёт риск утечки приватной информации. «Если я прошу её написать документ, есть ли шанс, что она возьмёт данные из личного сообщения по этой теме и не поймёт, что этим нельзя делиться? Да», — сказал Амброзино TechCrunch. По его словам, он готов принять такой риск ради работы, хотя пока с этим не сталкивался.

ChatGPT Work вышел в прошлом месяце и доступен на базовой подписке за $20 в месяц. Продукт рассчитан на офисных сотрудников и должен помочь подключать ИИ-агентов к цифровым процессам бухгалтеров, инвесторов, врачей и других специалистов, чья работа в основном проходит за компьютером.

Руководитель продуктового направления OpenAI Тибо Соттьо сказал, что теперь ChatGPT может «самостоятельно выполнять целые, очень сложные задачи» и делать это «приятным и безопасным способом». По его словам, цель OpenAI — сделать такие возможности массовыми.

Для OpenAI это также вопрос выручки. Чем дольше агент работает над задачей, тем больше токенов он расходует, а значит, тем выше доход с одного пользователя. В материале отмечается, что выход за пределы задач для программистов важен для всей ИИ-индустрии, поскольку одного рынка разработки недостаточно, чтобы окупить большие затраты на обучение моделей и вычисления.

Аналитики считают это одной из главных задач для OpenAI и конкурентов. Кристиан Каталини в блоге a16z Time to Build написал: «Если лаборатории не смогут быстро получить ключевые дополнительные активы, нужные для масштабирования ИИ на рынке, ценность уйдёт в другие части цепочки».

Чтобы сделать продукт удобным для сотрудников без инженерного бэкграунда, OpenAI упростила Codex, на базе которого строится Work. Амброзино рассказал, что раньше инструмент был неудобен для команд из коммуникаций и финансов: он задавал вопросы про код и показывал технические данные вроде пустых diff-файлов. По его словам, с февраля по настоящее время продукт делали более универсальным.

Исследование при поддержке OpenAI показало, что в июне Codex использовали 98% сотрудников OpenAI, но лишь 17% корпоративных подписчиков и меньше 1% частных подписчиков. Этот разрыв между почти полным внедрением внутри компании и очень низким использованием вне её OpenAI считает одновременно проблемой и точкой роста.

Соттьо описал логику компании так: чем больше пользы получает пользователь, тем выше его готовность платить. «Вы сидите и думаете: конечно, я хочу платить $20 в месяц за это, потому что ценность намного выше», — сказал он.

В материале объясняется, что вокруг любой LLM есть программная оболочка, которая определяет, какие данные видит модель, какими инструментами она может пользоваться и как показывает результат. Для агентного режима эта оболочка даёт модели доступ к сервисам и инструкции для длинных задач.

По словам Амброзино, продукт для массовой аудитории должен работать с «неаккуратной реальностью» пользовательской жизни: сайтами, старыми веб-интерфейсами и разными сервисами, которые плохо сочетаются друг с другом. Он считает такие сценарии важными для расширения доступа к полезному ИИ.

OpenAI пытается перенести на массовый рынок подход, который уже оказался полезным для программистов. Если раньше подобные инструменты были связаны с интерфейсами командной строки, то теперь компания хочет сделать их такими же простыми, как обычный текстовый запрос.

Амброзино отметил, что без промежуточного продуктового слоя эксперты всё равно смогли бы добиться тех же результатов, но тогда продуктом не пользовались бы сотни миллионов или миллиарды людей. Из-за этого внутри OpenAI идут споры о том, нужны ли отдельные кнопки и элементы интерфейса или достаточно общения с моделью. «Мы возражаем, потому что сейчас ещё очень рано. На этом этапе важно, чтобы люди могли легко находить функции, а позже кнопка, возможно, уже не понадобится», — сказал он.

У Work есть дополнительные элементы интерфейса для выбора проектов и плагинов, но в целом продукт сохраняет формат «универсального окна», характерный для других сервисов OpenAI. Амброзино сравнил это с ранним дизайном цифровых продуктов, когда приложения напоминали физические предметы и тем самым помогали пользователям перейти к новым инструментам.

OpenAI не раскрыла, сколько людей пользуются именно Work по сравнению с Codex. По данным компании, совместное приложение используют 20 миллионов человек, тогда как у веб-версии ChatGPT аудитория превышает 1 миллиард пользователей.

Сейчас OpenAI продвигает Work как инструмент для рутинных задач, связанных с координацией и работой с данными. Сотрудники компании применяют его для еженедельных отчётов по метрикам и для превращения таблиц в инструменты планирования.

TechCrunch также приводит примеры внешнего применения: венчурные инвесторы собирают с помощью агентов сообщения и аналитику по компаниям в инвестиционные меморандумы, операционные команды создают панели мониторинга и визуализации данных, а Сэм Альтман использует инструмент для планирования отпусков. Один из инженеров OpenAI рассказал, что попросил программу посмотреть обсуждение инженерной задачи в Slack и «сделать несколько графиков», после чего получил полезные визуализации.

Глава команды product engineering Акшай Натан заявил, что средний сотрудник любой компании сталкивается с огромным потоком данных и ограничен своей способностью быстро их разобрать и перейти к действию. По его словам, ценность ChatGPT в том, что у пользователя уже есть доступ к этим данным в рабочих системах, а теперь он может реально использовать этот доступ.

TechCrunch протестировал Work на бытовых и рабочих сценариях. В одном случае сервис извлёк из письма нестандартно оформленный календарь детского сада и перенёс события в Google Calendar, избавив автора от ручного ввода. В других сценариях инструмент собрал обновляемую панель по финансовым метрикам публичных компаний, создал базу данных по космическим запускам и настроил еженедельную рассылку по новым ИИ-исследованиям.

При этом настройка прав доступа оказалась запутанной. Автор материала несколько раз пытался выдать облачному хранилищу доступ только на чтение, но получал ошибки. Позже мобильное приложение показало, что для работы нужен полный доступ. Часть важных настроек доступна только в веб-версии, поэтому приходилось использовать сразу два интерфейса.

Есть и другие ограничения. Например, после подключения Google Calendar сервис умеет создавать события, но не может создавать новые календари. Автор также отмечает, что при низком уровне «effort» агент работает заметно хуже.

Руководитель инженерной команды, отвечающей за программную оболочку модели, Джо Гершенсон признал, что настройки effort пока неочевидны для новых пользователей. «Есть вещи, которые мы можем сделать лучше, чтобы помочь им выбрать правильный уровень рассуждения», — сказал он и добавил: «Следите за обновлениями».

Отдельная проблема для OpenAI — оценка качества работы агента вне программирования. В коде проще проверить результат: программа либо работает, либо нет. Хорошую презентацию, бизнес-стратегию или коммерческое предложение оценить намного труднее.

Амброзино назвал одной из уникальных проблем продукта то, что он «реально может делать что угодно». Когда журналист спросил, на какие конкретно задачи и процессы ориентируется команда, инженеры переадресовали вопрос исследовательскому подразделению OpenAI.

Позже компания ответила TechCrunch, что использует внутренний бенчмарк GDPVal, основанный на 44 профессиях и сотнях тестов для интеллектуального труда, а также дополняет его отзывами пользователей. Амброзино добавил, что важным источником обратной связи остаются и сами сотрудники OpenAI: команде приходится постоянно отделять типичные рабочие процессы от необычных внутренних сценариев.

Ранние пользователи Work также создают ценные следы использования, как это раньше произошло с инструментами для программирования, если не отказываются от передачи данных для обучения. Автор TechCrunch сообщил, что сам отказался от такой передачи.

На вопрос, чем Codex и ChatGPT Work отличаются от Claude CoWork и других массовых агентных продуктов, инженеры OpenAI отвечали уклончиво. Гершенсон сказал, что почти не следит за тем, какие оболочки строят конкуренты, и пошутил, сославшись на мем из Mad Men: «Я вообще о вас не думаю».

При этом в материале отмечается, что интерфейсы продуктов очень похожи, а при первом запуске ChatGPT Work предложил перенести данные из Claude Cowork. TechCrunch напоминает, что Anthropic фактически сформировала рынок ИИ-инструментов для программирования и изменила то, как работают разработчики, хотя OpenAI пришла к этой идее раньше.

По словам Амброзино, ранняя веб-версия Codex слишком сильно полагалась на то, что модель сама справится с задачей почти без участия пользователя. В отличие от этого Claude Code строился вокруг постоянного диалога: он предлагал несколько путей решения, просил выбрать вариант, затем делал следующий шаг и снова возвращался за подтверждением. Такой подход оказался эффективнее, хотя требовал от пользователя больше действий.

«Наш продукт тогда немного опередил уровень, на котором находились модель и оболочка», — сказал Амброзино. Позже OpenAI добавила больше точек взаимодействия с моделью, и так появилась нынешняя версия Codex с десктопными и мобильными приложениями.

По статистике загрузок, Claude Code был более востребован до апреля этого года, но затем Codex вышел вперёд с небольшим отрывом. Опросы по корпоративному использованию тоже показывают, что OpenAI сокращает разрыв.

Часть этого прогресса связана с более удачным соответствием продукта рынку. В статье также упоминаются жалобы пользователей на ограничения по безопасности у моделей Anthropic и нехватку вычислительных ресурсов. При этом инженеры OpenAI настаивают, что главным отличием остаётся качество новых моделей компании и их эффективность по цене.

«Раздражающий ответ в том, что часто всё упирается в модель, и одна из вещей, которые мы старались сделать очень хорошо в этом приложении, — полностью использовать её возможности», — сказал Амброзино.

Гершенсон добавил, что можно быстро улучшить результат за счёт большого числа дополнительных правил и инструментов, но через несколько месяцев новая модель может сделать такие надстройки устаревшими. По его словам, команда старается дать модели ровно тот набор инструментов и контекста, который нужен для решения задачи, и не больше.

Профессор Wharton School Итан Моллик, который изучает ИИ-инструменты для работы, пока считает Claude более удобным для пользователя. Он писал, что ChatGPT чаще пытается «сделать магию» и выполнить задачу сам, тогда как Claude показывает сравнения, регулярно просит обратную связь и проводит A/B-проверки.

Соттьо с этим не согласен. По его словам, разговорный формат приложения лучше, чем необходимость изучать отдельную программу. «Мы определённо видим, что люди, похоже, готовы к этому. Именно поэтому у нас было очень сильное внедрение», — сказал он.

При этом остаётся открытым вопрос, верна ли сама ставка на оболочку, жёстко связанную с одной моделью. В статье приводятся тесты компаний Composio и Databricks, где разные сочетания моделей и оболочек показывали разное качество на бенчмарках по программированию. Databricks обнаружила, что оболочка с открытым кодом Pi, опубликованная компанией Earendi, обошла Codex при использовании той же модели GPT 5.5.

Создатель Pi Марио Цехнер считает, что минималистичный подход тоже может работать, по крайней мере для программистов. По его словам, проблема шире: многие агентные продукты до сих пор выглядят как инструменты именно для написания кода, потому что у компаний есть обучающие данные в основном по таким задачам. «Если я менеджер, принимаю решение сегодня, а результат проявляется через месяцы, это невозможно уложить в простой след диалога между пользователем и агентом», — сказал он TechCrunch.

Как и другие сторонники открытого кода, Цехнер считает, что крупные лаборатории продвигают собственные оболочки, чтобы удерживать пользователей внутри своего стека. В противном случае, по его мнению, они рискуют превратиться просто в поставщиков моделей и столкнуться с более жёсткой конкуренцией, в том числе со стороны китайских моделей.

Отдельный вопрос — стоимость. По словам собеседников TechCrunch, у пользователей и разработчиков пока мало прозрачности в том, как именно тратятся токены и как ведут себя агенты внутри таких продуктов.

Автор материала пишет, что при подписке за $20 в месяц за четыре дня умеренного использования потратил более 80 миллионов токенов. По оценке самой модели, это соответствует расходам примерно в $65, то есть OpenAI фактически субсидировала использование более чем втрое относительно цены подписки за этот период.

Соттьо заявил, что компания ежедневно работает над ростом эффективности и напомнил о недавнем снижении цен на 80% для пользователей модели Luna. «Если вы проснётесь через шесть месяцев, то должны будете уметь делать все те же задачи с меньшими расходами», — сказал он.

Ещё один важный вопрос касается удержания клиентов за счёт данных и боли при настройке доступа к многочисленным плагинам и разрешениям. В материале отмечается, что именно такие детали могут усиливать привязку пользователя к продукту.

В завершение Натан сказал, что команда по-прежнему сосредоточена на идее «магического окна», но в продукте всё ещё слишком много лишней запутанности. По его словам, OpenAI рассчитывает устранить это за счёт самих моделей и по-настоящему ИИ-нативного подхода.

Источник: TechCrunch.

Читать новости ИИ и технологий в Telegram.


Оцените статью
Gimal-Ai