Encord, разработчик инструментов для разметки и подготовки данных для ИИ, тестирует новые способы сбора данных для обучения роботов на складе в Сан-Леандро, штат Калифорния. Компания проверяет, может ли сигнал мозговой активности помочь моделям лучше понимать намерение, ошибку и удивление человека при выполнении задач.
Во время демонстрации сотрудник Encord Эндрю Сеха разбирал башню из дженги в гарнитуре с камерой и датчиками мозговых волн. Такие камеры уже используют для сбора данных для робототехники, но в этом случае система ещё и записывала активность мозга. Гарнитуру создала немецкая нейронаучная компания Zander Labs.
По словам Encord, проект с Zander Labs пока проходит как пилот. Компания хочет собрать первичный датасет с метками мозговой активности, протестировать его на моделях клиентов из робототехники и затем оценить, даёт ли это прирост качества перед возможным масштабированием.
Нейробиолог Zander Labs Лукас Герке, который курирует работу, заявил, что объём мозговой активности в разные моменты задачи может подсказывать разработчикам, когда стоит задействовать самые ресурсоёмкие модели.
Глава направления robot learning в Encord Винит Велмуруган назвал этот подход передним краем работы над дефицитом данных для робототехники. Ранее он работал в робототехнической лаборатории OpenAI и в Berkshire Grey, а в Encord пришёл, чтобы создать внутреннюю команду по производству данных.
Изначально Encord помогала компаниям, которые создают системы компьютерного зрения, размечать данные и оценивать модели. Но по мере того как клиенты начали применять сквозное обучение для задач манипуляции объектами, компании пришлось заняться созданием датасетов самостоятельно. Как сказал Велмуруган, «этих данных попросту не существует».
По его словам, попытки перенести подход генеративного ИИ в робототехнику упираются в тот же барьер. Большие языковые модели обучались на текстах из интернета, тогда как собрать сопоставимый объём качественных данных о физических действиях гораздо труднее. Видео помогает, но уступает реальным данным по точности, а собственный сбор, как у разработчиков беспилотных автомобилей, сложно масштабировать.
Велмуруган считает, что для заметного прорыва потребуется датасет объёмом примерно в пять раз больше видеотеки YouTube. По его словам, именно поэтому генерация данных стала отдельным бизнесом, а не только исследовательской задачей.
Сейчас компании, создающие «мозг» для роботов, в основном используют два источника данных:
- видео от первого лица, записанное сотрудниками с носимыми камерами, часто с дополнительными ракурсами и метриками;
- данные от роботов, которыми человек управляет удалённо.
Encord применяет оба подхода. Компания собирает эгоцентрические видео на нескольких фабриках по всему миру, а площадку в Сан-Леандро использует для испытаний новых форматов данных, включая мозговые волны, а также для записи наборов под конкретные навыки и дообучение.
Во время визита TechCrunch сотрудники Encord работали с установками leader-follower: это пары роботизированных рук, где одна рука повторяет движения другой, которой управляет человек. Так компания собирала данные для задач вроде наливания кофе в кружки и укладки фишек для покера. По словам Велмуругана, «каждая компания, которая делает гуманоидов, просила у нас такие данные».
На складе также были подготовлены предметы для бытовых сценариев: искусственные цветы, книги, пластиковые овощи, лотки и совки для кошек, пакеты и связки проводов. Всё это используют для обучения манипуляторов действиям в домашних условиях.
На другой станции сотрудница София Инфанте управляла роботизированными руками, чтобы подключать и отключать Ethernet-кабели на задней панели сервера. Это задача, которую операторы дата-центров хотели бы автоматизировать, но пока роботам не хватает точности. Как отмечает автор материала, захваты всё ещё заметно уступают человеческим пальцам по ловкости и числу степеней свободы.
Ещё один формат данных, который разрабатывает Encord, использует датчики на предплечье для считывания электрических сигналов мышц. Велмуруган рассчитывает, что по этим данным можно будет строить трёхмерное представление положения руки, даже если камера не видит кисть целиком.
Датасеты Encord получают подробные текстовые метки с физическим описанием действий в кадре, например: «правая рука затягивает болт». Это нужно, чтобы модели на базе LLM лучше понимали, что происходит на видео. Велмуруган оценивает, что такая плотная разметка в 100 раз ценнее для обучения конкретным задачам, чем «сырой» эгоцентрический видеопоток, хотя и стоит в 20 раз дороже.
Именно цена остаётся главным ограничением. Если разработчики языковых моделей могли почти бесплатно собирать текст из интернета, то физические данные для робототехники нужно производить, а не просто находить. Это меняет экономику создания таких систем.
По словам Велмуругана, прогресс всё же есть. Encord работает сразу с несколькими робототехническими компаниями и поэтому видит, какие методы сбора данных начинают приносить результат, а какие нет. Этот обзор сразу по многим проектам компания считает частью своего предложения клиентам.
На площадке Encord этим занимается около дюжины операторов, которых в компании называют pilots. И София Инфанте, и Эндрю Сеха раньше работали в Scale AI, ещё одной компании, которая специализируется на разметке данных для ИИ, а затем перешли в Encord.
До этого Сеха работал в компании по вывозу отходов, где отвечал за обслуживание роботизированного сортировщика мусора. Теперь он занимается учебными задачами для роботов и говорит, что ему нравится эта работа: «Каждый день приносит что-то новое».
Источник: TechCrunch.






















