Компания Datacurve привлекла 15 миллионов долларов для сбора высококачественных данных
По мере взросления компаний, занимающихся искусственным интеллектом, борьба за высококачественные данные стала одной из самых конкурентных областей в отрасли. Это породило такие компании, как Mercor, Surge и, наиболее заметная, Scale AI Александра Вана. Теперь, когда Ван перешёл на работу над ИИ в Meta, многие инвесторы видят возможность и готовы финансировать компании с новыми стратегиями сбора обучающих данных.
Одной из таких компаний является Datacurve, выпускница Y Combinator, которая фокусируется на высококачественных данных для разработки программного обеспечения. В четверг компания объявила о привлечении 15 миллионов долларов в рамках раунда Series A, который возглавил Марк Голдберг из Chemistry. В раунде приняли участие сотрудники DeepMind, Vercel, Anthropic и OpenAI. Раунд Series A последовал за посевным раундом в размере 2,7 миллиона долларов, в котором участвовал бывший технический директор Coinbase Баладжи Шринивасан.
Datacurve использует систему «охотников за головами», чтобы привлечь опытных инженеров-программистов для создания наиболее труднодоступных наборов данных. Компания платит за эти вклады, распределив на данный момент более 1 миллиона долларов в виде бонусов.
Однако соучредитель Серена Ге (на фото выше с соучредителем Чарли Ли) говорит, что главная мотивация не финансовая. Для таких ценных услуг, как разработка программного обеспечения, оплата работы с данными всегда будет намного ниже, чем при обычной занятости. Поэтому самое важное преимущество компании — это положительный пользовательский опыт.
«Мы рассматриваем это как потребительский продукт, а не как операцию по разметке данных», — сказала Ге. — «Мы тратим много времени на размышления о том, как оптимизировать процесс, чтобы интересующие нас люди заинтересовались и зарегистрировались на нашей платформе».
Это особенно важно, поскольку потребности в данных после обучения становятся всё более сложными. Если раньше модели обучались на простых наборах данных, то современные ИИ-продукты опираются на сложные среды RL, которые необходимо создавать посредством целенаправленного сбора данных. По мере усложнения сред требования к данным становятся более строгими как по объёму, так и по качеству — этот фактор может дать таким компаниям, как Datacurve, преимущество.
На данном этапе Datacurve фокусируется на разработке программного обеспечения, но Ге говорит, что модель можно с лёгкостью применить и к таким областям, как финансы, маркетинг или даже медицина.
