شرکت xAI از مدل جدید Grok Voice Transcribe 2.0 رونمایی کرده است؛ یک مدل تبدیل گفتار به متن که برای فایلهای صوتی، تماسهای تلفنی، ویدئوها، پادکستها و پردازش صوتی لحظهای طراحی شده است. xAI میگوید این مدل در ارزیابیهای واقعی، دقتی دو برابر بیشتر از Grok Voice Transcribe 1.0 ارائه میدهد و قیمت آن نسبت به نسل قبلی تغییر نکرده است.
Grok Voice Transcribe 2.0 چیست؟
این مدل برای تبدیل صدای انسان به متن طراحی شده و تمرکز ویژهای روی شرایط دشوار مانند صدای پسزمینه، مکالمه چندنفره، خطوط تلفنی و لهجههای مختلف دارد. طبق اعلام xAI، مدل جدید از دادههای صوتی چندزبانه و محیطهای متنوع آموزش دیده است.
دقت دو برابر نسبت به نسل قبل
مهمترین ادعای xAI درباره نسخه 2.0، بهبود قابل توجه دقت تشخیص گفتار است. این شرکت اعلام کرده Grok Voice Transcribe 2.0 در ارزیابیهای داخلی نسبت به نسخه 1.0 در مجموعههای مختلف، از جمله تماسهای پشتیبانی، مکالمات، اطلاعاتی مانند شماره تلفن و ایمیل و فرمانهای صوتی چندزبانه، عملکرد بهتری داشته است.
در یکی از مجموعههای آزمایشی مربوط به عبارتهای کوتاه چندزبانه، نرخ خطای کلمه یا WER از 20.6 درصد به 6.8 درصد کاهش یافته است. البته این اعداد مربوط به ارزیابیهای اعلامشده از سوی xAI هستند و نباید بهعنوان نتیجه قطعی برای همه شرایط صوتی در نظر گرفته شوند.
پشتیبانی از زبانهای مختلف
Grok Voice Transcribe 2.0 میتواند دهها زبان را تشخیص دهد و حتی تغییر زبان در میانه یک فایل صوتی را دنبال کند. زبان فارسی نیز در مستندات رسمی API بهعنوان زبان پشتیبانیشده برای قالببندی متن معرفی شده است.
امکانات حرفهای برای تبدیل صدا به متن
مدل جدید علاوه بر تشخیص گفتار، قابلیتهایی مانند تایماستمپ در سطح کلمه، تشخیص گوینده، پردازش چندکاناله تا ۸ کانال، حذف کلمات پرکننده و تشخیص پایان نوبت صحبت را ارائه میکند. همچنین توسعهدهندگان میتوانند برای اصطلاحات تخصصی یا نام محصولات، از قابلیت Key Term Biasing استفاده کنند.
قیمت Grok Voice Transcribe 2.0
یکی از نکات مهم این معرفی، ثابت ماندن قیمت است. xAI اعلام کرده قیمت تبدیل دستهای صوت برابر 0.10 دلار به ازای هر ساعت صدا و قیمت تبدیل لحظهای یا Streaming برابر 0.20 دلار به ازای هر ساعت صدا است؛ همان نرخهای نسل قبلی.
کاربردهای احتمالی در دنیای واقعی
این مدل میتواند برای پیادهسازی خودکار زیرنویس ویدئو، تبدیل جلسات به متن، ثبت مکالمات پشتیبانی، ساخت دستیارهای صوتی، تولید متن از پادکست و پردازش تماسهای تلفنی مورد استفاده قرار گیرد. xAI همچنین اعلام کرده سرویسهایی مانند Loom از Grok Speech to Text برای تبدیل ویدئوها به متن استفاده میکنند.
جمعبندی
Grok Voice Transcribe 2.0 یکی از جدیدترین مدلهای تبدیل گفتار به متن xAI است که تمرکز آن روی افزایش دقت در شرایط واقعی و چندزبانه قرار دارد. طبق اعلام شرکت، مدل جدید نسبت به نسل قبل دو برابر دقیقتر شده و در عین حال قیمت API ثابت مانده است؛ موضوعی که میتواند برای توسعهدهندگانی که حجم زیادی فایل صوتی پردازش میکنند اهمیت داشته باشد.
این مدل در حال حاضر در API گفتار به متن xAI قابل استفاده است و طبق مستندات رسمی، نسخه 2.0 به مدل پیشفرض سرویس تبدیل شده است.