Короткий огляд російських інструментів транскрипції та їхньої точності

tl;dv перше місце в нашому тесті на транскрибування російськомовних зустрічей, набравши 168 балів із 200 можливих. HappyScribe посів друге місце з результатом 126 балів, Fireflies 110, а Fathom . Оцінювання проводилося «наосліп»: під час раундів оцінювання за допомогою великих мовних моделей (LLM) та носія мови інструменти були знеособлені.

tl;dv найкращіtl;dv за рівнем точності, випередивши конкурентів на 17 балів. Це був єдиний інструмент, який правильно розпізнав власні імена під час усіх трьох зустрічей і демонстрував стабільність у всіх тестових прогонах. Щодо розпізнавання російської мови, жоден інший інструмент навіть близько не наблизився до цього результату.

Ось результати оцінювання кожного інструменту за розділами, за якими ми його тестували.

РівеньМаксtl;dvFirefliesFathomHappyScribe
Транскрипція та точність6552/6522/6514/6535/65
Якість зустрічей у реальному житті4537/4516/4515/4529/45
Можливості та функції7261/7254/7242/7244/72
Довіра, безпека та цінність1818/1818/1818 грудня18/18
Загальний бал200168/200110/20083/200126/200
Рейтинг 1342
Зміст

Точність транскрипції російськомовних зустрічей показала більш неоднозначні результати, ніж наші попередні тести з французькою, іспанською та португальською мовами. Найвищий результат — 168 балів —tl;dv , а HappyScribe набрав 126 балів.

Розриви в результатах також не були рівномірними. У категорії транскрипції tl;dv найближчого конкурента загалом на 17 балів, причому показники щодо виявлення об’єктів значно відрізнялися. Саме з власними назвами інші інструменти з цього списку мали найбільші труднощі.

Російська мова має здатність виявляти дрібні помилки так, як це не вдається англійській. У російській мові іменники та прикметники мають відмінкові закінчення, тому навіть одна помилка в складі може змінити значення речення — наприклад, хто що зробив і кому — замість того, щоб просто стати очевидною друкарською помилкою. Крім того, у діловій російській мові часто трапляються переходи від англійських запозичень до речень, написаних кирилицею. Кожен інструмент, який ми тестували, мав вирішувати, чи транслітерувати такі елементи, як назви брендів, залишити їх латиницею, чи просто зробити вибір на основі власного судження. Три з чотирьох, здавалося, просто вгадували, а один із цих інструментів навіть перетворив голову регіонального уряду на головного демона.

Для проведення нашого тесту ми взяли три реальні зустрічі російською мовою та проаналізували їх за допомогою:

Заходи мали різноманітний характер: серед них була сесія, присвячена відмінностям між зростанням та розвитком, панельна дискусія з корпоративних комунікацій та сесія, присвячена міському розвитку в Казані.

Зазвичай у наших тестах ми намагаємося включити Google Gemini, оскільки це поширений інструмент у робочому середовищі користувачів, але наразі Gemini підтримує російську мову, тому його було виключено.

Щоб забезпечити максимально об’єктивні результати, оцінювання проводилося в режимі «сліпого» тестування. Два великі мовні моделі (LLM) оцінювали кожен результат без зазначення назв інструментів, а носій російської мови перевіряв ті моменти, з якими інструменти мали труднощі або в яких їхні оцінки розходилися.

Транскрипція російських зустрічей та її точність

У нашому тестуванні найбільшу вагу має розділ «Транскрипція та точність», оскільки саме від цього залежить усе інше. З загальних 65 балів tl;dv 52, тоді Fathom лише 14.

Ці результати були оцінені великими мовними моделями (ClaudeAnthropicта ChatGPT від OpenAI), а потім підтверджені в ході сліпої оцінки носіями мови, під час якої назви інструментів були приховані.

Метрична системаЯк підраховуються балиtl;dvFirefliesFathomHappyScribe
Точність викладуСліпа оцінка носієм мови ступеня точності висловлювань у рідній мові15/2020 липня20 травня20 грудня
Особливості обробки залежно від мовиКирилична орфографія, закінчення відмінків, пунктуація, переключення кодів15/2020 липня20 квітня20 вересня
Частота явно неправильних слівЧастка токенів, які явно містять помилки: вигадані або неросійські вставки та цикли повторень5/52/50/54/5
Виявлення об’єктівІмена, назви компаній та назви місць у складі акторського складу5/51/50/52/5
Числа, дати та валютаЦифри, дати та суми, відформатовані відповідно до вимог мови4/52/52/53/5
Технічний термін «сирове розпізнавання»Галузеві терміни та абревіатури перед початком індивідуального навчання4/51/51/52/5
Пунктуація та сегментаціяРозбиття речень та поділ на абзаци у вихідних даних тестового запуску4/52/52/53/5
Підсумок за транскрипцією та точністю 52/6522/6514/6535/65

Виявлення об’єктів

Найбільша розбіжність у оцінках спостерігалася в частині виявлення об’єктів. tl;dv 5 балів із 5, а Fathom 0.

Російські власні назви є складнішими, ніж в англійській мові. Наприклад, назви брендів потрібно транслітерувати кирилицею, а інструмент не може просто розшифрувати те, що він розпізнав. Два приклади, де tl;dv добре, а інші інструменти зазнали труднощів, — це правильне розпізнавання «Проктер енд Гембл» та розшифрування CBD як «Customer Business Development». Жоден з інших інструментів не зміг цього зробити.

Одним із найгірших промахів стала назва бренду «Wrike». tl;dv назвати його правильно. Інші троє описали продукт із 30 000 користувачів, але повністю оминули назву продукту у своєму реченні. Якби хтось прочитав ці стенограми й спробував з’ясувати, який саме інструмент рекомендував доповідач, він не зміг би знайти цю конкретну деталь.

На сесії в Казані це знову сталося з МЕГА, Баухаузом і Проспектом Універсіади. tl;dv єдиним інструментом, який отримав максимальну оцінку за цей ряд у всіх трьох тестах.

Точність викладу

Ніхто не набрав максимального балу за цим критерієм (максимум — 20), який відображає, яка частина зустрічі була збережена в процесі транскрибування. Найкращий результатtl;dv — 15 балів.

Fathom отримав Fathom 5 балів, і це була конкретна помилка, яку було виявлено, а не просто випадки неправильного розпізнавання. В одному clip згенерував англійські речення, яких ніхто не вимовляв, та створив об’єкти, про які в аудіозаписі взагалі не згадувалося. Наш носій мови зазначив, що те, що програма транскрибувала, було цілком прийнятним, але в підсумку вона додала багато того, чого насправді не було.

Fireflies набрав загалом 7 балів і продемонстрував дещо небезпечніші результати. Помилки, яких він припустився, полягали в тому, що російські слова, написані правильно, були вставлені в неправильні місця. Наприклад, він перетворив «глави региона» (голова регіонального уряду) на «главного демона» (головний демон). У тому ж уривку «Проспект Универсиады» перетворився на «Проспект Грузиады», якого немає ні в Казані, ні деінде.

Це означає, що той, хто читатиме Fathom дані Fathom , зможе легко помітити і подумати: «Це неправильно», тоді як Fireflies на перший погляд Fireflies більш цілісним, хоча й міститиме серйозні помилки.

Особливості обробки залежно від мови

tl;dv тут також 15 балів, очоливши рейтинг

Як ми вже згадували раніше, у російській діловій мові іноді трапляються випадки переходу на англійську мову, причому це відбувається посеред речення. Кожен інструмент мав транскрибувати такі випадки та визначати, як діяти в таких ситуаціях, а також вирішувати, чи слід вставляти англійське слово в речення, написане кирилицею. Tl;dv Fathom зберегти все, що було написано латиницею. Fireflies слова фонетично, наприклад «вот эвер», що наш носій мови позначив як неправильне.

Рівень помилок у тексті

Коротко кажучи, tl;dv тут 5 балів, а Fathom опинився Fathom останньому місці з 0 балами.

Під час тестування у нас не було перевіреної дослівної транскрипції виступу, тому ми звернули увагу на те, як кожен інструмент впорався із завданням і скільки слів було явно неправильними. Маються на увазі такі речі, як неросійські символи, повторювані фрази та будь-які інші помилки. У результатахtl;dvдля першого clip таких помилок фактично clip . Fathomвони зустрічалися приблизно в кожному восьмому слові.

Числа, дати та валюта

У сфері, де дані мають бути правильними, інакше це може призвести до серйозних помилок на подальших етапах, tl;dv тут найвищий бал — 4.

Однією з найбільших помилок у цій вибірці стала помилка HappyScribe. Доповідач назвав конкретний період у десять років (десять років). Натомість HappyScribe записав десять мільйонів, тобто десять мільйонів. Якщо побіжно переглянути текст, це не відразу здасться помилкою транскрипції, але різниця між десятьма роками та десятьма мільйонами досить велика.

У рамках панелі, присвяченій корпоративним комунікаціям, усі чотири інструменти змогли правильно відобразити всі цифри. Це стосувалося як чисел, так і дат, і відсотків.

Технічний термін «сировинне розпізнавання»

tl;dv 4 бали, HappyScribe — 2, Fireflies , а Fathom .

tl;dv найкращеtl;dv з технічним жаргоном і термінологією в цьому рядку, неtl;dv введення власних слів. Інші інструменти мали певні труднощі з конкретним словом «персоналізація» (personalization).

HappyScribe почув слово «реалізація» (realization або implementation). Fireflies слово «кристалізація» (crystallization). Обидва ці слова є справжніми російськими словами, але вони також є неправильними та відрізняються одне від одного.

Якість зустрічей у реальному житті

Точність транскрипції — це основа, на якій тримається все; якщо вона неточна, у всьому, що йде за нею, можуть виникнути проблеми.

У цьому розділі ми розглянемо деякі додаткові елементи транскрипції, а також результати її роботи та те, наскільки це може бути корисно під час реальних ділових зустрічей та у ваших робочих процесах.

tl;dv тут найвищу оцінку — 37, а найнижчу — Fathom 15.

Метрична системаЯк підраховуються балиtl;dvFirefliesFathomHappyScribe
Якість діаризаціїПорівняння кількості акторів та розподілу ролей з відомим складом акторського складу10/100/100/1010/10
Стабільність поведінкиСтабільність поведінки в різних типах сесій9/103/101/105/10
Якість резюмеКорисність резюме та те, чи збереглася воно мовою оригіналу, з урахуванням запозичених слів5/54/55/52/5
Частота галюцинацій / частота вставних образівВигаданий, повторюваний або дубльований текст, якого немає в аудіозаписі. Не враховуються випадки неправильного сприйняття на слух та упущення слів.8/100/100/1010/10
Виокремлення елементів для дійЯкість завдань та подальших дій, визначених під час наради0/55/55/50/5
Автоматичне розділення на розділи / підрозділиЧи поділяє цей підсумок засідання на зручні розділи?5/54/54/52/5
Проміжний підсумок щодо якості зустрічей у реальному світі 37/4516/4515/4529/45

Короткий огляд якості

tl;dv Fathom по 5 балів, Fireflies , HappyScribe — 2.

Fireflies змінили географію однієї з конференцій. У підсумковому звіті сесії в Казані є розділ під назвою «Градобудівна політика та інновації в Москві». Річ у тім, що вся конференція присвячена Казані, яка знаходиться аж за 800 км від Москви. У тексті цього розділу згадується, що місце проведення знаходиться «поблизу центру Москви».

HappyScribe також отримав нижчу оцінку — 2 бали, але з іншої причини. Під час одного засідання, незважаючи на те, що програма транскрибувала його, вона не змогла створити резюме. Вона видала повідомлення «Не виявлено мовлення», хоча транскрипція вийшла досить непоганою.

Як ми вже згадували вище, Fathom показав тут дуже хороші результати. Незважаючи на те, що система генерувала англійські речення, підсумок вийшов чітким, тематичним і повністю російською мовою. Жоден з вигаданих фрагментів не потрапив до підсумку.

Частота галюцинацій та частота вставних спогадів

HappyScribe набрав 10 балів, tl;dv , Fireflies Fathom .

Це одна з небагатьох областей, де tl;dv перше місце, і це був єдиний фрагмент, у якому з’явилися два японські ієрогліфи. Їх було легко помітити, і читач, безсумнівно, звернув би на них увагу, але, тим не менш, це було вставкою.

У двох із трьох тестів Fireflies кілька значних зациклень. В одному записі вона повторила фразу «з людьми» двадцять чотири рази. Під час сесії в Казані вона вісім разів повторила фразу «Я не знаю». Наш носій мови сприйняв ці випадки як помилки в транскрипції.

Після завершення дискусії у фільмі Fireflies напис «Продовження слідує» (to be continued). Це стандартний заключний напис, а не слова, вимовлені в залі.

Якість діаризації

tl;dv HappyScribe набрали по 10 балів, а Fireflies Fathom .

Оскільки тестування ядра виконується як єдине джерело аудіо через Google Meet, для оцінювання цього параметра ми проводимо ще один раунд тестів, завантажуючи контент безпосередньо на платформу, щоб перевірити, наскільки добре вона може ідентифікувати та позначати мовців. І tl;dv HappyScribe отримують тут найвищі оцінки. Fathom не Fathom можливості завантажувати аудіо чи відео на свою платформу.

Fireflies той самий аудіозапис і не впоралася із завданням. У випадку з одним аудіозаписом, де говорив лише один співрозмовник, система зафіксувала трьох співрозмовників і 22 рази змінювала їх протягом 24 сегментів, часто посеред речень. В одному випадку одне речення було приписано трьом різним співрозмовникам.

Стабільність поведінки

tl;dv 9 балів, HappyScribe — 5, Fireflies , а Fathom .

Тут ми розглядаємо, наскільки стабільно працює інструмент у всіх сесіях. tl;dv найстабільнішим у всіх аспектах, а Fathom найбільші коливання.

Виокремлення елементів для дій

У цій сфері tl;dv , і на це є вагома причина. У кожному з цих резюме Fireflies Fathom завдання між людьми на основі результатів роботи.

tl;dv не tl;dv цього під час жодного з трьох запусків, і на це є своя причина. Не було жодних дій, які потрібно було б зафіксувати.

Отже, коли Fireflies Fathom завдання, вони створювали їх з нуля. Це були три круглі столи. Ніхто нікому нічого не доручав, ніхто не погоджувався нічого виконати, і не було визначено жодних подальших дій. Не було жодного списку, який можна було б витягти, тому обидва інструменти самостійно сформували його.

Тож, хоча tl;dv тут не tl;dv жодного балу, ставтеся до цього з певною часткою скептицизму.

Автоматичне створення розділів та підрозділів

tl;dv 5 балів, Fireflies Fathom , HappyScribe — 2.

tl;dv послідовно розбити кожну зустріч на пронумеровані тематичні сегменти, причому кожен пункт містив посилання на часовий штамп для перевірки. Жоден інший інструмент не забезпечував такого рівня деталізації часових штампів, і хоча вони також дозволяли сегментувати матеріал, якість та кількість таких сегментів значно варіювалися залежно від інструменту. З метою забезпечення об’єктивності ми використовували стандартизований підсумок для кожного з них.

Можливості та функції

У цьому розділі ми розглянемо ці інструменти в цілому, їхні функції, а також деякі базові результати щодо таких показників, як швидкість обробки та точність часових міток.

Якщо в попередніх розділах йшлося про оцінку ефективності роботи інструменту, то в цьому розділі розглядається, скільки способів використання даних існує в рамках бізнесу. У цьому розділі результати досить близькі, і tl;dv перше місце з результатом 61, при цьому відрив від решти інструментів становить 19 балів.

Метрична системаЯк підраховуються балиtl;dvFirefliesFathomHappyScribe
Автоматичне визначення імен колонокАвтоматичне визначення імен реальних учасників у Meet, Zoom, Teams5/55/55/50/5
Розпізнавання голосуМожливість навчання системи розпізнаванню голосу користувача5/50/50/50/5
Запис без ботівЗдійснює запис через системний аудіоканал без підключення бота до дзвінка5/55/55/55/5
Синхронізація CRMВбудована синхронізація та автоматична синхронізація3/33/33/30/3
Особисті нотатки / шаблониНастроювані формати зведених даних проти фіксованого формату виводу3/33/33/33/3
Налаштування словника / навчання сутностейВикладати галузеві терміни та абревіатури5/55/50/55/5
Локалізація російського інтерфейсу користувачаЧи доступний сам інтерфейс продукту російською мовою0/50/50/50/5
Широта інтеграціїSlack, календар, Zapier, API3/33/33/33/3
Швидкість обробкиПорядок надходження готового стенограми після завершення засідання3/33/33/32/3
Відстеження слів-заповнювачівВідстежує слова-заповнювачі без подвоєння звуків при заїканні, замість надмірного згладжування транскрипту3/30/30/30/3
Точність часових мітокВиконайте вибіркову перевірку, щоб переконатися, що часові мітки відповідають потрібному моменту3/31/30/30/3
Наявність перекладуЧи може ця програма перекладати нотатки з наради, і на скільки мов?3/30/30/33/3
Пошук у стенограміПошук у матеріалах засідання та в бібліотеці3/33/33/33/3
Інтерфейс редагування транскриптівЧи можна легко виправити стенограму вже після того, як вона була складена?3/33/33/33/3
Формати експортуSRT, VTT, TXT, DOCX та подібні0/33/30/33/3
Транскрипт у прямому ефірі / у режимі реального часуЧи відображається стенограма в режимі реального часу під час засідання?0/33/33/30/3
Покриття платформи для проведення зустрічейОгляд Zoom, Meet, Teams та Webex3/33/33/33/3
Зйомка мобільного додаткаЧи можна за допомогою мобільного додатка записувати очні зустрічі?3/33/30/33/3
Вбудований сервер MCPВласний сервер, що дозволяє штучним інтелектам здійснювати запити до бібліотеки зустрічей5/55/55/55/5
Редагування міток динаміківЧи можна перейменувати та перепризначити динаміки вже після того, як все налаштовано?3/33/33/33/3
Підсумок за можливостями та функціями 61/7254/7242/7244/72

Розпізнавання голосу

«Розпізнавання голосу» — це функція, яка, за умови надання згоди, навчає систему розпізнавати голос конкретного користувача, завдяки чому його можна розпізнавати під час усіх зустрічей без необхідності повторного маркування. Цей показник залежить від того, чи доступна ця функція, і tl;dv єдиний сервіс, який її підтримує.

Відстеження слів-заповнювачів

Однією з причин, чому tl;dv такі високі tl;dv при транскрибуванні, є те, що він відстежує слова-заповнювачі, а не видаляє їх. Це означає, що інструмент визначає найбільш достовірну версію стенограми, зберігаючи паузи та вагання, а не згладжуючи їх. Хоча інші три інструменти можуть надавати загалом більш «очищену» версію зустрічі, вони фактично редагують її.

Наявність перекладу

tl;dv HappyScribe набрали по 3 бали. Fireflies Fathom по 0 балів.

Мені вдалося відкрити стенограму на tl;dv HappyScribe, натиснути кнопку й перекласти російську стенограму на англійську. Це надзвичайно корисно для міжнародних компаній, які проводять наради різними мовами. Fathom вдалося зробити це з резюме, але не з самої стенограми, тому вони не отримали оцінку, оскільки ми вже виявили розбіжності між стенограмою та самим резюме.

Назва колонки «Out Of The Box»

tl;dv Fireflies » Fireflies Fathom по 5 балів. «HappyScribe» набрав 0 балів.

Більшість програм здатні автоматично витягувати мітки з Google Meet, Zoom Teams і застосовувати їх до стенограми. HappyScribe цього не робить, тому імена доповідачів відображаються як загальні мітки, і вам доведеться вводити їх вручну згодом.

Синхронізація CRM

Інтеграції HappyScribe
У HappyScribe немає вбудованої інтеграції з CRM

HappyScribe — це єдиний інструмент, який не підтримує вбудовану синхронізацію з CRM. Він має різноманітні можливості інтеграції, але прямого підключення до CRM немає.

Це можна зробити за допомогою Zapier, але для цього знадобиться додаткове налаштування та обслуговування робочого процесу.

Усі три інші інструменти здатні автоматично надсилати нотатки безпосередньо до CRM, що дозволяє заощадити час, сили та ресурси.

Швидкість обробки

tl;dv Fireflies » Fireflies Fathom по 3 бали. «HappyScribe» отримав 2 бали.

У цьому розділі оцінювалося, як швидко після завершення зустрічі ставали доступними стенограма та резюме. Tl;dv Fathom одразу після завершення, за ними йшов Fireflies. HappyScribe серед усіх інструментів затримався найдовше.

Цей розділ закрито

У порівнянні з результатами, отриманими за показником точності транскрипції без обробки, тут різниця між оцінками була меншою. Кожен із інструментів має свої справді хороші функції, і, як наслідок, за багатьма параметрами — такими як запис без ботів, охоплення платформ та сервер MCP — вони не поступаються один одному.

Ці чотири продукти мають схожі функціональні можливості, але, як показує аналіз їхніх можливостей щодо транскрипції, у питанні транскрипції російської мови вони не можуть зрівнятися.

Довіра, безпека та цінність

Цей розділ присвячений питанням безпеки та надійності кожної платформи. Усі представлені інструменти мають чудові функції безпеки та чітко усвідомлюють свою відповідальність у 2026 році щодо забезпечення безпеки даних.

tl;dv Fireflies HappyScribe отримали найвищі оцінки, тоді як Fathom бали за двома критеріями з цілком конкретних причин.

Метрична системаЯк підраховуються балиtl;dvFirefliesFathomHappyScribe
Розташування даних / регіональний хостингВаріанти регіонального хостингу, наприклад, хостинг у ЄС на замовлення3/33/30/33/3
Безпека та відповідність вимогамSOC2, ISO 27001, GDPR3/33/33/33/3
Навчання штучного інтелекту на основі аудіозаписів користувачівЧи дозволяє це уникнути навчання ШІ на ваших аудіозаписах (у разі відсутності навчання виставляється найвища оцінка)?3/33/30/33/3
Контроль зберігання данихКонтроль за термінами зберігання записів та стенограм3/33/33/33/3
Прозорість цінЦіни на плани публікуються, а не надаються лише за запитом3/33/33/33/3
Безкоштовний тариф / обмеженняНаявність безкоштовного тарифного плану (сама лише безкоштовна пробна версія оцінюється в 0 балів)3/33/33/33/3
Підсумок за статтями «Довіра», «Безпека» та «Цінність» 18/1818/1818 грудня18/18

Розташування даних та регіональний хостинг

tl;dv Fireflies HappyScribe набрали по 3 бали. Fathom 0 балів.

Це перша сфера, в якій ці три інструменти випереджають Fathom. І це має досить серйозні наслідки. Клієнти мають можливість обирати місце зберігання своїх даних, що є ключовим фактором для компаній з ЄС та тих, хто працює у дуже специфічних галузях. Оцінка в цьому випадку проводиться на основі наявності вибору.

Зокрема, британські та європейські команди матимуть зобов’язання щодо розміщення серверів, а багато компаній не зможуть зберігати дані в певних географічних регіонах.

Fathom альтернативних варіантів у цьому питанні, і всі її дані зберігаються у США. Компанія заявляє, що для постачальників з ЄС та Великої Британії вона може забезпечити відповідність вимогам GDPR і за запитом підпише угоду про обробку даних (DPA).

Навчання ШІ на основі аудіозаписів користувачів

tl;dv Fireflies HappyScribe набрали по 3 бали. Fathom 0 балів.

У цьому розділі бали нараховуються за те, що штучний інтелект не навчається на даних про клієнтів. Три з чотирьох інструментів заявляють, що вони цього не роблять.

Позиція Fathomє більш багатогранною. Її субпроцесорам штучного інтелекту — а саме Anthropic, OpenAI та Google — за умовами договору заборонено навчатися на даних користувачів. Fathom , що використовує знеособлені дані клієнтів для вдосконалення власних моделей, і ця опція увімкнена за замовчуванням.

Цю функцію можна вимкнути, і адміністратори команд можуть вимкнути її для всієї організації. Але я знайшов її лише після того, як прокрутив налаштування, а знайти елемент керування — це зовсім інша справа, ніж просто увімкнути його.

Тест на точність розпізнавання російської мови: методологія

Наше порівняння ґрунтується на контрольованому тестуванні за принципом «один до одного», яке було розроблено з метою забезпечення однакових умов для кожного інструменту.

Набір для тестування

Щоб забезпечити широкий спектр можливостей для тестування, було обрано три не пов’язані між собою російські круглі столи. Матеріали для них були взяті з загальнодоступних записів, і ми проводили всі тести, наскільки це було можливо, в однакових умовах.

Перша — це ділова дискусія про різницю між зростанням та розвитком, в якій розглядаються питання організаційної структури, плинності кадрів та ризиків.

Друга — це панель, присвячена корпоративним комунікаціям, у якій багато англійських запозичень, назв брендів та показників кількості користувачів.

Третя частина присвячена обговоренню питань міського розвитку, туризму та нерухомості в Казані; у ній багато згадуються місцеві топоніми.

Тривалість відеороликів становила приблизно 7 хвилин, чого має вистачити для виявлення чіткої закономірності та визначення слабких місць. Усі пристрої підключилися до одного й того самого Google Meet і здійснювали запис одночасно. Аудіосигнал, який вони отримували, був ідентичним, оскільки ситуація була однаковою.

Крім того, ми, де це було можливо, провели окремий цикл завантаження, щоб оцінити рядок діаризації. Це був той самий аудіофайл, завантажений безпосередньо, щоб обійти виклик.

Google Meet із чотирма програмами для створення нотаток на основі штучного інтелекту, що записують одночасно: tl;dv, HappyScribe, Fathom  Fireflies, а також організатор зустрічі

Огляд

Спочатку якість транскрипції та запису зустрічі оцінювалася методом «сліпого» тестування. Результати роботи інструментів були внесені до документа та анонімізовані за допомогою літер від A до D. Ані великі мовні моделі (LLM), ані наш носій мови не змогли встановити, яка саме транскрипція належала якому інструменту.

Ми провели два незалежні цикли обробки за допомогою великих мовних моделей (LLM), оцінюючи результати за шкалою оцінювання. Один із них виконав Claude, а інший — ChatGPT. Ці цикли виконувалися в ізольованих проєктах, і моделі не мали доступу до результатів одна одної.

У випадках, коли результати цих двох інструментів розходилися, ми спиралися на той, який надавав більше доказів, а не обчислювали середнє значення. Це означає, що узгоджені оцінки пов’язані з конкретними рядками в конкретних стенограмах, а не з текстом у цілому.

Потім ми попросили носія російської мови перевірити отримані результати, виділивши моменти, що викликали особливі труднощі, а також випадки, коли результати різних інструментів розходилися. Йому надали посилання на оригінальний аудіозапис для порівняння. Ці зауваження були використані для підтвердження результатів роботи великих мовних моделей (LLM) та для наведення конкретних прикладів, які б помітив справжній носій російської мови.

Оцінка можливостей та рівня довіри була проведена згодом на основі документації, що була актуальною на момент тестування. Ці дані були перевірені безпосередньо у постачальників, а не на сторонніх веб-сайтах.

Набір інструментів

Ці інструменти були обрані з однієї причини: у своїх рекламних матеріалах їхні розробники заявляють, що вони здатні здійснювати транскрипцію російської мови.

Випадаюче меню «Мова» Fireflies , де російська мова вказана серед доступних мов транскрипції
Випадаюче меню «Мова» Fireflies , де російська мова вказана серед доступних мов транскрипції
Fireflies Fathom добре відомими на ринку, і їх було обрано з огляду на заявлені можливості та загальну порівнянність із tl;dv. HappyScribe було обрано як ще одного постачальника з ЄС; спочатку цей сервіс створювався як інструмент для транскрипції та створення субтитрів, а згодом перейшов на ринок послуг для проведення зустрічей. Усі чотири сервіси було обрано ще до того, як будь-який із них пройшов тестування, а склад конкурентів було визначено до того, як з’явилися перші оцінки.

Розбивка двигуна та плану

Саме «двигун» цих інструментів виконує роботу з транскрипції, і він не завжди є загальнодоступним. Під час нашого тестування tl;dv ElevenLabs; Fireflies ліцензії, а не власні збірки, але не називає постачальника. Fathom HappyScribe не розкривають жодної інформації.
Інструмент Базовий двигун / виробник Власний чи ліцензований Тип двигуна План
tl;dv ElevenLabs Scribe Ліцензовані, оприлюднені Спеціалізована система розпізнавання мови (ASR) Бізнес
Fireflies Не розголошується Ліцензована. Генеральний директор Кріш Рамініні заявив, що компанія ніколи не прагнула бути компанією, яка надає API, і що транскрипція є лише засобом для досягнення мети, вказавши на сторонніх постачальників послуг розпізнавання мовлення (ASR) Сторонній ASR із накладеним шаром LLM Про
Fathom Не розголошується Не розголошується Не розголошується Безкоштовно
HappyScribe Не розголошується Не розголошується Не розголошується План «Lite»

Сфера застосування та застереження

Для жодної сесії запису не було перевірених дослівних стенограм. Ми протестували власні автоматичні субтитри YouTube як еталон і відхилили їх: у порівнянні з цими субтитрами кожен інструмент показав рівень помилок понад 100%. Діаризація здійснювалася шляхом прямого завантаження файлу, а не під час прямого дзвінка. Fathom шляху для завантаження, тому значення «0» у цьому рядку вказує на відсутність такої можливості, а не на невдалий тест. Усі оцінки в цій статті були визначені до того, як було названо будь-який інструмент.

Яке програмне забезпечення для транскрибування зустрічей найкраще підходить для російської мови?

tl;dv найвищий результат серед усіх чотирьох інструментів, які ми тестували, — 168 балів із 200, і вирішальним фактором став саме рівень точності транскрипції, а не набір функцій. Хоча всі ці інструменти виконують одну й ту саму функцію, вони по-різному сприймають і записують російську мову.

Справжньою головною вадою багатьох із цих інструментів, порівняно з tl;dv здатність розпізнавати власні назви та правильно їх відображати. Розпізнавання об’єктів було найбільшим недоліком у системі оцінювання. Назви брендів, місцевостей та абревіатури потрібно транслітерувати на кирилицю. Якщо інструмент намагається вгадати, у результаті можна отримати транскрипцію, яка виглядає правильно, але фактично є неправильною.

Ця закономірність спостерігається у всій серії. Ми провели той самий тест із 200 балами для японської, іспанської, французької, німецької, італійської, португальської, шведської та фінської мов. Різні мови, різні конкуренти, але щоразу однакова система оцінювання. Якщо ви працюєте з однією з цих мов, починайте саме з неї, а не з англомовного еталону.

Функції, про які йдеться в цій статті, можна обійти, і tl;dv вже tl;dv більшість із них, але транскрипт, у якому неправильно вказано ім’я клієнта, цього зробити не зможе. Спробуйте запустити tl;dv вашої наступної зустрічі російською мовою — це безкоштовно. Переконайтеся самі та дізнайтеся, як покращення якості результатів може вплинути на всю вашу подальшу роботу.

Поширені запитання щодо транскрипції зустрічей російською мовою

tl;dv найточнішим, набравши 52 бали з 65 за якість транскрипції в нашому сліпому тесті 2026 року. HappyScribe посів друге місце з результатом 35 балів, Fireflies 22, а Fathom . Найбільший розрив спостерігався у виявленні сутностей, де tl;dv 5 tl;dv з 5 можливих, тоді як інші — 2, 1 та 0 відповідно. Саме у роботі з власними назвами російські інструменти транскрипції демонструють свої переваги.

tl;dv Fireflies, Fathom HappyScribe створюють транскрипти російською мовою. Жоден із цих чотирьох сервісів не пропонує російськомовного інтерфейсу, тому всі функції, пов’язані з транскриптом, залишаються англійською мовою. Google Gemini взагалі Gemini транскрибування зустрічей російською мовою. Gemini вісім мов: англійську, французьку, німецьку, італійську, японську, корейську, португальську та іспанську.

Моделі транскрипції можуть вставляти стандартні текстові фрагменти, коли аудіозапис замовкає або стає зашумленим, замість того, щоб не повертати жодних результатів. Під час нашого тесту 2026 року Fathom рядок з титрами, який не з’являється в жодній частині аудіозапису. Fireflies «Продовження слідує» — стандартний заключний титр. Обидва ці текстові шаблони часто зустрічаються в моделях, навчених на відеоматеріалах із субтитрами.

Рівень точності в російській мові коливається набагато сильніше, ніж це випливає з опублікованих результатів тестування англійської мови. У нашому тесті 2026 року чотири інструменти набрали від 14 до 52 балів із 65 за результатами аналізу тих самих трьох зустрічей. Помилки не були незначними. Серед них були вигадані англійські речення, фраза, що повторювалася двадцять чотири рази, а також запис «десять років» як «десять мільйонів».

Усі чотири інструменти, які ми протестували у 2026 році, виконують транскрипцію російської мови з переходом між мовами, причому результати були неоднозначними. tl;dv Fathom англійське слово «whatever» у латинській транскрипції. Fireflies його фонетично як «вот эвер», що наш носій мови визнав неправильним. Транслітерація завдала більше шкоди, ніж сам перехід між мовами. Лише tl;dv правильно tl;dv «Проктер энд Гэмбл» та «CBD».