Podsumowanie: rosyjskie narzędzia do transkrypcji i ich dokładność
tl;dv pierwsze miejsce w naszym teście transkrypcji rosyjskich spotkań, uzyskując wynik 168 na 200 punktów. Drugie miejsce zajęło HappyScribe z wynikiem 126 punktów, trzecie – Fireflies 110, a czwarte – Fathom . Ocena odbywała się metodą ślepej próby, a narzędzia zostały zanonimizowane podczas rund oceny przeprowadzanych z udziałem modeli LLM oraz native speakera.
tl;dv najlepszytl;dv w kategorii dokładności, uzyskując 17-punktową przewagę. Było to jedyne narzędzie, które poprawnie zidentyfikowało nazwy własne we wszystkich trzech spotkaniach i zachowało spójność we wszystkich przebiegach testu. Jeśli chodzi o rozpoznawanie języka rosyjskiego, żadne inne narzędzie nie zbliżyło się do tego wyniku.
Oto wyniki poszczególnych narzędzi w poszczególnych sekcjach, w których je testowaliśmy.
| Poziom | Max | tl;dv | Fireflies | Fathom | HappyScribe |
|---|---|---|---|---|---|
| Transkrypcja i dokładność | 65 | 52/65 | 22/65 | 14/65 | 35/65 |
| Jakość spotkań w rzeczywistych warunkach | 45 | 37/45 | 16/45 | 15/45 | 29/45 |
| Możliwości i funkcje | 72 | 61/72 | 54/72 | 42/72 | 44/72 |
| Zaufanie, bezpieczeństwo i wartość | 18 | 18/18 | 18/18 | 18 grudnia | 18/18 |
| Ogólna ocena | 200 | 168/200 | 110/200 | 83/200 | 126/200 |
| Ranking | 1 | 3 | 4 | 2 |
Dokładność transkrypcji spotkań w języku rosyjskim dała bardziej zróżnicowane wyniki niż nasze poprzednie testy dotyczące języków francuskiego, hiszpańskiego i portugalskiego. Najwyższy wyniktl;dv – 168 punktów, a HappyScribe uplasowało się na drugim miejscu z wynikiem 126 punktów.
Różnice w wynikach również nie były równomierne. W kategorii transkrypcji narzędzie tl;dv najbliższego konkurenta łącznie o 17 punktów, przy czym wyniki w zakresie wykrywania encji znacznie się różniły. Pozostałe narzędzia z tej listy miały największe trudności właśnie z nazwami własnymi.
Rosyjski to język, który potrafi naprawdę uwypuklić drobne błędy w sposób, w jaki nie robi tego angielski. W języku rosyjskim rzeczowniki i przymiotniki mają końcówki przypadkowe, więc nawet pojedynczy błąd w sylabie może zmienić znaczenie zdania – np. kto co zrobił komu – zamiast spowodować bardziej oczywistą literówkę. W rosyjskim języku biznesowym pojawiają się również zapożyczenia z angielskiego w zdaniach zapisanych cyrylicą. Każde z testowanych przez nas narzędzi musiało zdecydować, czy transliterować takie elementy jak nazwy marek, pozostawić je w alfabecie łacińskim, czy po prostu dokonać wyboru na podstawie własnej oceny. Trzy z czterech narzędzi wydawały się zgadywać, a jedno z nich zamieniło nawet szefa samorządu regionalnego w głównego demona.
Aby przeprowadzić nasz test, wybraliśmy trzy rzeczywiste spotkania w języku rosyjskim i poddaliśmy je analizie:
Program spotkania był zróżnicowany i obejmował sesję poświęconą różnicy między wzrostem a rozwojem, panel poświęcony komunikacji korporacyjnej oraz sesję poświęconą rozwojowi miejskiemu w Kazaniu.
W naszych testach zazwyczaj staramy się uwzględnić Google Gemini, ponieważ jest to narzędzie powszechnie stosowane w środowisku pracy, jednak Gemini obsługuje obecnie języka rosyjskiego, dlatego zostało pominięte.
Aby uzyskać jak najbardziej obiektywne wyniki, ocena odbywała się metodą „w ciemno”. Dwa modele LLM oceniały każdą generowaną treść po usunięciu nazw narzędzi, a native speaker języka rosyjskiego sprawdzał fragmenty, z którymi narzędzia miały trudności lub w których wyniki się rozchodziły.
Transkrypcja rozmowy w języku rosyjskim i jej dokładność
W naszych testach największą wagę przywiązujemy do sekcji poświęconej transkrypcji i dokładności, ponieważ wszystko inne wynika właśnie z tego. Na łączną liczbę 65 punktów tl;dv 52, podczas gdy Fathom zaledwie 14.
Zostały one ocenione przez modele LLM (ClaudeAnthropicoraz ChatGPT firmy OpenAI), a następnie zweryfikowane w ramach ślepej oceny przeprowadzonej przez native speakerów, przy czym nazwy narzędzi były ukryte.
| System metryczny | Jak przyznawane są punkty | tl;dv | Fireflies | Fathom | HappyScribe |
|---|---|---|---|---|---|
| Poprawność językowa | Ocena stopnia trudności przez nieświadomego, rodzimego użytkownika języka w odniesieniu do poprawności językowej | 15/20 | 20 lipca | 20 maja | 20 grudnia |
| Obsługa specyficzna dla danego języka | Ortografia cyrylica, końcówki przypadków, interpunkcja, przełączanie kodów językowych | 15/20 | 20 lipca | 20 kwietnia | 20 września |
| Wskaźnik wyraźnie błędnych słów | Odsetek tokenów, które w oczywisty sposób są błędne: sfabrykowane lub nie rosyjskie wstawki oraz pętle powtórzeń | 5/5 | 2/5 | 0/5 | 4/5 |
| Wykrywanie obiektów | Nazwiska, firmy i miejscowości występujące w obsadzie | 5/5 | 1/5 | 0/5 | 2/5 |
| Liczby, daty i waluty | Liczby, daty i kwoty sformatowane poprawnie w danym języku | 4/5 | 2/5 | 2/5 | 3/5 |
| Rozpoznawanie surowych terminów technicznych | Terminy branżowe i skróty przed szkoleniem dostosowanym do potrzeb klienta | 4/5 | 1/5 | 1/5 | 2/5 |
| Interpunkcja i podział na segmenty | Podział na zdania i akapity w wynikach testu | 4/5 | 2/5 | 2/5 | 3/5 |
| Suma częściowa za transkrypcję i dokładność | 52/65 | 22/65 | 14/65 | 35/65 |
Wykrywanie obiektów
Największa rozbieżność w ocenach dotyczyła wykrywania encji. tl;dv 5 na 5 Fathom , a Fathom 0.
Rosyjskie nazwy własne są trudniejsze niż w języku angielskim. Na przykład nazwy marek trzeba transliterować na cyrylicę, a narzędzie nie może po prostu zapisać dosłownie tego, co uchwyciło. Dwa przykłady, w których tl;dv dobrze, a inne narzędzia miały z tym trudności, to poprawne rozpoznanie nazwy „Проктер энд Гэмбл” oraz rozwinięcie skrótu CBD na „Customer Business Development”. Żadne z pozostałych narzędzi nie poradziło sobie z tym zadaniem.
Jednym z największych błędów było tl;dv nazwy marki „Wrike”. tl;dv ją poprawnie. Pozostali trzej opisali produkt mający 30 000 użytkowników, ale w ogóle nie wspomnieli o jego nazwie. Gdyby ktoś przeczytał te transkrypcje i próbował ustalić, jakie narzędzie polecał mówca, nie byłby w stanie znaleźć tej konkretnej informacji.
Podczas sesji w Kazaniu sytuacja ta powtórzyła się w przypadku МЕГА, Баухауз i Проспект Универсиады. tl;dv jedynym narzędziem, które uzyskało maksymalną liczbę punktów w tej serii we wszystkich trzech testach.
Poprawność językowa
Nikt nie uzyskał maksymalnej liczby punktów w tej kategorii, w której maksymalna liczba punktów wynosiła 20, a która odzwierciedla, jaka część spotkania została zachowana w transkrypcji. Najlepszy wyniktl;dv , zdobywając 15 punktów.
Fathom uzyskał Fathom 5 punktów, a ujawniono konkretne błędy, a nie tylko przypadki błędnego zrozumienia. W jednym clip angielskie zdania, które nigdy nie padły, clip stworzył elementy, o których w nagraniu w ogóle nie była mowa. Nasz native speaker stwierdził wprawdzie, że to, co program transkrybował, było sensowne, ale ostatecznie dodał wiele elementów, które w rzeczywistości nie istniały.
Fireflies uzyskał łącznie 7 punktów i wykazał się nieco bardziej niebezpieczną wydajnością. Błędy, które popełnił, dotyczyły rosyjskich słów, poprawnie napisanych, ale umieszczonych w niewłaściwych miejscach. Na przykład przekształcił wyrażenie „главы региона” (szef władz regionalnych) w „главного демона” (głównego demona). W tym samym fragmencie „Проспект Универсиады” stał się „Проспект Грузиады”, co nie jest nazwą ulicy ani w Kazaniu, ani nigdzie indziej.
Oznacza to, że osoba zapoznająca się z Fathom mogłaby z łatwością stwierdzić: „To jest błędne”, podczas gdy Fireflies na pierwszy rzut oka Fireflies bardziej spójne, choć zawierałyby poważne błędy.
Obsługa specyficzna dla danego języka
tl;dv tu również 15 punktów, zajmując czołowe miejsce
Jak już wspomnieliśmy, w rosyjskiej mowie biznesowej zdarzają się przypadki przełączania się na język angielski, które mają miejsce w środku zdania. Każde z narzędzi musiało transkrybować takie fragmenty i ocenić, jak postąpić w takich sytuacjach oraz czy umieścić angielskie słowo w zdaniu zapisanym cyrylicą. Tl;dv Fathom wszystko, co było zapisane alfabetem łacińskim. Fireflies takie fragmenty fonetycznie, np. „вот эвер”, co nasz native speaker uznał za błędne.
Wskaźnik błędów w tekście
tl;dv tutaj 5 punktów, a Fathom ostatnim miejscu z wynikiem 0.
W trakcie naszych testów nie dysponowaliśmy zweryfikowaną, dosłowną transkrypcją wypowiedzi, więc sprawdziliśmy, jak poradziło sobie każde z narzędzi i ile słów było ewidentnie błędnych. Chodziło o takie rzeczy jak znaki spoza alfabetu rosyjskiego, zapętlenia powtórzeń i wszelkie inne nieścisłości. Wyniktl;dvdla pierwszego clip praktycznie nie clip takich błędów. Fathombłąd występował mniej więcej w co ósmym słowie.
Liczby, daty i waluty
W dziedzinie, w której dane muszą być poprawne, bo w przeciwnym razie mogą spowodować poważne błędy na dalszych etapach, tl;dv tutaj najwyższy wynik – 4.
Jednym z największych błędów w tej grupie był błąd serwisu HappyScribe. Prelegent mówił o konkretnym okresie dziesięciu lat (десять лет). Serwis HappyScribe zapisał jednak dziesięć milionów (десять миллионов). Przy pobieżnym przeglądaniu tekstu nie od razu rzucałoby się w oczy, że jest to błąd transkrypcji, ale różnica między dziesięcioma latami a dziesięcioma milionami jest dość znaczna.
W ramach panelu poświęconego komunikacji korporacyjnej wszystkie cztery narzędzia poprawnie wyświetliły wszystkie dane liczbowe. Dotyczyło to zarówno liczb, dat, jak i wartości procentowych.
Termin techniczny: rozpoznawanie surowych danych
tl;dv 4 punkty, HappyScribe – 2, Fireflies , a Fathom .
tl;dv najlepiejtl;dv z żargonem technicznym i terminologią w tym wierszu, bez konieczności wprowadzania własnego słownictwa. Pozostałe narzędzia miały pewne trudności z konkretnym słowem „персонализация” (personalizacja).
HappyScribe usłyszało słowo „реализация” (realizacja lub wdrożenie). Fireflies słowo „кристаллизация” (krystalizacja). Oba są prawdziwymi słowami w języku rosyjskim, ale są również niepoprawne i różnią się od siebie.
Jakość spotkań w praktyce
Dokładność transkrypcji stanowi podstawę całego procesu; jeśli jest ona nieprawidłowa, wszystko, co wynika z niej, narażone jest na problemy.
W tej sekcji przyjrzymy się niektórym dodatkowym elementom transkrypcji, a także jej wynikom oraz temu, jak przydatne mogą one być podczas rzeczywistych spotkań biznesowych i w ramach procesów roboczych.
tl;dv tutaj najwyższą ocenę – 37 punktów, a najniższą ocenę otrzymało Fathom 15 punktów.
| System metryczny | Jak przyznawane są punkty | tl;dv | Fireflies | Fathom | HappyScribe |
|---|---|---|---|---|---|
| Jakość diaryzacji | Zgodność liczby mówców i przypisania kwestii z znaną obsadą | 10/10 | 0/10 | 0/10 | 10/10 |
| Stabilność zachowania | Stabilność zachowań w różnych typach sesji | 9/10 | 3/10 | 1/10 | 5/10 |
| Podsumowanie jakości | Przydatność streszczenia oraz to, czy zachowano je w języku źródłowym, z uwzględnieniem zapożyczeń | 5/5 | 4/5 | 5/5 | 2/5 |
| Częstotliwość występowania halucynacji / wstawek | Tekst wymyślony, zapętlony lub powielony, który nie występuje w nagraniu audio. Nie uwzględniono przypadków błędnego zrozumienia oraz skrótów. | 8/10 | 0/10 | 0/10 | 10/10 |
| Wyodrębnianie działań do wykonania | Jakość zadań i działań następczych wynikających ze spotkania | 0/5 | 5/5 | 5/5 | 0/5 |
| Automatyczne podział na rozdziały / sekcje | Czy streszczenie dzieli spotkanie na przydatne części? | 5/5 | 4/5 | 4/5 | 2/5 |
| Suma częściowa dotycząca jakości spotkań w praktyce | 37/45 | 16/45 | 15/45 | 29/45 |
Podsumowanie jakości
tl;dv Fathom po 5 punktów, Fireflies , a HappyScribe – 2.
Fireflies zmieniły kontekst jednego ze spotkań. W podsumowaniu sesji poświęconej Kazaniu znajduje się sekcja zatytułowana „Градостроительная политика и инновации в Москве” (Polityka urbanistyczna i innowacje w Moskwie). Problem polega na tym, że całe spotkanie dotyczy Kazania, które leży aż 800 km od Moskwy. W treści tej sekcji podsumowującej mowa jest o obszarze położonym „w pobliżu centrum Moskwy”.
HappyScribe również uzyskał niższą ocenę – 2 – ale z innego powodu. Podczas jednego ze spotkań, mimo że program transkrybował przebieg spotkania, nie był w stanie wygenerować streszczenia. Wyświetlił komunikat „Nie wykryto mowy”, mimo że transkrypcja była całkiem zadowalająca.
Jak wspomnieliśmy powyżej, Fathom wypadł w tym zakresie Fathom dobrze. Mimo że program generował angielskie zdania, streszczenie było przejrzyste, na temat i w całości w języku rosyjskim. Żadna z wymyślonych treści nie znalazła się w streszczeniu.
Częstość występowania halucynacji i wstawek
HappyScribe uzyskał 10 punktów, tl;dv , a Fireflies Fathom .
To jedna z nielicznych sekcji, w których tl;dv pierwszego miejsca, a chodziło o fragment, w którym pojawiły się dwie japońskie postacie. Łatwo było to dostrzec i czytelnik z pewnością by to zauważył, ale mimo to była to wstawka.
W dwóch z trzech testów Fireflies kilka znaczących pętli. W jednym z nagrań dwadzieścia cztery razy powtórzył frazę „с людьми” (z ludźmi). Podczas sesji w Kazaniu osiem razy powtórzył frazę „Я не знаю” (nie wiem). Nasz native speaker uznał te powtórzenia za błędy transkrypcyjne.
Fireflies „Продолжение следует” („Ciąg dalszy nastąpi”) po zakończeniu dyskusji. Jest to standardowy napis końcowy, a nie coś, co faktycznie padło w pokoju.
Jakość diaryzacji
tl;dv HappyScribe zdobyły po 10 punktów, a Fireflies Fathom .
Ponieważ testy rdzenia są przeprowadzane jako pojedyncze źródło dźwięku za pośrednictwem Google Meet, w celu oceny tej funkcji przeprowadzamy kolejną serię testów, przesyłając treść bezpośrednio na platformę, aby sprawdzić, jak dobrze potrafi ona identyfikować i oznaczać mówców. Zarówno tl;dv HappyScribe otrzymują tutaj pełną liczbę punktów. Fathom nie Fathom możliwości przesyłania plików audio ani wideo na swoją platformę.
Fireflies ten sam plik audio i nie poradził sobie z zadaniem. W przypadku jednego pliku, w którym występował tylko jeden mówca, program zarejestrował trzech mówców i dwadzieścia dwa razy zmieniał ich przypisanie w ciągu dwudziestu czterech segmentów, często w połowie zdań. W jednym przypadku jedno zdanie zostało przypisane trzem różnym mówcom.
Stabilność behawioralna
tl;dv 9 punktów, HappyScribe – 5, Fireflies , a Fathom .
W tym miejscu przyglądamy się, jak stabilnie narzędzie radzi sobie we wszystkich sesjach. tl;dv największą stabilnością we wszystkich przypadkach, natomiast Fathom największe wahania.
Wyodrębnianie działań
W tej dziedzinie tl;dv nie tl;dv , a istnieje ku temu ważny powód. W każdym ze streszczeń serwisy Fireflies Fathom zadania poszczególnym osobom na podstawie wyników.
tl;dv nie tl;dv tego w żadnym z trzech przebiegów i jest ku temu powód. Nie było żadnych działań, które należałoby odnotować.
Tak więc w przypadkach, gdy Fireflies Fathom zadania do realizacji, tworzyły je z niczego. Były to trzy dyskusje przy okrągłym stole. Nikt nikomu niczego nie zlecił, nikt nie zgodził się na realizację żadnego zadania i nie ustalono żadnych dalszych działań. Nie istniała żadna lista, z której można by wyodrębnić zadania, więc oba narzędzia same ją wygenerowały.
Więc chociaż tl;dv tu żadnego wyniku, potraktujcie to z pewnym dystansem.
Automatyczne podział na rozdziały i sekcje
tl;dv 5 punktów, Fireflies Fathom , a HappyScribe – 2.
tl;dv spójny podział każdego spotkania na ponumerowane sesje tematyczne, przy czym każdy punkt zawierał link do znacznika czasu umożliwiającego weryfikację. Żadne z pozostałych narzędzi nie zapewniało znaczników czasu na tym poziomie, a choć umożliwiały one podział na segmenty, to jakość i liczba tych segmentów różniły się w zależności od narzędzia. W trosce o obiektywność wykorzystaliśmy w każdym przypadku standardowe podsumowanie.
Możliwości i funkcje
W tej sekcji przyjrzymy się narzędziom jako całości, ich funkcjom, a także przedstawimy podstawowe wyniki dotyczące takich obszarów, jak szybkość przetwarzania i dokładność znaczników czasu.
O ile w poprzednich sekcjach skupiono się na ocenie wydajności narzędzia, o tyle w tej sekcji chodzi o to, na ile różnych sposobów dane mogą być wykorzystywane w firmie. Wyniki w tej sekcji są dość wyrównane, a tl;dv pierwsze miejsce z wynikiem 61 punktów, przy 19-punktowej przewadze nad pozostałymi narzędziami.
| System metryczny | Jak przyznawane są punkty | tl;dv | Fireflies | Fathom | HappyScribe |
|---|---|---|---|---|---|
| Automatyczne rozpoznawanie mówców | Automatyczne rozpoznawanie prawdziwych rozmówców w aplikacjach Meet, Zoom i Teams | 5/5 | 5/5 | 5/5 | 0/5 |
| Rozpoznawanie głosu | Możliwość przeprowadzenia treningu rozpoznawania głosu dla własnego głosu użytkownika | 5/5 | 0/5 | 0/5 | 0/5 |
| Nagrywanie bez botów | Nagrywa za pomocą wbudowanego systemu audio bez włączania bota do rozmowy | 5/5 | 5/5 | 5/5 | 5/5 |
| Synchronizacja CRM | Tryb natywny i synchronizacja automatyczna | 3/3 | 3/3 | 3/3 | 0/3 |
| Notatki niestandardowe / szablony | Formaty podsumowań z możliwością dostosowania a stały format wyników | 3/3 | 3/3 | 3/3 | 3/3 |
| Szkolenie w zakresie niestandardowego słownictwa / encji | Nauczaj terminów branżowych i skrótów | 5/5 | 5/5 | 0/5 | 5/5 |
| Lokalizacja rosyjskiego interfejsu użytkownika | Czy sam interfejs produktu jest dostępny w języku rosyjskim | 0/5 | 0/5 | 0/5 | 0/5 |
| Zakres integracji | Slack, kalendarz, Zapier, API | 3/3 | 3/3 | 3/3 | 3/3 |
| Szybkość przetwarzania | Kolejność dostarczenia gotowego protokołu po zakończeniu spotkania | 3/3 | 3/3 | 3/3 | 2/3 |
| Śledzenie słów wypełniających | Śledzi słowa wypełniające bez podwajania z powodu jąkania, zamiast nadmiernego wygładzania transkrypcji | 3/3 | 0/3 | 0/3 | 0/3 |
| Dokładność znacznika czasu | Sprawdź wyrywkowo, czy znaczniki czasu odpowiadają właściwym momentom | 3/3 | 1/3 | 0/3 | 0/3 |
| Dostępność tłumaczeń | Czy potrafi przetłumaczyć notatki ze spotkania i na ile języków? | 3/3 | 0/3 | 0/3 | 3/3 |
| Wyszukaj w transkrypcji | Wyszukiwanie w treści spotkania i w bibliotece | 3/3 | 3/3 | 3/3 | 3/3 |
| Interfejs użytkownika do edycji transkrypcji | Czy można łatwo poprawić transkrypcję po fakcie? | 3/3 | 3/3 | 3/3 | 3/3 |
| Formaty eksportu | SRT, VTT, TXT, DOCX i podobne | 0/3 | 3/3 | 0/3 | 3/3 |
| Transkrypcja na żywo / w czasie rzeczywistym | Czy podczas spotkania wyświetlany jest na żywo zapis rozmowy? | 0/3 | 3/3 | 3/3 | 0/3 |
| Zasięg platformy konferencyjnej | Omówienie usług Zoom, Meet, Teams i Webex | 3/3 | 3/3 | 3/3 | 3/3 |
| Przechwytywanie z aplikacji mobilnej | Czy umożliwia nagrywanie spotkań stacjonarnych za pomocą aplikacji mobilnej? | 3/3 | 3/3 | 0/3 | 3/3 |
| Wbudowany serwer MCP | Własny serwer, umożliwiający asystentom AI przeszukiwanie biblioteki spotkań | 5/5 | 5/5 | 5/5 | 5/5 |
| Edycja etykiet głośników | Czy można zmienić nazwy i przyporządkowanie głośników po zakończeniu konfiguracji? | 3/3 | 3/3 | 3/3 | 3/3 |
| Suma częściowa: możliwości i funkcje | 61/72 | 54/72 | 42/72 | 44/72 |
Odcisk głosu
Rozpoznawanie głosu to funkcja, która – po wyrażeniu zgody przez użytkownika – uczy system rozpoznawania jego głosu, dzięki czemu jest on rozpoznawany podczas wszystkich spotkań bez konieczności ponownego oznaczania. Ocena ta opiera się na tym, czy dana funkcja jest dostępna, a tl;dv jedyną platformą, która ją oferuje.
Śledzenie słów wypełniających
Jednym z powodów, dla których tl;dv tak dobre tl;dv w zakresie transkrypcji, jest to, że narzędzie to oferuje funkcję śledzenia słów wypełniających, a nie ich usuwania. Oznacza to, że narzędzie identyfikuje najbardziej autentyczną wersję transkrypcji, zachowując wahania w mowie zamiast je wygładzać. Chociaż pozostałe trzy narzędzia mogą zapewnić ogólnie bardziej przejrzystą wersję spotkania, w praktyce dokonują one edycji treści spotkania.
Dostępność tłumaczeń
tl;dv HappyScribe uzyskały 3 punkty. Fireflies Fathom 0 punktów.
Udało mi się przejść do transkrypcji w tl;dv HappyScribe, nacisnąć przycisk i przekonwertować rosyjską transkrypcję na angielski. Jest to niezwykle przydatne dla międzynarodowych firm, które organizują spotkania w różnych językach. Fathom , że udało Fathom się to zrobić w przypadku streszczenia, ale nie samej transkrypcji, w związku z czym nie otrzymały one oceny, ponieważ już wcześniej stwierdziliśmy, że występowały rozbieżności między transkrypcją a samym streszczeniem.
Nazywanie głośników „Out of the Box”
tl;dv Fireflies Fathom 5 punktów. HappyScribe uzyskało 0 punktów.
Większość narzędzi potrafi pobierać etykiety z Google Meet, Zoom Teams oraz automatycznie przypisywać je do transkrypcji. HappyScribe tej funkcji nie posiada, więc mówcy są oznaczani jako „ogólne etykiety”, a użytkownik musi następnie samodzielnie wprowadzić ich imiona i nazwiska.
Synchronizacja CRM
HappyScribe to jedyne narzędzie, które nie oferuje natywnej synchronizacji z systemem CRM. Oferuje ono integrację z różnymi rozwiązaniami, ale nie ma bezpośredniego połączenia z systemem CRM.
Można to zrobić za pomocą Zapiera, ale będzie to wymagało dodatkowej konfiguracji i utrzymania przepływu pracy.
Wszystkie trzy pozostałe narzędzia umożliwiają automatyczne przesyłanie notatek bezpośrednio do systemu CRM, co pozwala zaoszczędzić czas, energię i zasoby.
Szybkość przetwarzania
tl;dv Fireflies Fathom 3. HappyScribe uzyskało ocenę 2.
W tej sekcji sprawdzono, jak szybko po zakończeniu spotkania udostępniono transkrypcję i streszczenia. Tl;dv Fathom natychmiast po spotkaniu, a zaraz po nich Fireflies. Spośród wszystkich narzędzi najwięcej czasu zajęło to HappyScribe.
Ta sekcja jest zamknięta
W porównaniu z wynikami uzyskanymi w zakresie czystej dokładności transkrypcji różnice między wynikami były tutaj mniejsze. Każde z narzędzi ma kilka naprawdę dobrych funkcji, w związku z czym wiele aspektów, takich jak nagrywanie bez botów, obsługa różnych platform oraz serwer MCP, jest na równym poziomie.
Te cztery produkty są do siebie podobne pod względem możliwości, ale jeśli chodzi o transkrypcję rosyjską, to rzeczywiste wyniki pokazują, że nie ma między nimi żadnego porównania.
Zaufanie, bezpieczeństwo i wartość
W tej sekcji skupiono się na bezpieczeństwie i wiarygodności poszczególnych platform. Wszystkie przedstawione narzędzia charakteryzują się doskonałymi zabezpieczeniami i ich twórcy doskonale zdają sobie sprawę z obowiązków, jakie spoczywają na nich w 2026 roku w zakresie zapewnienia bezpieczeństwa danych.
tl;dv Fireflies HappyScribe otrzymują maksymalną liczbę punktów, natomiast Fathom punkty w dwóch kategoriach z bardzo konkretnych powodów.
| System metryczny | Jak przyznawane są punkty | tl;dv | Fireflies | Fathom | HappyScribe |
|---|---|---|---|---|---|
| Lokalizacja danych / hosting regionalny | Regionalne opcje hostingu, np. hosting w UE na żądanie | 3/3 | 3/3 | 0/3 | 3/3 |
| Bezpieczeństwo i zgodność z przepisami | SOC2, ISO 27001, RODO | 3/3 | 3/3 | 3/3 | 3/3 |
| Szkolenie modelu AI na podstawie nagrań audio użytkowników | Czy to pozwala uniknąć szkolenia sztucznej inteligencji na Twoich nagraniach audio (brak szkolenia oznacza maksymalną liczbę punktów)? | 3/3 | 3/3 | 0/3 | 3/3 |
| Kontrola przechowywania danych | Kontrola nad okresem przechowywania nagrań i transkrypcji | 3/3 | 3/3 | 3/3 | 3/3 |
| Przejrzystość cen | Ceny planów są publikowane, a nie podawane wyłącznie na zapytanie | 3/3 | 3/3 | 3/3 | 3/3 |
| Pakiet bezpłatny / limity | Dostępność bezpłatnego planu (sama bezpłatna wersja próbna otrzymuje 0 punktów) | 3/3 | 3/3 | 3/3 | 3/3 |
| Suma częściowa: zaufanie, bezpieczeństwo i wartość | 18/18 | 18/18 | 18 grudnia | 18/18 |
Lokalizacja danych i hosting regionalny
tl;dv Fireflies HappyScribe uzyskały po 3 punkty. Fathom 0 punktów.
Jest to pierwsza różnica, w której te trzy narzędzia wyprzedzają Fathom. Ma to dość istotne znaczenie. Klienci mogą wybrać miejsce przechowywania swoich danych, co ma kluczowe znaczenie dla firm z UE oraz tych, które działają w bardzo specyficznych obszarach. Ocena w tym zakresie opiera się na dostępności możliwości wyboru.
W szczególności zespoły z Wielkiej Brytanii i Europy będą miały zobowiązania związane z hostingiem, a wiele firm nie będzie mogło przechowywać danych w określonych lokalizacjach geograficznych.
Fathom w tym zakresie Fathom opcji, a wszystkie jego dane są przechowywane w Stanach Zjednoczonych. Firma oświadcza jednak, że w przypadku dostawców z UE i Wielkiej Brytanii może zapewnić zgodność z RODO i na żądanie podpisze umowę o przetwarzaniu danych (DPA).
Szkolenie w zakresie sztucznej inteligencji na podstawie nagrań audio użytkowników
tl;dv Fireflies HappyScribe uzyskały po 3 punkty. Fathom 0 punktów.
W tej sekcji przyznawane są punkty za to, że sztuczna inteligencja nie jest szkolona na danych klientów. Trzy z czterech narzędzi deklarują, że tak właśnie jest.
Stanowisko Fathomjest bardziej złożone. Jej podwykonawcy zajmujący się sztuczną inteligencją – a mianowicie Anthropic, OpenAI i Google – mają na mocy umów zakaz wykorzystywania danych użytkowników do uczenia modeli. Fathom , że wykorzystuje zanonimizowane dane klientów do ulepszania własnych modeli, a opcja ta jest domyślnie włączona.
Można tę funkcję wyłączyć, a administratorzy zespołów mogą wyłączyć ją dla całej organizacji. Znalazłem ją jednak dopiero po przewinięciu listy ustawień, a znalezienie opcji, którą trzeba odkryć, to coś zupełnie innego niż włączenie opcji, którą trzeba po prostu aktywować.
Test dokładności pomiarów w Rosji: Metodologia
Nasze porównanie opiera się na kontrolowanym teście, w którym porównujemy produkty o identycznych parametrach, tak aby zapewnić każdemu narzędziu takie same warunki.
Zestaw testowy
Aby zapewnić szeroki wachlarz możliwości przeprowadzenia testów, wybrano trzy niepowiązane ze sobą rosyjskie dyskusje przy okrągłym stole. Materiały te pochodziły z publicznie dostępnych nagrań, a wszystkie testy przeprowadzono – w miarę możliwości – w identycznych warunkach.
Pierwszym z nich jest dyskusja biznesowa na temat różnicy między wzrostem a rozwojem, obejmująca strukturę organizacyjną, rotację pracowników oraz ryzyko.
Drugim punktem programu jest panel poświęcony komunikacji korporacyjnej, w którym pojawia się wiele zapożyczeń z języka angielskiego, nazw marek i danych dotyczących liczby użytkowników.
Trzecia część to omówienie zagadnień związanych z rozwojem miejskim, turystyką i rynkiem nieruchomości w Kazaniu, pełne lokalnych nazw miejscowych.
Nagrania trwały około 7 minut, co powinno wystarczyć, by wyodrębnić wyraźny wzorzec i zidentyfikować słabe punkty. Wszystkie urządzenia dołączyły do tej samej Google Meet i nagrywały jednocześnie. Sygnał audio, który odbierały, był identyczny i pochodził z tej samej sytuacji.
W miarę możliwości przeprowadziliśmy również oddzielną operację przesyłania, aby ocenić wiersz dotyczący diarizacji. Był to ten sam plik audio, przesłany bezpośrednio, aby ominąć wywołanie.
Recenzja
W pierwszej kolejności transkrypcje i jakość spotkań oceniano metodą ślepej oceny. Wyniki uzyskane za pomocą poszczególnych narzędzi zostały umieszczone w dokumencie i zanonimizowane za pomocą liter od A do D. Ani modele LLM, ani nasz native speaker nie byli w stanie ustalić, która transkrypcja pochodziła z którego narzędzia.
Przeprowadziliśmy dwa niezależne cykle przetwarzania za pomocą modeli LLM, oceniając wyniki zgodnie z tabelą punktacji. Jeden z nich został zrealizowany przez Claude’a, a drugi przez ChatGPT. Zostały one przeprowadzone w oddzielnych projektach, a modele nie miały wglądu w wyniki siebie nawzajem.
W przypadkach, gdy wyniki obu narzędzi się rozchodziły, opieraliśmy się na tym, które dostarczało więcej dowodów, zamiast obliczać średnią. Oznacza to, że uzgodniona ocena odnosi się do konkretnych wierszy w konkretnych transkrypcjach, a nie do całości.
Następnie poprosiliśmy osobę, dla której rosyjski jest językiem ojczystym, o sprawdzenie wyników, wskazując obszary budzące szczególne trudności oraz miejsca, w których wyniki generowane przez poszczególne narzędzia się różniły. Otrzymała ona linki do oryginalnych nagrań audio w celu porównania. Oznaczenia te posłużyły do weryfikacji wyników generowanych przez modele LLM oraz do przedstawienia konkretnych przykładów, które zauważyłaby osoba posługująca się językiem rosyjskim jako ojczystym.
Kompetencje i poziom zaufania zostały ocenione później, na podstawie dokumentacji dostępnej w momencie przeprowadzania testów. Dane te zostały zweryfikowane bezpośrednio u dostawców, a nie na stronach internetowych podmiotów zewnętrznych.
Zestaw narzędzi
Narzędzia te zostały wybrane z jednego powodu – w swoich materiałach marketingowych producenci twierdzą, że umożliwiają one transkrypcję języka rosyjskiego.
Podział silnika i planu
To właśnie silnik tych narzędzi odpowiada za transkrypcję, a nie zawsze jest on publicznie dostępny. W naszych testach tl;dv ElevenLabs; Fireflies licencji zamiast z gotowych kompilacji, ale nie podaje nazwy dostawcy. Fathom HappyScribe nie ujawniają żadnych informacji na ten temat.| Narzędzie | Silnik bazowy / dostawca | Własne lub na licencji | Typ silnika | Plan |
|---|---|---|---|---|
| tl;dv | ElevenLabs Scribe | Zlicencjonowane, podane do wiadomości publicznej | Dedykowany ASR | Biznes |
| Fireflies | Nie podano | Posiada licencję. Dyrektor generalny Krish Ramineni stwierdził, że firma nigdy nie chciała być dostawcą interfejsów API, a transkrypcja jest jedynie środkiem do osiągnięcia celu, wskazując na zewnętrznych dostawców usług rozpoznawania mowy (ASR). | Zewnętrzny system rozpoznawania mowy (ASR) z warstwą modelu językowego (LLM) nałożoną na niego | Pro |
| Fathom | Nie podano | Nie podano | Nie podano | Bezpłatny |
| HappyScribe | Nie podano | Nie podano | Nie podano | Pakiet Lite |
Zakres i zastrzeżenia
W przypadku żadnej z sesji nagraniowych nie dysponowaliśmy zweryfikowanymi transkrypcjami słowo w słowo. Przetestowaliśmy automatyczne napisy serwisu YouTube jako punkt odniesienia i odrzuciliśmy je: w porównaniu z tymi napisami każde narzędzie osiągnęło wynik powyżej 100% błędów. Transkrypcja odbywała się poprzez bezpośrednie przesłanie pliku, a nie podczas rozmowy na żywo. Fathom nie Fathom opcji przesyłania plików, więc wartość 0 w tym wierszu oznacza brak tej funkcji, a nie niepowodzenie testu. Wszystkie wyniki podane w tym artykule zostały ustalone przed wskazaniem konkretnych narzędzi.Jakie jest najlepsze oprogramowanie do transkrypcji spotkań w języku rosyjskim?
tl;dv najwyższy wynik spośród wszystkich czterech testowanych przez nas narzędzi – 168 na 200 punktów – a decydującym czynnikiem była w tym przypadku raczej dokładność transkrypcji niż sam zakres funkcji. Chociaż wszystkie te narzędzia służą temu samemu celowi, nie wszystkie w równym stopniu radzą sobie z rozpoznawaniem i rejestrowaniem języka rosyjskiego.
Prawdziwą podstawową wadą wielu z tych narzędzi w porównaniu z tl;dv zdolność do wykrywania i poprawnego odzwierciedlania nazw własnych. Rozpoznawanie encji stanowiło największą lukę w tabeli wyników. Nazwy marek, miejsc i akronimy muszą być transkrybowane na cyrylicę. Jeśli narzędzie próbuje je odgadnąć, można otrzymać transkrypcję, która wygląda na poprawną, ale jest niezgodna z faktami.
Ta tendencja utrzymuje się w całej serii. Przeprowadziliśmy ten sam test obejmujący 200 punktów w językach japońskim, hiszpańskim, francuskim, niemieckim, włoskim, portugalskim, szwedzkim i fińskim. Różne języki, różni konkurenci, ale za każdym razem te same kryteria oceny. Jeśli pracujesz w jednym z tych języków, zacznij od niego, a nie od angielskiego punktu odniesienia.
Funkcje opisane w tym artykule można obejść, a tl;dv już większość z nich, ale transkrypcja, w której błędnie podano nazwę klienta, nie jest w stanie tego zrobić. Uruchom tl;dv następnego spotkania w języku rosyjskim – to nic nie kosztuje – i przekonaj się sam, jak lepsza jakość wyników może wpłynąć na całą Twoją dalszą pracę.
Najczęściej zadawane pytania dotyczące transkrypcji spotkań w języku rosyjskim
Jakie jest najdokładniejsze narzędzie do transkrypcji oparte na sztucznej inteligencji dla języka rosyjskiego?
tl;dv najdokładniejsze, uzyskując 52 na 65 punktów za jakość transkrypcji w naszym teście ślepym z 2026 roku. Drugie miejsce zajęło HappyScribe z wynikiem 35 punktów, Fireflies 22, a Fathom . Największa różnica wystąpiła w zakresie wykrywania encji, gdzie tl;dv 5 na 5 punktów, podczas gdy pozostałe narzędzia uzyskały odpowiednio 2, 1 i 0 punktów. To właśnie w rozpoznawaniu nazw własnych rosyjskie narzędzia do transkrypcji wyróżniają się na tle konkurencji.
Które asystenty do prowadzenia spotkań oparte na sztucznej inteligencji obsługują język rosyjski?
tl;dv Fireflies Fathom HappyScribe generują transkrypcje w języku rosyjskim. Żadna z tych czterech tl;dv nie oferuje interfejsu w języku rosyjskim, więc elementy związane z transkrypcją pozostają w języku angielskim. Google Gemini w ogóle Gemini transkrypcji spotkań w języku rosyjskim. Gemini osiem języków: angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski i hiszpański.
Dlaczego narzędzia do transkrypcji oparte na sztucznej inteligencji popełniają błędy w języku rosyjskim?
Modele transkrypcji mogą wstawiać gotowe frazy, gdy dźwięk cichnie lub pojawiają się zakłócenia, zamiast nie zwracać żadnego wyniku. W naszym teście z 2026 roku Fathom napis końcowy z listą twórców, który nie pojawia się w żadnym miejscu nagrania. Fireflies „Продолжение следует” – standardowy napis końcowy. Oba są wzorcami tekstowymi szeroko opisywanymi w modelach trenowanych na materiałach wideo z napisami.
Jak dokładna jest transkrypcja oparta na sztucznej inteligencji w języku rosyjskim w porównaniu z językiem angielskim?
Dokładność w języku rosyjskim wykazuje znacznie większe wahania, niż sugerują opublikowane wyniki testów porównawczych dla języka angielskiego. W naszym teście z 2026 roku cztery narzędzia uzyskały wyniki od 14 do 52 na 65 punktów w oparciu o te same trzy spotkania. Błędy nie były drobnymi pomyłkami. Obejmowały one zmyślone zdania w języku angielskim, frazę powtórzoną dwadzieścia cztery razy oraz zapis „dziesięć lat” jako „dziesięć milionów”.
Czy systemy do sporządzania notatek oparte na sztucznej inteligencji radzą sobie z językiem rosyjskim i angielskim podczas tego samego spotkania?
Wszystkie cztery narzędzia, które przetestowaliśmy w 2026 roku, transkrybują rosyjski z przełączaniem kodów językowych, dając mieszane wyniki. tl;dv Fathom angielskie słowo „whatever” w alfabecie łacińskim. Fireflies je fonetycznie jako „вот эвер”, co nasz rodzimy użytkownik języka uznał za błędne. Transliteracja spowodowała więcej szkód niż samo przełączanie kodów. Tylko tl;dv poprawnie tl;dv „Проктер энд Гэмбл” i „CBD”.



