Podczas przepisywania rozmowy z pliku audio bardzo szybko okazuje się, że najwięcej trudności nie wynika z samego pisania, lecz z konieczności właściwego odczytania tego, co de fakto zostało powiedziane. Nagranie może zawierać dłuższe przerwy, zmiany tematu, poprawianie własnych wypowiedzi lub fragmenty wypowiadane bardzo cicho. Transkrypcja nagrań wymaga więc jednoczesnego słuchania i zapisywania informacji w sposób uporządkowany.
Przy prostych rozmowach wystarcza zwykle rozpoznanie kolejnych wypowiedzi, jednakże przy bardziej złożonym materiale dochodzi identyfikacja osób, administrowanie kolejności a także zaznaczanie miejsc, których nie można jednoznacznie odczytać. Ważne jest także rozróżnienie pośród zapisem dosłownym a tekstem po redakcji. W pierwszym przypadku pozostawia się naturalne cechy mowy, tj. powtórzenia czy niedokończone zdania. W drugim można ograniczyć elementy utrudniające lekturę, jednak każda ingerencja w tekst powinna mieć dany cel i nie może prowadzić do zmiany znaczenia wypowiedzi.
Duże znaczenie ma jakość samego nagrania. Plik zarejestrowany w cichym pomieszczeniu daje zupełnie inne sposobów niż materiał pochodzący z miejsca, w którym słychać ruch uliczny, pracujące urządzenia lub kilka rozmów prowadzonych jednocześnie. Problematyczne bywają także nagrania z telefonu, gdy urządzenie znajduje się daleko od osoby mówiącej. W takich ustaleniach pojedyncze słowa mogą być skomplikowane do rozpoznania, a próba odtworzenia ich jedynie na podstawie kontekstu prowadzi do ryzyka błędu. W praktyce dużo lepiej pozostawić oznaczenie niezrozumiałego fragmentu niż wpisać słowo, które tylko może się wydawać prawdopodobne. Przy dłuższych materiałach przydaje się też oznaczanie czasu nagrania. Pozwala ono szybko wrócić do dokładnie sprecyzowanej wypowiedzi i porównać zapis z oryginalnym plikiem. Ma to znaczenie w szczególności wtedy, gdy dokument będzie analizowany przez osoby, które nie uczestniczyły w rozmowie.
W materiałach związanych z postępowaniem prawnym sposób opracowania zapisu może posiadać dodatkowe znaczenie. Transkrypcja do sądu powinna przedstawiać tekst nagrania w sposób czytelny, ale bez swobodnego interpretowania wypowiedzi uczestników. Nie należy poprawiać sensu zdania wyłącznie dlatego, że rozmówca użył błędnej formy językowej albo przerwał wypowiedź w połowie (sprawdź:transkrypcje cennik). O ile na nagraniu występuje kilka osób, niezbędne jest konsekwentne oznaczanie ich wypowiedzi. Jeszcze trudniejsza sytuacja pojawia się przy mówieniu jednoczesnym, ponieważ wtedy nie za każdym razem da się ustalić pełną treść obu wypowiedzi. W takiej sytuacji warto podkreślić nakładanie się głosów, zamiast tworzyć pozornie kompletny zapis. Znaczenie mogą mieć też dłuższe pauzy, śmiech, podniesiony głos czy odgłosy wskazujące na reakcję uczestników, jeśli są wyraźnie słyszalne i istotne dla przebiegu rozmowy.
W współzależności od celu dokumentu używa się różnorodne sposoby przedstawiania materiału. Stenogram może być przygotowany w formie bardzo zbliżonej do rzeczywistego przebiegu rozmowy, z zachowaniem kolejności wypowiedzi i charakterystycznych elementów mowy. Przy innych zastosowaniach tekst może zostać uporządkowany tak, aby łatwiej było znaleźć konkretne informacje, bez zmieniania ich znaczenia. W obu przypadkach znacząca pozostaje konsekwencja przy stosowaniu oznaczeń oraz dokładne sprawdzanie nazwisk, dat, liczb i nazw własnych. To właśnie takie detale są podatne na pomyłki, szczególnie gdy dźwięk jest niewyraźny albo rozmówca posługuje się niewiele znanym określeniem. Przy pracy z nagraniem warto także pamiętać, że tekst nie oddaje wszystkich cech komunikacji ustnej. Nie każdą intonację czy emocję można niedwuznacznie opisać, dlatego zapis powinien oddzielać to, co de facto wynika z nagrania, od interpretacji osoby przygotowującej dokument.
Zobacz: stenogram.