Сообщество / ИИ

whisper на vps без облака, хватит ли heka на час записи

D
dasha_voice
Junior
Сообщения: 12
Репутация: 4
Дата регистрации:
08.09.2026
АВТОР ТЕМЫ08 сент. 2026 г., 21:58 (GMT+3)
Здравствуйте. Я журналистка, расшифровываю интервью — сейчас гоняю их в облачные сервисы, но часть материала такая, что мне бы очень не хотелось, чтобы она куда-то уезжала. Подумала поднять whisper на своём сервере.
Я не ML-инженер, поэтому по-простому: часовое интервью, русская речь, обычный диктофон (не звонки колл-центра, качество нормальное). Хватит ли Heka на такое, или расшифровка часа будет идти полночи? И какую модель whisper реально брать, а то там их целый зоопарк.
0
masha_spb
Junior
Сообщения: 77
Репутация: 55
Дата регистрации:
11.08.2026
08 сент. 2026 г., 22:24 (GMT+3)
dasha_voice привет, тема хорошая и правильная — как раз то, ради чего вообще стоит свой сервер: материал не уезжает. По делу: whisper на cpu живёт, но модель large будет медленной. Для русской речи хорошего качества берите faster-whisper (это оптимизированная реализация) с моделью medium или large-v3 в int8 — faster-whisper на cpu в разы бодрее обычного openai-whisper. Час записи на Heka medium'ом посчитает примерно за полчаса-час, large подольше. Ночь это не займёт, но и не «в реалтайме». gleb_tomsk сейчас придёт с точными цифрами по памяти)
0
gleb_tomsk
Junior
Сообщения: 54
Репутация: 35
Дата регистрации:
21.08.2026
08 сент. 2026 г., 22:47 (GMT+3)
masha_spb уже иду) dasha_voice прикидка, не стенд, cpu без gpu:

  • faster-whisper medium int8 — ест ~2-3 гб, на Heka идёт спокойно, час аудио считает примерно за 30-50 минут
  • large-v3 int8 — ~4-5 гб, качество заметно лучше на именах и терминах, но час аудио будет ближе к часу-полутора счёта

для интервью на русском я бы взял large-v3 int8: имена собственные и термины medium иногда мажет, а вам их потом руками править. на Heka влезет, если рядом не крутить ещё оламу одновременно. gpu вам не нужен, это не картинки.
1
tema_py
Junior
Сообщения: 58
Репутация: 42
Дата регистрации:
18.08.2026
08 сент. 2026 г., 23:10 (GMT+3)
dasha_voice если что, faster-whisper заворачивается в маленький скрипт на 20 строк, я такое делал для голосовых из телеги. кидаешь файл — получаешь txt с таймкодами. могу накидать минималку, если руки не доходят с нуля. только не гоняй через веб-обёртки какие попало, они любят «а давайте в облачко для скорости», вам как раз этого не надо)
1
D
dasha_voice
Junior
Сообщения: 12
Репутация: 4
Дата регистрации:
08.09.2026
08 сент. 2026 г., 23:31 (GMT+3)
Ой, спасибо, вы быстрые) masha_spb про faster-whisper поняла, а то я как раз на обычный whisper смотрела и пугалась скорости. gleb_tomsk large-v3 int8 — записала, качество на именах мне критично, интервью же. tema_py за минималку буду благодарна, с нуля я точно закопаюсь. Возьму Heka тогда, раз влезает.
0
tema_py
Junior
Сообщения: 58
Репутация: 42
Дата регистрации:
18.08.2026
09 сент. 2026 г., 22:30 (GMT+3)
dasha_voice скинул минималку в личку по faster-whisper, но продублирую суть тут для гуглящих: берёшь файл, WhisperModel("large-v3", compute_type="int8"), transcribe с vad_filter=True (режет паузы, быстрее). на выходе сегменты с таймкодами. 20 строк, без облака. vad_filter реально ускоряет на интервью, там пауз много.
0
D
dasha_voice
Junior
Сообщения: 12
Репутация: 4
Дата регистрации:
08.09.2026
10 сент. 2026 г., 11:15 (GMT+3)
tema_py спасибо, запустила! Час интервью посчитался минут за сорок, качество на именах приятно удивило, large-v3 их правда держит. vad_filter включила — стало ощутимо бодрее, ты прав про паузы. Теперь у меня расшифровки лежат у меня, а не в чужом облаке, ради этого и затевала))
0
gleb_tomsk
Junior
Сообщения: 54
Репутация: 35
Дата регистрации:
21.08.2026
10 сент. 2026 г., 19:20 (GMT+3)
dasha_voice раз работает — на будущее: если захочешь партию файлов за ночь, ставь их в очередь по одному, а не разом, иначе на Heka память кончится (whisper + если рядом олама). по одному — и к утру пачка готова. compute_type int8 правильно взяла, float16 на cpu смысла не имеет.
0
D
dasha_voice
Junior
Сообщения: 12
Репутация: 4
Дата регистрации:
08.09.2026
12 сент. 2026 г., 20:50 (GMT+3)
gleb_tomsk уже поняла это на практике)) запустила два файла разом «чтоб быстрее» — оба поползли и память в потолок. Сделала по очереди скриптом — идёт ровно. За ночь три интервью перемолол спокойно. Спасибо, что предупредил, а то я по привычке «давай всё сразу».
1