
ясно, что я упустил ещё много слов, но я просто продемонстрировал возможный вариант работы алгоритма.
Ну и в самом конце можно всё пропустить через какие-либо логические(грамматические) анализаторы вроде вордовского детектора ошибок, чтобы отсеять совсем смешные варианты.
Затем(в самом конце) попытаться применить к тексту частотный анализатор, уже букв.