Я обычно делаю иначе: отдельно хранится контент -- и отдельно поисковый индекс. Простейший вариант таков:
1. Таблица всех слов (id и текст слова).
2. Индекс использования (id слова и ссылка на документ, обычно тоже некоторый идентификатор)
Это не самый оптимальный вариант, но хорошо переносится на любые реляционные БД.
Таблицы будут суть сложнее если планируется выполнять поточное переиндексирование сайта с сохранением функций поисковой машины на время построения нового индекса.
(что-то мы от темы ушли...

)