




О Гугле, Яндексе и нильских крокодилах |
Cообщение скрыто для удобства комментирования.
Прочитать сообщение
Всё, что сказано для версии B, справедливо и тут. Однако есть два новых и крайне важных момента:
Про алгоритм цепей Маркова все наслышаны. Вкратце он таков:
Берётся достаточно большой текст с единой стилистикой, килобайт на 200-300 минимально (да и мегабайта много не будет- посему нужен производительный сервер). И разбивается на последовательность слов в предложениях- от двух до пяти (это будет порядок цепи Маркова). Скажем, фраза "Чёрная барсетка терлась о штаны" при работе по алгоритму Маркова второго порядка даст целых четыре словосочетания:
1.) чёрная барсетка
2.) барсетка терлась
3.) терлась о
4.) о штаны
Помимо такого набора, алгоритм Маркова нуждается и в полном списке уникальных слов. Это просто- бъем весь текст на слова, отбираем уникальные, и делаем из них массив. Он получится достаточно большим.
Теперь сопоставляем массиву уникальных слов те словосочетания, взятые из предыдущего шага, первое слово в которых равно уникальному. Это порождает двумерный массив. И, как несложно понять, большинству уникальных слов будет соответствовать несколько словосочетаний, в которых оно используется.
Теперь, если ткнуть наугад в любое слово, и наугад же выбрать любую фразу, ему сопоставленную, да записать фразу на бумаге, то последнее слово тоже будет иметь набор сопоставлений. Совершенно произвольно выбираем любое из словосочетаний этого набора, и зацикливаемся. Не забывая оформлять текст в предложения неравной длины, снабжая их вразумительной пунктуацией и прочими знаками препинания.
В качестве ноу-хау при синтезе контента динамически варьируем порядок цепи Маркова (пусть он будет тем выше, чем больше вариантов в подборке сопоставления). Ну и подмешиваем в текст кейворды, памятуя, что они обычно являются существительными, и должны идти за определёнными предлогами (своими для русского и английского языков). Не забываем также, что если кейворд многословный, то в реальном тексте он никогда не встречается в единственном написании- слова меняются местами и используются в разном сочетании между собой. Так что делаем и это.
Результат можно наблюдать тут (вставленные кейворды подсвечены):
В качестве исходного материала для синтеза контента по алгоритму цепей Маркова пятого порядка использован очень коротенький текстик Стандартной Общественной Лицензии, конечно же, не позволяющий творить вразумительный вторичный текст, но, тем не менее, достаточный для организации демки:
Предвосхищая вопросы, хочется подчеркнуть, что концепция точечных баз тут употребима в полной мере. Более того, для каждой точечной базы можно назначить не только набор кейвордов и таргетинговую страницу, но и собственный исходный текст, на основе которого цепями Маркова и будет генериться контент для виртуальных страниц в рамках этой точечной базы.
Зачем это может понадобиться, интуитивно понятно. Когда к данным кейвордам прилагается текст, кейвордам полностью релевантный, получаемый на выходе результат наиболее полно соответствует ожиданиям поисковика. Сотворённый набор доров ляжет под реальные запросы без зазора.
К примеру:
И в заключение две традиционных кнопки:
| Комментировать | « Пред. запись — К дневнику — След. запись » | Страницы: [1] [Новые] |