Master-X
Регистрация
|
Вход
Форум
|
Новости
|
Статьи
Главная
»
Форум
»
Реклама, Объявления
»
Тема:
A-Parser - продвинутый парсер ПС, PR, WS, более 35 парсеров!
Новая тема
Ответить
цитата
21/05/26 в 19:19
A-Parser Support
Сборник рецептов #65: проверка DMCA в Google выдаче, парсинг Wayback Machine и Steam Market
65-й сборник рецептов, в котором представлены парсер для проверки запросов DMCA в Google выдаче, парсер сохранённых страниц Wayback Machine и парсер Steam Market.
Проверка запросов DMCA в Google выдаче
Парсер проверяет наличие DMCA-уведомлений внизу выдачи Google. В качестве запросов можно указывать любые поисковые запросы, которые возможны в браузере: домены, операторы Google, обычные ключевые слова и другие варианты. Подходит для быстрой проверки, есть ли по запросу ограничения или жалобы DMCA в поисковой выдаче.
Парсинг Wayback Machine
Парсер веб-архива собирает данные о сохранённых страницах из WebArchive / Wayback Machine. Можно задать начальный и конечный год парсинга, а в результате получить список архивных копий страниц с датой сохранения, ссылкой на архивную версию, исходным URL и заголовком страницы.
Парсер Steam Market
Парсер Steam Market собирает данные из поиска торговой площадки Steam. В качестве запросов принимает ключевые слова, например case или ak 47. В результатах доступны название товара, название игры, изображение, количество и цена.
Еще больше различных рецептов в нашем
Каталоге
!
Предлагайте ваши идеи для новых парсеров
здесь
, лучшие будут реализованы и опубликованы.
Подписывайтесь на
наш канал на Youtube
- там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в
X
.
Все сборники рецептов
Последний раз редактировалось: A-Parser Support (
18/06/26 в 06:07
), всего редактировалось 2 раз(а)
цитата
29/05/26 в 11:43
A-Parser Support
1.2.3390 - полное восстановление работы SE::Google, новый docker образ aparser/runtime:headful
Улучшения
Полностью восстановлена работа парсера
SE::Google
под Linux и Windows
В
SE::Google
добавлена опция
Write Google timeout HTML
(по умолчанию отключена)
В
SE::Bing::Translator
актуализирован список языков
В
Net::Whois
добавлена поддержка домена
.us.com
В
Util::Turnstile
добавлена поддержка сервиса разгадывания BotLab
Добавлен docker образ
aparser/runtime:headful
- помогает увеличить скорость парсинга в
SE::Google
Исправления в связи с изменениями в выдаче
В
SE::Google
исправлены некоторые ошибки парсинга (включая timeout ошибки), возникающие из-за изменений в верстке
В
Reddit:: PostInfo
исправлен сбор комментариев к публикациям
В
SE::Yandex:: Direct
исправлен сбор
$domain
,
$title
,
$text
В
SE::Yandex::WordStat
исправлен сбор частотности, а так же разгадывание смарт-каптчи
Исправления
В
SE::Google
исправлено закрытие браузера
В
SE::Bing::Translator
исправлено отсутствие списка поддерживаемых языков для параметров
From language
и
To language
В
FreeAI:: Perplexity
исправлена работа функции
New attempt when match
для языков, отличных от английского
цитата
18/06/26 в 06:08
A-Parser Support
Дайджест A-Parser: обновление дополнительных парсеров
Дайджест A-Parser: обновление дополнительных парсеров
Внешние сервисы регулярно изменяют структуру страниц, форматы выдачи, механизмы авторизации и способы загрузки данных. Мы отслеживаем такие изменения и вносим необходимые доработки, чтобы вы могли продолжать использовать парсеры в своих рабочих процессах.
Парсер SimilarWeb
Обновление парсера для сбора данных SimilarWeb
Восстановлена корректная работа парсера
Модуль обхода защиты переработан с Puppeteer на Playwright
Улучшена совместимость с текущими механизмами защиты SimilarWeb
Парсер JS::MailValidator
Обновление парсера для проверки email-адресов
Исправлена проверка почты в Outlook/Hotmail, Mail.ru, Яндексе, Рамблере
Добавлена поддержка Yahoo через Puppeteer
Добавлена поддержка AOL через Puppeteer
Добавлен домен hotamil.com
Парсер expireddomains.net
Обновление парсера для сбора данных об удаленных доменах
Пресет полностью переписан на JS-парсер
Учтена новая обязательная авторизация с MFA
Реализована загрузка данных таблицы через XHR-запросы
Обновлен набор колонок: убрана ALEXA, добавлены WBY, MMGR и List
Парсер постов из X (Twitter)
Обновление парсера для сбора постов из X
Исправлена совместимость с новой структурой X API
Исправлена обработка аккаунтов с promoted content
Исправлена работа с курсорами пагинации
Улучшен экспорт Post ID в Excel для корректного отображения длинных идентификаторов
Парсер всех видео с YouTube-канала
Обновление парсера для сбора видео с YouTube-каналов
Добавлена совместимость с новым форматом YouTube lockupViewModel
Исправлена обработка ytcfg для каналов с нестандартной структурой
Исправлено получение длительности видео
Добавлен сбор описаний видео
Переработана архитектура для параллельной обработки роликов
Если вы хотите, чтобы мы более подробно раскрыли какой-то функционал парсера, у вас есть идеи для новых статей или вы желаете поделиться собственным опытом использования A-Parser — отписывайтесь
здесь
.
Подписывайтесь на
наш канал на Youtube
- там регулярно выкладываются видео с примерами использования A-Parser, а также следите за новостями в
X
.
цитата
27/07/26 в 19:39
A-Parser Support
NextGen UI — новый интерфейс A-Parser
В новом обновлении мы завершили переход на NextGen UI — теперь он используется по умолчанию в версиях A-Parser для Windows и Linux.
Интерфейс полностью переписан с нуля на новой архитектуре, работает в браузере и в формате Desktop-приложения, поддерживает тёмную тему и сохраняет привычные возможности A-Parser.
С момента первой тестовой версии NextGen UI получил множество крупных улучшений: расширенную работу с логами, встроенные инструменты тестирования и отладки, улучшенное управление заданиями и пресетами, планировщик, групповые операции и автоматическое восстановление после сбоев.
Основные возможности NextGen UI
Расширенная работа с логами.
Доступны поиск, фильтрация, выделение, копирование и скачивание записей. Логи отображаются непосредственно при тестировании задания в редакторе, а отладочный вывод можно быстро включать и отключать.
Наглядная отладка.
JS-дампы, HTTP-запросы и ответы отображаются в виде раскрываемых JSON-деревьев, изображения выводятся прямо в логах. Для регулярных выражений добавлен быстрый переход во встроенный Тестер регулярок.
Улучшенный Parser Test.
Настроенный в тестере парсер можно перенести непосредственно в редактор задания. При замене парсера предлагается сохранить совместимые переопределённые настройки.
Информативная очередь заданий.
В очереди отображаются используемый пресет, настройки парсера, точное время запуска и расчётное время до завершения. Добавлены массовое выделение заданий и групповые действия.
Удобное управление пресетами.
Пресеты можно переименовывать, искать и сортировать. При импорте пресет сначала открывается в редакторе, где его можно проверить и изменить перед сохранением. Для действий «по завершении» добавлены отдельные поля выбора пресетов заданий и конфигураций потоков.
Встроенные инструменты.
В NextGen UI доступны планировщик заданий, Тестер регулярных выражений, редактор tools.js, расширенные настройки и диалог API-запроса с редактором кода.
Сохранение рабочего состояния.
Интерфейс запоминает открытые разделы, выбранные вкладки, страницы очереди, прокрутку, положение и размер окон, а также состояние редактора JS-парсеров.
Обновлённая тёмная тема.
Переработана цветовая схема, повышена контрастность и улучшены визуальные акценты в редакторе заданий.
Работа с большими объёмами данных.
Ускорена загрузка логов, снижена нагрузка на диск, большие списки файлов подгружаются постепенно по кнопке «Загрузить ещё».
Автоматическое обслуживание.
Хост и порт ядра настраиваются через интерфейс, свободный порт подбирается автоматически. После сбоя ядро перезагружается, а после обновления A-Parser автоматически перезапускается.
Полностью восстановлена работа SE::Google
Вторым ключевым изменением обновления стало полное восстановление работы парсера
SE::Google
.
В последние недели Google последовательно усиливал защиту и менял механизмы формирования выдачи, из-за чего сбор результатов стал заметно сложнее. Работа над адаптацией парсера велась практически непрерывно.
В результате:
полностью восстановлена работа
SE::Google
в режиме Browser на Windows и Linux для профилей desktop и mobile;
полностью восстановлена работа HTTP-режима на всех платформах и профилях;
улучшена работа с пагинацией;
добавлено определение неполной выдачи — одной из разновидностей защиты Google;
добавлено определение новой капчи «Verifying your request»;
исправлено смешивание браузерных заданий при работе через Redis API;
восстановлена работа
SE::Google::Images
;
исправлена работа
SE::Google::Translate
в режиме desktop;
восстановлен сбор отзывов в
Maps::Google::Reviews
;
исправлен вывод общего количества отзывов
$totalcount
;
исправлен сбор переменной
$claim
в
Maps::Google
;
добавлен сбор общего рейтинга организации
$avgrating
.
Новый парсер SE::Rutube
Добавлен новый парсер
SE::Rutube
для сбора результатов поиска видео на Rutube.
Улучшения
Net::Whois
- добавлена работа через серверы RDAP и переменная
$rdapserver
. Добавлена поддержка доменных зон `.gr` и `.ελ`.
Shop::Wildberries::ProductInfo
- добавлен сбор цены с кошельком WB в переменную
$walletPrice
.
Util::Turnstile
- добавлена возможность обработки Cloudflare Turnstile через XEvil.
Telegram::GroupScraper
- добавлены новые переменные и массивы, фильтр по дате и возможность пропускать пересланные сообщения.
Social::TikTok::Profile
- парсер переведён на Puppeteer для обхода блокировки HTTP-запросов со стороны Akamai; восстановлен сбор ссылок на подписки.
FreeAI::Kimi
- восстановлена работа и добавлена авторизация через Bearer token.
SE::Brave
- добавлена обработка капчи.
Исправления в связи с изменениями на источниках
SE::Bing
- исправлен парсинг в режимах Browser и HTTP.
SE::You
- восстановлена работа парсера.
SE::Startpage
- восстановлена работа основной выдачи.
SE::Startpage::Videos
и
SE::Startpage::Images
- восстановлена работа парсеров.
SE::DuckDuckGo
и
SE::DuckDuckGo::Images
- восстановлена работа парсеров.
Social::Instagram::Search
- восстановлена работа, исправлена ошибка 403 Forbidden.
Social::Instagram::Tag
- устранены дубли публикаций в результатах.
Social::Instagram::Profile
- восстановлена работа и исправлена смена прокси при сборе подписчиков.
Shop::Wildberries::ProductsList
- восстановлена работа и исправлен нестабильный сбор данных.
Shop::Wildberries::ProductInfo
- восстановлена работа и исправлены ошибки на отдельных запросах.
Shop::Amazon
- исправлен сбор части результатов.
SecurityTrails::Domain
- восстановлен обход Cloudflare.
Util::Turnstile
- исправлена работа в режимах Browser и Auto.
Net::Whois
- исправлена работа с зонами `.direct`, `.insure`, `.global`, `.services`, `.travel` и `.co`.
FreeAI::ChatGPT
- исправлен парсинг списков.
FreeAI::Perplexity
,
FreeAI::DeepAI
и
DeepL::Translator
- восстановлена работа.
Cloudflare::Radar
,
CoinMarketCap::LastPrice
и
Rank::Mustat
- восстановлена работа.
цитата
04/08/26 в 11:59
A-Parser Support
Какие сайты получают видимость в ChatGPT и Perplexity — и можно ли судить об этом по одному ручному запросу?
Мы закончили большое исследование источников в ответах ChatGPT и Perplexity. Нас интересовали не отдельные удачные скриншоты, а системная картина: какие домены появляются в ответах ИИ, насколько различаются две системы и что происходит со списком источников при смене страны и прокси.
Для эксперимента собрали и проанализировали
17 873 источника
по 12 слот-играм, 6 коммерческим интентам и 4 странам. Запросы запускались через резидентские прокси целевых стран и смешанный прокси-пул, а ссылки нормализовались и дедуплицировались по паре query + URL.
Уже на первом сравнении стало понятно, почему единичной ручной проверки недостаточно. После нормализации у ChatGPT было 1 223 домена, у Perplexity — 2 019, а общими оказались только
450 доменов
. Коэффициент сходства между системами составил всего
16,12%
. ChatGPT чаще выводил официальных провайдеров и Reddit, а Perplexity — классические аффилейт-обзорники.
Но количество цитирований оказалось только половиной картины.
В ChatGPT сайт Pragmatic Play лидировал по общей частоте — 303 цитирования. При этом только 23,1% его ссылок вошли в Top-3.
У Reddit было меньше цитирований — 182, зато
68,7% ссылок
оказались в первой тройке сохранённого списка источников.
Получается, лидер по числу ссылок и лидер по заметности — не обязательно один и тот же домен.
Отдельно проверили влияние IP. В контрольном тесте из запросов убрали название страны и отправляли одинаковые англоязычные вопросы через резидентские прокси Новой Зеландии, Бразилии, Мексики и Казахстана.
Даже без географических подсказок в тексте пересечение доменов у ChatGPT составило только
16,28%
. То есть один запрос с одного IP показывает лишь конкретный срез, а не устойчивую картину видимости.
Именно здесь разовая выгрузка превращается в задачу для регулярного мониторинга: кто удерживается в источниках, кто появляется впервые, кто выпадает и как меняется доля Top-3 по странам и режимам прокси.
A-Parser позволяет поставить такой сбор по расписанию и получать данные в одинаковом формате без ручного копирования ответов.
В полной теме:
методика эксперимента и формула запросов;
сравнение ChatGPT и Perplexity;
страновые срезы и влияние разных режимов прокси;
анализ числа цитирований, средней позиции в массиве источников и доли Top-3;
открытый датасет основного сбора и контрольного теста;
готовые пресеты для ChatGPT и Perplexity, чтобы повторить сбор на своей нише.
Открыть исследование, посмотреть результаты и скачать материалы
Если уже проверяли видимость своих сайтов или конкурентов в ответах ИИ, интересно сравнить опыт: насколько сильно у вас меняется набор источников между ChatGPT, Perplexity и разными GEO?
цитата
10/08/26 в 23:42
A-Parser Support
В каких нишах небольшие каналы выигрывают в выдаче YouTube — и почему высокий ранг не гарантирует просмотры?
Представьте парадокс: видео автора с 700 подписчиками забирает 2,7 миллиона просмотров и 3-е место в поисковой выдаче YouTube по iPhone, а в финансовых темах — крипте и дропшиппинге — ни одно из 59 видео небольших каналов не преодолевает планку в 20 000 просмотров. При этом в обзорах криптобирж авторы небольших каналов занимают каждый третий ролик в ТОП-10: 45 из 136, или 33,09%.
Чтобы выяснить, где алгоритмы дают реальный охват, а где ранжирование оказывается «холостым», мы провели исследование выдачи с помощью A-Parser. Для эксперимента собрали
34 070 строк поисковой выдачи YouTube
по 28 темам и 343 подсказкам, сведя датасет к 21 537 уникальным видео.
Главное открытие: высокий ранг в поиске и реальные просмотры — это две разные задачи.
Визуальные ниши дают шанс малым авторам:
В распаковках гаджетов, фитнесе, DIY и коротких роликах с демонстрацией AI-инструментов доля прорывных видео от небольших каналов (от 100 до 10 000 подписчиков, набравших от 20 000 просмотров и превысивших число подписчиков в 10+ раз) достигала
23,15%
от уникальных видео в ТОП-10.
Коммерческие ниши дают позиции, но не дают просмотров:
В темах криптобирж, ботов и дропшиппинга малые каналы формировали 33–35% результатов в ТОП-10, но
ни один из 59 роликов не достиг 20 000 просмотров
. Позиция в поиске есть, а просмотров нет.
Один ролик закрывает сразу кластер подсказок:
22,38% видео появлялись минимум по двум поисковым подсказкам, а отдельные ролики-лидеры ранжировались сразу по
21 подсказке
.
A-Parser позволяет превратить этот процесс из ручного просмотра сотен запросов в регулярный автоматизированный мониторинг ниши с помощью 3-шаговой цепочки:
SE::YouTube::Suggest ➔ SE::YouTube ➔ SE::YouTube::Video
.
В полной теме:
подробная методика эксперимента и структура датасета на 34 070 строк;
4 фильтра для поиска прорывных видео небольших авторов;
разбор 3 групп тем (визуальные, коммерческие, с ограничениями фильтрации);
анализ тегов и модификаторов заголовков для составления ТЗ на контент;
открытый CSV-датасет и готовый пресет A-Parser для повторения исследования.
Открыть исследование, посмотреть результаты и скачать материалы
Если вы уже анализировали выдачу YouTube в своих нишах — поделитесь опытом: в каких тематиках вам чаще попадаются выстрелившие микро-каналы, а где первые места намертво закрепились за гигантами?
цитата
25/08/26 в 13:46
A-Parser Support
Как выгрузить архив сайта из Wayback Machine: CDX API, чистый HTML и Markdown
Старые статьи, цены и описания исчезают из живого веба вместе с редизайнами и удалёнными разделами. По данным Pew Research Center,
38% страниц из выборки 2013 года были недоступны к октябрю 2023 года
. Снимки Wayback Machine помогают вернуть этот исторический слой, но обычный обход архива медленный и приносит в данные панели Wayback и служебные скрипты.
В A-Parser для этой задачи есть два практических сценария:
No-Code-конвейер:
Net::HTTP и HTML::ArticleExtractor
получает URL через CDX API, скачивает чистые снимки и сохраняет результат в JSONL.
Готовый TypeScript-парсер JS::WaybackCDX:
находит снимки, нормализует и дедуплицирует URL, очищает текст через Mozilla Readability и сохраняет отдельные Markdown-файлы с YAML Frontmatter.
Режим id_:
в ссылке на снимок убирает тулбар и внедрённые скрипты Wayback, чтобы в выгрузку попал исходный HTML страницы.
Открыть руководство, скачать готовый парсер и пресеты
Стр.
« первая
<
13
,
14
,
15
Новая тема
Ответить
Эта страница в полной версии