Master-X
Форум | Новости | Статьи
Главная » Форум » Программинг, Скрипты, Софт, Сервисы » 
Тема: Автоматизация на локальных LLM: парсеры, обработка данных.
цитата
03/08/26 в 16:38
 Olha25
Разработка и автоматизация под задачи, где данные не должны уходить наружу.

Работаю на своём железе: Ryzen AI 9 HX 370, 32 GB VRAM, 64 GB RAM. Локальные модели
(Qwen 2.5 32B, DeepSeek-R1) через Ollama. Ни OpenAI, ни Claude, ни одного внешнего
API — ваши базы, тексты и логи остаются на моей машине и потом удаляются.

ЧТО ДЕЛАЮ

Парсеры и сборщики данных
Асинхронный Python (httpx/Playwright), обход JS-рендеринга, устойчивость к падениям,
докачка после обрыва, состояние в SQLite. Не разовый скрипт, а то, что работает
месяцами без присмотра.

Обработка текста локальными LLM
Классификация, извлечение структурированных данных, суммаризация, перевод.
Ключевое отличие: вывод по JSON Schema с валидацией и автоматической проверкой на
выдумки. Модель обязана подтверждать факты дословными цитатами из источника, а всё,
что не проходит проверку, отбраковывается, а не отдаётся вам.

Автоматизация процессов
n8n, systemd-сервисы, Telegram-боты, обработка входящих файлов, вебхуки,
уведомления. Связываю то, что у вас уже есть, в конвейер без ручных шагов.

Работа с документами и медиа
OCR (Tesseract, многоязычный), транскрипция аудио (whisper.cpp на GPU, ~7x реального
времени), парсинг PDF, извлечение таблиц.

Серверное и системное
Linux, Docker, systemd, миграции, дуалбут, диагностика железа и производительности,
настройка ROCm/CUDA под инференс.

ПРИМЕР РАБОТЫ

Последний проект — конвейер сбора и обогащения B2B-данных. Собирает компании из
открытых источников, анализирует их сайты локальной моделью, извлекает структуру
и генерирует персонализированные тексты. Четыре уровня защиты от галлюцинаций:
JSON Schema, верификация цитат против исходника, фильтр качества цитат, аудит
результата. На последнем прогоне 33 текста из 37 прошли автоматическую проверку,
4 отбракованы и не попали в выдачу. Всё локально, ~2500 строк Python.

Готов показать код и разобрать архитектуру.

ЦЕНЫ

Небольшой скрипт или парсер — от 100 EUR
Конвейер с LLM-обработкой — от 300 EUR
Автоматизация процесса под ключ — от 500 EUR

Консультация по архитектуре, час — бесплатно, если задача интересная

ЧЕГО НЕ ДЕЛАЮ

Не пишу спам-рассылки и не собираю базы под них. Не занимаюсь обходом капч,
накрутками и всем, что ломает чужие системы. Не беру задачи, где нужно врать
конечному пользователю.

Европа, работаю удалённо. Пишу и говорю по-русски, польски, английски.
Пример задачи в личку — отвечу, реально ли и за сколько.

ТГ: @ser_mish25
цитата
05/08/26 в 03:14
 Skyworker
Прикольные у тебя скиллы! Но мне сейчас хочется самому влезть в подобную тему и научиться автоматизации для наполнения собственных проектов. Там достаточно парсера на Python и обработчика, который будет формировать .csv файл с измененными описаниями (десками). Но чтобы парсить такие ресурсы, почти всегда нужен обход капчи. Странно, что с капчами не работаешь. Ну, ок буду тогда сам разбираться в тонкостях парсинга и закажу парсер на Python у прогером с обходом капчи. Есть парсер уже, который уже не пашет и его нужно допилить и полностью переписать. Потом только нужно будет немного разобраться с созданием и настройкой обработчика полученных данных icon_cool.gif
цитата
05/08/26 в 14:12
 Olha25
Что могу сделать прямо сейчас:
Асинхронный парсер (Playwright / httpx) любой сложности с обходом Cloudflare/JS и докачкой при обрывах.
Автоматизация рутины (файлы, базы, Telegram-боты, n8n-воркфлоу).
Обработка и фильтрация текста через локальные LLM (без отправки ваших данных в сторонние OpenAI/Claude).
Кидайте ТЗ в ЛС или прямо в тему — разберем задачу и сделаем в лучшем виде.


Эта страница в полной версии