#webscraping najlepsze najnowsze

asdfiksowy 2026-07-28 14:16:21 +0
Szukam osoby która ma doświadczenie w webscrapingu i potrafi zbudować program/projekt od podstaw. Robota odpłatna. Potrzebuje programu ktory bedzie zbieral dane w czasie rzeczywistym i je przetwarzał.
#it #webscraping #programista15k #programowanie #python
Cozzie 2026-07-28 14:21:17 +0
@asdfiksowy: Zdecydowanie polecam tego człowieka i usługi w tym zakresie https://dataminers.pl/
some_ONE 2026-07-28 17:23:31 +1
@asdfiksowy: klałde
pokaż komentarze (2)
fadi-aidi 2025-06-13 13:42:07 +2
Darmowe warsztaty z web scrapingu i analizy danych – Warszawa, lipiec 2025

Cześć Wykopowicze 👋

Jeśli interesujecie się web scrapingiem, automatyzacją zbierania danych lub analizą danych z sieci, to mamy coś dla Was!

Firma Bright Data organizuje w lipcu 2025 bezpłatne warsztaty w Warszawie. W planie:

Praktyczne sesje z ekspertami
Przykłady zastosowań w realnych projektach
Dema narzędzi do scrapingu i analizy danych
Networking z innymi specjalistami z branży
📍 Rejestracja (za darmo, liczba miejsc ograniczona):
👉 https://brightdata.com/lp/workshop-warsaw-july2025

Jeśli pracujesz z danymi lub po prostu chcesz dowiedzieć się więcej o tym, jak zbierać i wykorzystywać dane z sieci – warto wpaść.

Do zobaczenia w Warszawie! PL

#warsztaty #webscraping #programowanie #dane #datascience #warszawa #brightdata #wydarzenia #it #bigdata #ai
uzytkownik_wykop_pl 2025-06-13 13:58:52 +0
@fadi-aidi: Moshe, wasza strona nie działa(tak, użyj sobie chatgpt zeby przetłumaczyć).
fadi-aidi 2025-06-16 09:29:15 +0
@uzytkownik_wykop_pl: Czy możesz spróbować jeszcze raz? Widzę, że działa.
pokaż komentarze (1)
Mannequeen 2025-04-09 21:43:48 +1
#prawo #informatyka #it #cyberbezpieczenstwo #webscraping
Mam scrapper który zbiera publicznie dostępne dane (dostępne bez żadnej autoryzacji). Jednak strona internetowa, z której pochodzą te dane, zabrania w regulaminie korzystania z botów do ściągania danych. Dodatkowo, udostępnia płatne API na te dane.
Czy w świetle prawa korzystanie z tego scrappera do ściągania danych, które potem są wykorzystywane w celach komercyjnych jest nielegalne?
odysjestem 2025-04-09 21:48:35 +1
@Mannequeen: Dane są okej, ale metoda nie jest okej
Polinik 2025-04-09 21:58:39 +0
@Mannequeen: naruszasz regulamin usługi, mają pełne prawo wystąpić z pozwem cywilnym
pokaż komentarze (2)
maly1234 2025-03-18 13:01:13 +2
Macie jakiś działający sposób na wyciąganie oceny filmów z filmweba?
Python i Grok/DeepSeek się poddają, tzn. skrypt czasem ściągnie czasem nie, nie wiem od czego to zależy. Stąd pytam, może już jest jakaś pancerna biliblioteka ;)

Może problem też jest w szukaniu filmu, tj. mam search bar, podpowiada tytuły na bazie IMDB (tytuł i rok), i chyba ciężko czasem to dopasować pod filmweb.

#python #programowanie #webscraping #skryptowanie #filmweb
fiddle 2025-03-18 13:17:52 +0
embedded browser+rotator
blacktyg3r 2025-03-18 19:02:44 +0
crawl4ai nie daje rady?
Krylan 2025-01-30 14:04:31 +0
Wie ktoś może, w jaki sposób działają aplikacje/strony z gazetkami sklepowymi? Chodzi mi o takie jak Blix, Goodie, gazetki.pl, które wyświetlają gazetki reklamowe z różnych sklepów, wraz z datą obowiązywania promocji, czy nawet wyciągając konkretne promocje osobno, żeby można było je sobie zapisać.

Mają udostępnione niepubliczne API? Web scrapping ze stron sklepów? Wyciąganie danych z obrazów OCR-em?
Nie wydaje mi się, żeby ktoś ręcznie to wyciągał, wpisywał i oznaczał, bo jest tego całkiem sporo i często się zmienia.
Ciekawi mnie, w jaki sposób to robią.

#webdev #webscraping
MisterMinister 2025-01-30 14:06:04 +1
@Krylan: zacznij od strony konsumenta. Możesz przecież pobrać pdf z gazetką. A Ty już OCR kombinujesz :)
MisterMinister 2025-01-30 16:36:27 +2
@Krylan: w takich kwestiach to myślę że można się dogadać żeby podsyłali pdfa nawet. Im zależy żeby być w jak największym zasięgu w sumie :)
pokaż komentarze (1)
interpenetrate 2024-10-18 22:46:09 +3
Staram się poduczyć trochę o programowaniu, no a zawsze się mówi, że najlepiej gdy ma się jakiś projekt. Wymyśliłem sobie, że zliczę sobie łączny czas jaki poświęciłem, na obejrzenie filmów i seriali jakie mam zapisane w bazie Filmwebu. Jako że nie wyciągnę tych informacji z ich danych (nawet nie o to by mi chodziło w tym projekcie), chciałbym zrozumieć jak mogę zautomatyzować proces ściągania tych danych, po prostu korzystając z tych informacji które się wyświetlają na stronie. Nazywa się to chyba metodą webscrappingu?
W każdym razie, nawet nie chodziłoby mi o to, aby czytać każdą informację ze źródła każdej strony (może na pierwszy sposób) - tylko może jakoś zrobić program, który kazałby komputerowi patrzeć w określone miejsce na stronie, rozpoznał co tam pisze, przekonwertował dane do excela.

Chciałbym to zrobić na dwa sposoby, ten drugi, wizualny w ogóle nie wiem jak zacząć. Jak mógłbym to zrobić?

Jeśli chodzi o pierwszy sposób, zapytałem chatagpt, no i do VCS, kazał mi wkleić coś takiego. Zainstalowałem bibliotekę soup w cmd pipem.
Uruchomiony skrypt (z wpisaną poprawną nazwą profilu filmweb), nie generuje nic do zapisanego pliku .csv - więc pewnie chodzi o to że identyfikatory ze strony nie są dobrze ściągnięte. Jak klikając na nazwę filmu na filmwebie, mogę po "zbadaj element" zobaczyć które parametry należy wpisać do skryptu aby dane się zaciągnęły?

#pytanie #programowanie #python #filmweb #webscraping #webdev
venomik 2024-10-19 00:13:03 +3
@interpenetrate: Idea odpowienia, ale wybór kiepski. Scrappowanie stron sprawi, że pewnie większość problemów będziesz rozwiązywał właśnie w tym zakresie. I często nie będziesz pewien czy problem jest z Twoim kodem czy może jednak z tym jak strona się 'wczytała'. Plus się będziesz męczyć z selectorami. I znów będziesz się zastanawiał czy Twój kod jest zły, czy może selector źle napisany.

Trust me. Znajdź sobie coś innego.
Mogę Ci nawet spróbować coś dobrać odpowiedniego, bylebyś nie wisiał utykając trochę niepotrzebnie.
venomik 2024-10-19 23:20:18 +2
@interpenetrate: Pewnie. Tak jak wczesniej pisałem. Niestety mój ostatni sarkastyczny komentarz nie mógł być bardziej rozbudowany - dziś akurat pare godzin spędziłem w aucie jadąc po psa mojej siostry.
Nevermind.

Jak bardzo lubisz filmy to weź sobie jakiś JSON z informacjami o filmach. Możesz na przykład któryś z tych:
https://github.com/prust/wikipedia-movie-data
Sugeruję coś z ostatnich dekad, jest więcej info.

Zadanie rozbudowane: przepisz ten JSON na relacyjną bazę danych. Z tabelami, powiedzmy: aktorzy, filmy, gatunki filmowe.

Ewentualnie po prostu pracując na tym JSONie sprawdzaj sobie jakieś losowe staty w stylu: jakie imie jest najpopularniejsze wśród aktorów grających w romansie.
Ogarniesz sobie tym wszelkie ify, pętle, struktury danych, nauczysz się pracy z JSONem, pracy na stringach, zbiorach.

Ewentualnie mogę Ci sparafrazowac to, co wczoraj sobie napisałem. Ja akurat potrzebowałem sobie zasymulować rozkład pewnych rzeczy w grze planszowej. Ale mogę Ci przepisać ten problem tak, że opiszę Ci problem w kilku zdaniach, a Ty spróbujesz podac mi rozwiązanie. Wtedy to nawet będę mógł przejrzec Twój kod i powiedzieć Ci co i dlaczego jest nie tak.
A mój kod ma raptem poniżej 100 linijek i masz tam sporo, czego potrzebujesz na początku:
- bardzo prosta klasa
- praca na zbiorach i słownikach
- pętle
- instrukcje warunkowe
pokaż komentarze (24)
Drmscape2 2024-04-18 16:50:31 +1
Robię apkę w pythonie, która scrapuje jedną ze stron. Za zgodą admina, ale rzucił we mnie reCAPTCHA i napisał, żebym ograniczył liczbę logowań i korzystał z ciasteczka, które jest ważne przez godzinę.
Do logowania i poruszania się po stronie używam Mechanize. Wyczytałem, że Mechanize automatycznie przechowuje ciasteczka. Apkę mam napisaną obiektowo i rzeczywiście w każdej klasie oddzielnie inicjowałem mechanize.browser() logując się ponownie. Wymyśliłem, że zaloguję się raz, a potem będę starał się utrzymać tę sesję przy życiu odwołując się do niej z każdego miejsca apki, o tak:
https://pastebin.com/0uwyMJLZ
Pytania:
1. Czy to w ogóle prawidłowe podejście?
2. Jeśli tak, to podpowiecie może sposób w jaki najlepiej by to było przetestować, zanim napiszę adminowi, że zmieniłem poprawiłem i żeby zdjął reCAPTCHE?

#python #programowanie #webscraping
lubie_placki777 2024-04-18 20:50:49 +1
@Drmscape2:
1. Wg mojego ograniczonego doświadczenia prawidłowe (tzn sam bym zrobił tak samo/podobnie używając selenium), chociaż metoda login będzie próbowała zwrócić browser nawet jak będziesz miał błąd logowania i tutaj sie wywali całość.

Zastanowił bym się nad dodatkową klasa Browser gdzie ogarniesz logowanie, sprawdzanie czy dalej jesteś zalogowany czy nie, ewentualne ponowne logowanie w razie konieczności itp.

2. Puść skrypt na kilka godzin i zobacz czy sie wykrzaczy bez ponownego logowania czy nie.

3. Alternatywnym rozwiązaniem (nie wiem jak jest w mechanize) jest zainicjowanie browser, zalogowanie i zapisanie cookies do pliku/bazy danych/whatever. Scrapujesz, zamykasz browser. Jak ponownie potrzebujesz coś zescrapować startujesz z browser i używasz wcześniej zapisanych cookies. Opłacalność tego rozwiązania może być żadna ( ͡° ͜ʖ ͡°), ale przy większej skali to lepsze rozwiązanie.
fifiak 2024-03-03 18:31:32 +0
Jak wyciagnąć link ze strony po kliknięciu w pewien przycisk który wyswietla zmienioną listę na tej stronie? Link caly czas jest ten sam do konsoli a zmiana dziala jakoś z poziomu javascriptu... To jakbyś wszedł na pogodę na wp.pl i zamiast wp.pl/pogoda masz caly czas wp.pl #scrapping #python #javascript #html #webdev #php #webscraping
blacktyg3r 2024-03-03 18:40:59 +1
@fifiak: Rozpoczynasz przygodę ze grzebaniem od front-endu, poczytaj o Selenium albo playwright, frameworki które mogą 'udawać, że są zwykłym użytkownikiem (głównie stosowane do testów).

W ten sposób łatwo podjąć interakcję ze skryptami i dostać się do interesujących nas danych.

PS. Często otwierając konsolę deweloperską możemy znaleźć adresy URL do niepublicznych API które strona wykorzystuje do pobierania danych - jeśli nie masz zamiaru robić nic 'złego' to można w ten sposób dostać się łatwiej do danych np. w JSON, o niebo przyjemniejsza praca niż od front-endu :).
fifiak 2024-03-03 20:05:17 +0
@blacktyg3r o tym wiem co napisałeś, ale mam skrypt gotowy który skrapuje dane z ogolnej strony a z podstrony nie da się bo nie ma adresu.. a json wyswietla jakieś dziwne dane które mnie nie interesuja. Robią "bota" ktory sam to przeklika zmusza mnie do robienia całkiem nowego /innego skryptu
pokaż komentarze (1)
maly1234 2024-02-16 13:12:30 +0
Czy działał ktoś kiedyś ze scrapingem danych jeśli chodzi o utwory muzyczne? Potrzebuje wyciągnąć daty premier ok. 500 polskich piosenek. Próbowałem z pythonowym "Spotipy", ale Spotify ma miks w tym przypadku, czasem daty się zgadzają, a czasem są to daty jakieś re-edycji lub po prostu dodania do serwisu. ChatGPT też nie działa - wygląda jakby rzucał pierwszą datą znalezioną w google i tutaj ma się to podobnie jak Spotify, przy wyrywkowym sprawdzaniu, dużo się nie zgadzało. Szukajka ZAIKSowa to też jakieś nieporozumienie ;(

#python #ai #gpt #muzyka #dane #przetwarzaniedanych #webscraping #skrypty
pa6lo 2024-02-16 13:40:11 +1
Spotify ma miks w tym przypadku, czasem daty się zgadzają, a czasem są to daty jakieś re-edycji

Zgadza się, dla mnie to jedna z największych bolączek Spotify. Próbowałeś MusicBrainz?
c.....s 2024-02-16 16:23:48 +0
@maly1234: https://www.tekstowo.pl/piosenka,europe,the_final_countdown.html przykładowe coś z tekstowo, jest rok wydania. Jeśli znajdziesz tam te piosenki, o które Ci chodzi to już z górki.
pokaż komentarze (2)
MlLF 2024-01-31 15:07:16 +0
Mirki, czy i jak można za pomocą node robić web scraping strony, która wymaga logowania?
Dla przykładu załóżmy, że chcę pobierać statystyki oferty ze strony otomoto.
(Załóżmy oczywiście, że strona nie udostępnia takich informacji poprzez API)

#webscraping #nodejs #programowanie #programista15k
zibizz1 2024-01-31 15:12:03 +4
@MlLF: logujesz się wysyłając login i haśło, pobierasz token i potem doddajesz informacje które otrzymasz do każdego requesta w nagłówkach, może jakies ciastka. Jest pełen wachlarz różnych sposobów, ale token jest najpopularniejszym
pa6lo 2024-01-31 15:25:49 +4
czy i jak można za pomocą node robić web scraping strony, która wymaga logowania?

@MlLF: Oczywiście, najlepiej przy pomocy Puppeteer.

Scraper używa dedykowanego browsera (Chromium), który jest inicjowany przy każdym uruchomieniu, czyszcząc sesję i ciasteczka. Można też podłączyć go do zainstalowanego Chrome, ale w większości przypadków można tak zaprojektować proces, żeby zawsze zaczynał od zera.

Jeśli chodzi o logowanie, to wybieram najprostsze podejście, czyli jednorazowo, ręcznie spisuję z DOM selektory pól "username" i "password" i tworzę funkcję przechodzącą przez ekran logowania. Program pobiera te wartości ze zmiennych środowiskowych (nie zapisuj tych informacji w kodzie źródłowym) i je wklepuje na ekranie logowania, po czym sprawdza czy udało się przekierować.

Z pewnością istnieją inne sposoby, ale ten mnie jeszcze nie zawiódł.
pokaż komentarze (5)
thebigshort 2024-01-23 16:12:43 +0
Mam jakieś 1k linków do aukcji konkurencji (docelowo pewnie bym chciał do 10k aukcji) z których chcę pobierać dane do raportu w PowerBI, dokładnie cenę i ilość (albo prosto do PowerBi albo przez skrypt pythona i wtedy do PowerBI).

Nie interesuje mnie moment pobrania tych 1k-10 aukcji, bardziej interesuje mnie kwestia odświeżania danych, czyli ceny oraz ilości.

Czy allegro szybko wyłapują takie ruchy przy takiej ilości? Jakiś sposób na obejście, sprawdzone metody? Czy opóźnienia pobierania coś dają? Co jaki czas odświeżać i kiedy? itp.

Jest komercyjne rozwiązanie, ale ono niestety wyszukuje tylko po EANie, ale może ono kogoś zainspiruje jak ktoś inny to rozwiązał.
https://baselinker.com/pl-PL/pomoc/wiedza/sprawdzanie-cen-konkurencji/

#allegro #ecommerce #scraping #webscraping #programowanie #powerbi
fiddle 2024-01-23 17:35:00 +1
@junus123: Wszystkie strony blokują dużą liczbę zapytań i odpowiadając @thebigshort - tak, do minuty (max kilku, zależy od ilości zapytań) Cię wyłapią i będzie captcha. Oczywiście da się obejść, ale do tego potrzebujesz zainwestować w rotator z przyzwoitą pulą.
NieoznaczonaReklama 2024-01-23 17:56:11 +1
@fiddle: ja na vpn pobieram skryptem aukcje z kategorii od kiedy zablokowali API i wyłapuję bana z raz na miesiąc i wystarczy zmienić serwer... Także jak czegoś nie robisz i nie masz pojęcia to po co pleciesz głupoty?
pokaż komentarze (6)
c.....s 2023-12-30 16:00:13 +0
#scraping #webscraping #selenium

czy ktoś używał z was serwisów typu zenrows do scrapowania danych? Zazwyczaj radziłem sobie ze zmianą headerów, ewentualnie mniejsze batche, jakieś darmowe proxy. Teraz problem jest taki, że wystarczy otworzyć 5 kart z danej strony i już jest podejrzenie bycia botem :P dlatego rozkminiam nawet takie portale.
gadatos 2023-09-03 19:25:45 +0
dlaczego klasy CSS na allegro mają tak dziwne nazwy
czy zmieniają się co jakiś czas czy są stałe

#programowanie #webscraping
radziu_11 2023-09-03 19:28:26 +2
@gadatos: może być to jeden z mechanizmów walki z web scrapperami
KontoDoPomocy 2023-09-03 20:03:00 +8
@gadatos: Aktualnie w webie często nie pisze się już klas w plikach css tylko korzysta z jakichś mechanizmów typu styled-components czy scss/sass, które w czasie budowy zmieniają nazwy na hashe (lub coś innego w zależności od libki). Głównym celem jest unikanie kolizji nazw (sytuacja gdzie różne klasy dzielą tą samą nazwę)
pokaż komentarze (2)
mk321 2023-07-06 19:25:35 +0
#paywall #chatgpt #piractwo #webscraping

Podobno ChatGPT mógł obejść paywalle.
Jak?

Czy jest jakiś sposób, żeby dostać się do treści ze strony? Jeśli tak, to jak?

Czy po prostu OpenAI miało wykupione subskrypcje do tych wszystkich serwisów?

Tutaj info o tym, że ChatGPT omijał paywalle: https://comparic.pl/chatgpt-napotkal-pewien-problem-w-zwiazku-z-tym-openai-informuje-o-zrobieniu-kroku-wstecz/
damianooo8 2023-07-06 19:31:05 +1
@mk321: Info na jednej ze stron do omijania paywalla:

Pomysł jest dość prosty: serwisy informacyjne chcą, by Google indeksował ich treści, by pojawiały się one w wynikach wyszukiwania. Nie pokazują więc paywalla robotowi indeksującemu Google. Korzystamy na tym, ponieważ crawler Google buforuje kopię witryny za każdym razem, gdy ją indeksuje.
k.....r 2023-06-27 12:28:12 +4
Hejka #programowanie #webdev #hacking #kiciochpyta #pytaniedoeksperta

Szukam #webscraping który wygeneruje linki do wszystkich treści publikowanych na moim profilu. Linki mogą sobie być zapisane jako adresy url w formacie txt, obojętne. Wystarczą same linki.

TEN WPIS NIE MA ŻADNEGO ZWIĄZKU Z Usunięcie twoich WSZYSTKICH publikowanych treści na wykop.pl ANI Z ARTYLKUŁEM NA telegra.ph.

#niebezpiecznik @niebezpiecznik-pl
Benzen 2023-06-27 12:36:11 +0
@kidzior: Nie wiem po co chcesz się męczyć. Wyślesz linki i dostaniesz odpowiedź że nie naruszają regulaminu i nie zostaną usunięte oraz sugestię, że możesz usunąć je sam ( ͡° ͜ʖ ͡°)
k.....r 2023-06-27 12:39:11 +0
@Benzen: nie chcę niczego kasować

. To nie jest wpis na ten temat. Poszukuję sposobu w jaki mogę zrobić scrapping linków do moich treści z wypoku.
pokaż komentarze (3)
Xardin 2023-01-02 18:55:49 +0
Dzień dobry, szukam biblioteki do webscrapingu, najważniejszym parametrem jest chyba szybkość. popróbowałem requests plus bs4, problem jednak w tym że jest wolno. Chce ten kod wsadzić do programu okienkowego, więc najchętniej bym przyspieszył jakoś dostęp do danych, by poprawić płynność.
#python #webscraping
c.....s 2023-01-02 18:59:55 +2
@Xardin: scrapy
zwei 2023-01-02 19:00:09 +2
przyspieszył jakoś dostęp do danych, by poprawić płynność.

@Xardin: niech zgadnę, nie scrapujesz w osobnym wątku, prawda? Poczytaj sobie o threadingu.
pokaż komentarze (7)
Oake 2022-12-14 14:44:10 +0
chce zescrapować stronę, na której jest dużo textboxów i comboxów, w których są już konkretne wartości. Niestety w kodzie w htmlu wartości z tych boxów nie ma. Czy da się to jakoś zescrapować BeautifulSoupem, czy on po prostu wyciąga tekst z kodu html? Np. żeby znalazł value dla danego id. Dołączam screena jak to wygląda np. na wykopie, gdzie domyślny wartość z textboxa jest w kodzie html, u mnie tego nie ma #python #webscraping #html
fiddle 2022-12-14 14:45:43 +0
@Oake: Skąd bierzesz html?
RolnikSamWdolinie 2022-12-14 16:26:57 +1
@Oake: nie wiem na ile umiesz front ale do scrapowania 10x lepszyn jest nodejs i cheerio. Używasz tego jak jQuery
pokaż komentarze (9)
Masto 2022-11-08 11:38:33 +0
Potrzebuję pobrać do #googlesheets aktualną cenę danego produktu z #olx po podaniu linku.

Udało mi się na razie napisać:

=IMPORTXML(URL;"//div[contains(@class,'css-dcwlyx')]")

Ale raz działa, raz nie i zasysa zbędne dane.

Ktoś ogarnięty w #xpath, #webscraping pomoże?
#programowanie
l-_-l 2022-11-08 11:46:48 +0
@Masto: nazwy klas są najprawdopodobniej losowe, aby utrudnić właśnie taki scraping
marsjanin2012 2022-11-08 12:06:38 +1
@Thiocomaster: wschodnie boty od pobierania numeru telefonu i kontaktu przez WU jakos nie widza problemu, tez strzelam na nazwy klass bo juz widac dcwlyx jakies takie "losowe" ale na bank do ogarniecia
pokaż komentarze (1)
AnonimoweMirkoWyznania 2022-07-16 20:16:46 +0
#anonimowemirkowyznania
Cześć, z góry zaznaczam, że nie mam konta na wykopie i nie mam się kogo poradzić. Od razu podam tagi #programowanie #naukaprogramowania #python #scraping #webscraping

Wymyśliłem sobie taki plan. Zapytacie się jaki? Kurna sprytny.( ͡° ͜ʖ ͡°) Chciałbym scrapować nazwy produktów+ceny tych produktów. Słabo się znam na programowaniu, ale myślę, że ogarnę na podstawie filmików na yt i nauczę się czegoś przydatnego. Chodzi o inną kwestię, wyczytałem w internecie, że za webscraping można dostać bana na ip za zbyt dużo zapytań na stronę. Niby mam częściowo zmienne ip(trzecia i czwarta liczba w ip zmienia się poprzez reset routera, ale boję się o bana na zakres ip(cs 1.6 #pdk) I tutaj mam parę pytań:
1. Zamierzam scrapować ok 50 produktów i ich ceny z jednego linku(w sumie ok 600 produktów=12 linków do poszczególnej listy produktów i cen; 6-8 domen). Oznacza to, że odpalając pythona z jednym url i pobieraniem 100 danych, strona będzie widzieć to jako 1 request czy 100 requestów(bo pod jednym url pobieram 50 nazw i 50 cen)?
2. Wyczytałem również, że można zabezpieczyć się poprzez proxy. Stawiać linuxa mint i proxychaining na wirtualnej maszynie? Czy tylko zmiana ip i user-agent w kodzie pythona? Czy olać to bo i tak zmienne ip?
Strony w swoich regulaminach zabraniają takich rzeczy, ale cebula here, inflacja, nauka czegoś nowego itp.
Nie zamierzam atakować stron non stop, raz dziennie wystarczy z kilkunastosekundową przerwą między linkami)
Thank you from the mountains

---
Kliknij tutaj, aby odpowiedzieć w tym wątku anonimowo
Kliknij tutaj, aby wysłać OPowi anonimową wiadomość prywatną
ID: #62d2f16992022bdb5cf1d621
Post dodany za pomocą skryptu AnonimoweMirkoWyznania ( https://mirkowyznania.eu ) Zaakceptował: karmelkowa
Wesprzyj projekt
a.....e 2022-07-16 20:52:19 +0
@AnonimoweMirkoWyznania:
1. Załóż konto albo spi*aj, mirkowyznania to nie pogotowie programistyczne dla pasożytów.

@karmelkowa Ja źle interpretuję "Napisz co leży Ci na sercu", czy o co chodzi? Co tutaj jest takiego, że ziomek nie mógłby założyć konta i zapytać? Rozumiem jak jest jakaś afera i kogoś zbanowali, a potem komunikuje się z "zewnątrz" w ten sposób, no ale bez przesady.
k.....i 2022-07-16 20:59:19 +1
@AnonimoweMirkoWyznania: to nie nauka na tydzien czy dwa jak nie umiesz w ogole programowac ;)
pokaż komentarze (3)
Spofity 2022-07-09 12:46:38 +1
Strona nie pozwala na prostego requesta html, komunikat "Please turn on Javascript". Czy da się to jakos obejsc?
Sprawdziłem w devtoolsach i wszystkie dane które potrzebuje są na stronie statycznie bez wywoływania żadnego skryptu.
#python #programowanie #webscraping #webdev
Ernest_ 2022-07-09 12:52:39 +2
Sprawdziłem w devtoolsach i wszystkie dane które potrzebuje są na stronie statycznie bez wywoływania żadnego skryptu

@Spofity: sprawdź jeszcze raz przez prawy klik -> Wyświetl źródło strony ( ͡° ͜ʖ ͡°)
kubako 2022-07-09 15:04:56 +1
@Spofity no to c--j wie ;)
pokaż komentarze (5)
heater 2022-06-28 19:51:04 +0
Potrzebowalbym narzedzie, ktore weszloby mi na strone i pobralo html z kilkuset podstron, plus od czasu do czasu rozwiazalo captche v2. Zrobilem maly research i nie znalazlem nic rozsadnego/darmowego, serio wymagam tak wiele?
Nie siedze w ogole w webdevie, wiec pisanie jakis skryptow srednio widze.

#webdev #informatyka #webscraping
k.....i 2022-06-28 19:54:59 +8
serio wymagam tak wiele?

@heater: tak
vytah 2022-06-28 20:04:48 +3
@heater: Zatrudnij do tego kilkudziesięciu Hindusów przez Amazon Mechanical Turk
pokaż komentarze (15)
DreqX 2022-06-27 16:22:08 +0
Mirki wiecie jak wyciągnąć datę stworzenia ogłoszenia na otomoto? Data pod zdjęciem to oczywiście data odświeżenia, szukałem po requestach ale nie widzę nigdzie.
#otomoto #programowanie #webscraping #scraping
b.....b 2022-06-27 16:29:45 +0
d.....z 2022-06-27 16:55:15 +1
@DreqX: jak nie ma to odwiedzaj stronę odpowiedno często i utrzymuj swoją własną bazę ogłoszeń - będziesz wtedy miał moment dodania danego ogłoszenia, na podstawie swojej własnej bazy,
pokaż komentarze (2)