#databases najlepsze najnowsze

neekerit 2021-05-27 15:31:59 +0
Siema mirki. Mam rozmowę na posadę Data Engineering Intern w Santanderze. Ktoś miał może taką rozmowę i chce się podzielić pytaniami( nie chodzi o santandera ale ogólnie na podobne stanowisko)? Nie powiem stack wymagany jest dosyć spory(Tableau, Spark, Kafka, Hadoop, Python, Flink, roziązania Cloudowe). Podstawy mam dosyć dobre jeżeli chodzi o Big Data, Hurtownie Danych i robiłem trochę we wszystkim zwłaszcza w PySpark, ale nadal się trochę cykam. ( ͡° ͜ʖ ͡°)
#bigdata #datascience #databases #dataengineering #bazydanych #inzynieriadanych #programowanie
Popcornn1 2021-05-27 22:43:54 +1
Spore wymagania jak na Interna :O
neekerit 2021-05-28 15:11:28 +1
@Popcornn1: Już po. Spoko było chyba. Pytanka typowo pythonowe z przykładami kodów co robią(lambdy, jakieś funkcje, listy etc.), zadanka jakieś logiczne i wyjaśnienie co to hurtownie danych, po co są, etc. Ogółem specyficzna bardzo rozmowa bo nie było żadnych pytań z sekcji soft skill(dla mnie na plus mocno) i sami prowadzący rozmowy byli k--s. (⌐ ͡■ ͜ʖ ͡■)
pokaż komentarze (9)
P.....r 2018-08-01 17:12:45 +7
Mirki, jest tutaj ktos pracujacy, jako Data Engineer? Mam zagadke, poniewaz zaoferowano mi takie stanowisko na internship/traineeship, ale nie mam pojecia, czy to bedzie faktycznie interesujace dla mnie. Lubie machine learning, deep learning, data science, ale data engineering wydaje mi sie mocno backendowym zajeciem, ktore zwyczajnie moze mi sie znudzic. Chcialbym porozmawiac z kims, kto ma z tym stycznosc na codzien, moze to wyglada zupelnie inaczej, niz moje wyobrazenie. Bede bardzo wdzieczny :)
#bigdata #datascience #databases #dataengineering #bazydanych #inzynieriadanych #programowanie
Krever 2018-08-01 19:53:48 +0
Pracowałem 3 lata jako takowy, pytaj śmiało. Najlepiej publicznie coby moze ktoś jeszcze skorzystał.
Kura_Wasylisa 2018-08-01 21:35:44 +0
@Piz-dur dla mnie to ciekawsze niz sam ml/dl
pokaż komentarze (9)
s.....t 2017-02-10 18:01:30 +1
Robił ktoś #mongodb repairDatabase? Uruchomiłem to koło południa na dość małej bazie (~50GB), do teraz trwa, w tej chwili alokuje plik nazwa_bazy.194, zajęło już 350 GB i końca nie widać? Przerywać, nie przerywać? #programowanie #sysop #sysadmin #linux #databases #programista #programista15k #javascript #js
drag_op 2017-02-10 18:02:15 +3
@szy_mat nie przerywaj bo może całkiem uwalic. Naprawianie baz głównie zależy od szybkości dysków.
s.....t 2017-02-10 18:05:40 +0
@drag_op: Mam snapshot ZFS sprzed procesu więc nie ma problemu (od tego czasu baza nie była edytowana) więc to nie problem. Cholera, 350 GB zaalokowało przy bazie poniżej 50 GB? Według dokumentacji Mongo required_free_space=2xdatabase_size, więc powinno najwyżej 100 GB, coś mi tu nie gra. A repair robię bo zdarzały się "wykolejenia" całego mongod z wypluciem stacktrace w hexie (mongo wersja stabilna). Zero problemów z dyskami, RAID1 na ZFS (serwerowe dyski HDD Toshiby na SATA 6 Gb/s 2TB), uptime ponad 70 dni i od tego czasu zero błędów odczytu czy zapisu.
pokaż komentarze (3)
michal__q 2015-03-22 10:46:04 +2
Dobrze rozumiem że baza NoSQL pozbywa się całkiem relacji, więc wiele danych w niej jest po prostu dublowana?
Załóżmy bazę z dwoma tabelami, autorzy i książki, tabela autorzy zawiera autorów: imię, nazwisko, rok urodzenia, skąd pochodzą, narodowość i masę innych rzeczy a książki to tytuł, gatunek, ilość stron itd...
W podejściu relacyjnej bazy w książkach mielibyśmy id do autora taki zwykły integer.
W podejściu NoSQL do x książek tego samego autora przypisywane jest x razy te same dane dotyczące autora.
Teraz autor Y umiera i aktualizujemy informację o nim:
w relacyjnej bazie zmieniamy 1 rekord,
w bazie nosql zmieniamy x rekordów, wszędzie tam, gdzie występuje wzmianka o autorze?
Dobrze to rozumiem?

#nosql #sql #rdbms #database #databases #bazydanych
G.....n 2015-03-22 10:52:51 +0
@michal__q: Niby tak, ale to jest złe podejście - duplikowane dane powinny być możliwie niezmienne.
Innym rozwiązaniem są relacje, np. tak rozwiązane: http://docs.mongodb.org/manual/tutorial/model-embedded-one-to-many-relationships-between-documents/
b.....r 2015-03-22 19:47:55 +2
@michal__q: zależy jaka NoSQL. NoSQL to tylko nazwa nurtu, jest kilka rodzajów baz i "struktur danych". Np. grafowa baza danych da Ci dużo lepszą wydajność na danych które przedstawiają relację, bo naturalnie je odzwierciedla (w przeciwieństwie do relacyjnych baz danych ;) ). Na grafie od jednego autora (węzeł grafu) masz x relacji do książek które napisał. W przypadku wspomnianej śmierci autora również zmieniasz tylko info w węźle autora, nie musisz nic więcej dodawać. Nigdzie więcej (poza tym węzłem of course) nie trzymasz informacji o autorze. Jedyne co robisz to wyprowadzasz sobie dowolną relację od niego (np "stworzył", "napisał", "mieszka w", "lubi" czy cokolwiek Ci przyjdzie na myśl co reprezentuje relację) do innych węzłów grafu. Polecam popatrzeć i poczytać. Proste tutoriale od podstaw teoretycznych i praktycznych masz np z Neo4j http://neo4j.com/developer/get-started/
pokaż komentarze (1)