#spark najlepsze najnowsze

mccloud 2022-09-30 23:06:40 +0
Jest tu jakiś spec od #awsglue #glue #spark ?
Po odpaleniu joba, po jakims czasie dostaje bład jak niżej...

I nie wyglada to na coś złego, normalnie wszystko się przetwarza (screen)
jakieś pomysły co zrobiłem nie tak?

An error occurred while calling o5466.resolveChoice. Job aborted due to stage failure: Task 6 in stage 53.0 failed 4 times, most recent failure: Lost task 6.3 in stage 53.0 (TID 449) (10.10.1.162 executor 11): ExecutorLostFailure (executor 11 exited caused by one of the running tasks) Reason: Remote RPC client disassociated. Likely due to containers exceeding thresholds, or network issues. Check driver logs for WARN messages.
KORraN 2022-05-22 16:55:23 +0
#dji #spark #drony Wygrzebałem swojego Sparka po prawie dwóch latach i niestety jedna bateria już się nie ładuje. Gdzie najlepiej kupić nową? Widzę, że kiepsko z dostępnością ( ͡° ʖ̯ ͡°)
jurii 2022-05-22 16:58:36 +0
@KORraN nie ma nowych, musisz szukać tam, gdzie komuś zostały na stocku lub naprawić starą. Ebay, amazon- tam jeszcze trafisz, ale często w chorych cenach.
Laszl0 2022-05-22 17:24:01 +1
@KORraN: Ja yebie, jeszcze 3 lata temu był to nowoczesny dron a teraz nawet akumulatorów do nich nie robią.
pokaż komentarze (6)
Hektorrr 2022-04-26 03:57:35 +3
Humble Bundle z książkami wydawnictwa Apress. Głównie o technologiach związanych z .NET, ML.NET, Cpłotek, TypeScript, Azure, Github.

26 książek za £14!

Pełna lista:

Practical Entity Framework Core 6
.NET Developers Guide to Augmented Reality in iOS
Lean Software Systems Engineering for Developers
Pro Cryptography and Cryptanalysis
Introducing Distributed Application Runtime (Dapr)
Pro ASP.NET Core Identity
ML.NET Revealed
Visual Studio Code Distilled
The Complete ASP.NET Core API Tutorial
Introducing .NET 6
Building Single Page Applications in .NET Core
Microsoft Blazor
Introducing .NET for Apache Spark
Microsoft Conversational AI Platform for Developers
Practical Paint.NET
Pro ASP.NET Core 6
Advanced ASP.NET Core 3 Security
Pro Microservices in .NET 6
C# Programming for Absolute Beginners, 2nd edition
Mastering Azure API Management
Stylish F# 6
Essential TypeScript 4
Beginning gRPC with ASP.NET Core 6
Hands on GitHub Actions
ASP.NET Web Forms Development
Introducing Microsoft Quantum Computing for Developers


#dotnet #programowanie #microsoft #microservices #entityframework #blazor #frontend #backend #azure #dapr #csharp #fsharp #spark #mlnet
Hektorrr 2022-04-26 04:09:42 +3
@Hektorrr: Dodam, że zestaw tych wszystkich książek normalnie wyceniony jest na £1,119.85.
Tak więc £14 funtów to prawie jak za darmo a jak wiadomo za darmo to uczciwa cena.
chaddeveloper 2022-04-26 07:08:12 +1
@Hektorrr: szkoda, że nie fizyczne wydanie ( ͡° ʖ̯ ͡°)
mccloud 2022-03-26 21:29:33 +0
#pyspark #awsglue #spark

Mam sobie kolumne z danymi:

`60
null
null
null
null
35
4.594595
null
null
`

po wczytaniu wykrywa mi typ jako
`|-- TestColumn: struct
| |-- string: string
| |-- long: long`

No to wrzucilem sobie:

`for column, data_type in df.dtypes:
____if data_type.startswith('struct'):
________df = df.withColumn(column, col(column).cast(StringType()))
`
(nie ma wcięć?)

Liczyłem, że dostanę 60, null, 35, 4.594595 a tu moim oczom w bazie ukazją się potworki
`"{60, null}"
"{35, null}"
"{null, 4.594595}"
`

Jak to ogarnąc aby były normalne wyniki
Tzn. coczekuję 60, 35, 4.594595 lub ew. null
inny_89 2022-03-26 22:11:16 +0
Bulldogjob 2022-01-27 13:06:44 +1
Nie używaj Sparka do Machine Learning

https://bulldogjob.pl/readme/nie-uzywaj-sparka-do-uczenia-maszynowego

#machinelearning #programowanie #naukaprogramowania #spark
Hadzik 2022-01-27 13:42:21 +0
@Bulldogjob:
z mojego doświadczenia wynika, że osoby zajmujące się data science, nie są tak dobrze zaznajomione z (Py)Spark, jak z Pandas. W obu przypadkach wykorzystywana jest koncepcja ramek danych, ale API do manipulowania danymi w ramce jest zupełnie inny.

Był Koalas, a teraz już nawet nie trzeba:
https://databricks.com/blog/2021/10/04/pandas-api-on-upcoming-apache-spark-3-2.html#:~:text=We're%20thrilled%20to%20announce,on%20their%20existing%20Spark%20clusters.
inny_89 2022-01-27 21:44:18 +1
@Bulldogjob: ehhh, dałem się złapać na clickbajtowy tytuł. Argumenty przeciw sparkowi są prawdziwe ale w praktyce należy je pominąć z rozważań. Zwłaszcza argument o syntax pysparka vs pandasa
pokaż komentarze (1)
mlodymedyk 2021-12-11 11:31:57 +1
Szukam prezentu dla fana #f1 i pomyślałem o modelu bolidu Maxa Verstappena. Czy znacie może producenta modeli #spark ? A może jakaś inna firma lepsza? #modelarstwo


#f1
Gentleman_Adrian 2021-12-11 11:37:06 +1
@mlodymedyk: W skali 1:43 Spark oraz Minichamps oferują bardzo podobną jakość, różnią się mankamentami. Moim jednak skromnym zdaniem Minichamps bardziej zakorzeniło się w świadomości kolekcjonerów, mają ogromną kolekcję gdzie występują kierowcy zarówno z wyścigów, treningów jak i poszczególnych wydarzeń. Natomiast jeżeli kolega nie zbiera modeli to pewnie nie robi mu to większej różnicy, a nawet jak zbiera to raczej firmą Spark nie pogardzi. Modele jak na swoją skalę są bardzo dobrze odwzorowane.

edit: Bburago w skali 1:43 to raczej zabawki, jakość znacząco odstaje od wyżej wymienionych producentów. Chociaż to co kolega wysłał to jedna z nowszych edycji i jakość poszła w górę względem poprzednich lat. Jak na pierwszą przygodę z modelami i takie coś będzie dobre. Dodam ze Bburago ma dobre modele f1 w skali 1:18 gdzie naprawdę cena jest bardzo atrakcyjna w stosunku do jakości.
Gentleman_Adrian 2021-12-11 12:00:01 +1
@mlodymedyk: Jasne. Gdybyś jeszcze się zastanawiał czy Spark, Minichamps czy nawet ewentualnie Bburago z innej półki cenowej to na yt oraz forach tematycznych jest sporo recenzji czy porównań.
pokaż komentarze (2)
xaro 2021-12-10 13:55:25 +1
używał ktoś aplikacji #spark do kupowania biletów na a4?
wszystko działa nie ma przypału? bo tam w porównaniu do etolla po prostu kupuje się bilet bramka A -> bramka B i tyle?

#polskiedrogi #a4 #etoll
inny_89 2021-12-10 14:08:37 +0
@xaro najpierw jakiś dron spark, a teraz aplikacja.
No nie ma lekko człowiek na wykopie co chce sobie poczytać o Apache Sparku ;(
soadfan 2021-12-10 14:25:20 +0
@xaro: aplikacja etoll bilet pl - tam kupisz w taki sposób
pokaż komentarze (1)
PiotrokeJ 2021-11-10 10:34:03 +0
Cześć, dostałem mały projekt w pracy w pysparku. Mała transformacja danych i wrzucenie wyników do nowej tabeli. W punktach opiszę co trzeba zrobić:
1. 4 uniony
2. Pobrać tabelę z mappingiem
3. Zrobić joina (te 4 uniony i mapping)
5. Przerobić 2 kolumny na podstawie wartości, i dodać dwie puste kolumny
4. Wykonać prostą agregacje danych -> groupby po 5 kolumnach.
6. Wrzucić wyniki do nowej tabeli

Tabela z unionami ma łącznie 7k rekordów. (7k wierszy i 7 kolumn)
Tabela z mappingiem max 300 wierszy
Jednak cały czas mam problem z pamięcią, GC czy timeoutami. Próbowałem zwiększać limity pamięci jednak nic nie pomaga. Przeważnie dostaje error: gc overhead limit exceeded. Troche dziwne bo to jest raptowanie 7k rekordów, po agregacji ma wyjść ~~3k. Ktoś wie jak to rozwiązać?

#pyspark #spark #dataengineering #hadoop
#programowanie #python #scala
o.....6 2021-11-10 10:36:45 +2
@PiotrokeJ: 7k rekordów w sparku? Jebnij im to w sql, pandas albo excelu.
PiotrokeJ 2021-11-26 11:03:49 +1
@inny_89: Dzięki, jedno i drugie działa :) Teraz pytanie z innej beczki, wiesz dlaczego w Apache Ambari kiedy puszczam zapytanie dostaje wyniki, jak puszę identyczne zapytanie przez pysparka i dam np. df.count() albo chce wrzucć dataframe do nowej tabeli do dostaje error An error occured while calling o73.count. Job aborted due to stage failure: task 0 i insta 83.0 failed 4 times, most recent failure lost task 0.3 in stage 83.0 TID xxx. java.lang.IndexOutOfBoundsException: toIndex =212
pokaż komentarze (18)
inny_89 2021-11-03 12:42:54 +1
Hey #scala
Macie może jakieś dobre tutoriale, dokumentację odnośnie implementacji ZIO ze #spark ?

Na głównym repo ziverge od zio-spark nie mogę dużo znaleźć, a znowu film Pana Leo Benkela bardzo mnie zaciekawił i chciałbym trochę bardziej zgłębić temat:



#apachespark #databricks
inny_89 2021-11-03 12:43:32 +1
A, i nie napisałem, ze chodzi o coś więcej / innego niż od Pana Leo xD
inny_89 2021-11-03 20:00:08 +1
@inny_89: o, ciekawa zajawka. zwykle piszę albo w jednym albo w drugim - ciężko by mi było przekonać team Sparkowy do ZIO. ma to ręce i nogi według ciebie?

@gabonczyk właśnie generalnie u mnie w firmie mocno zrazili się do scali kiedyś jak z projektami startowali i teraz wszystko na pysparku leci

Moim zdaniem to ma jak najbardziej sens. Lepsze wykorzystanie zasobów klastra i większa asynchronicznosc taskow sprawi, że podobne joby pisane w czystym pysparku będą się wykonywać dłużej, a doprowadzenie ich do podobnego stanu co z zio to zadanie karkołomne. Lub wręcz niemożliwe.

Mam w pracy właśnie jednego joba, który dane miesięczne procesuje ok 30h.
Przepisze go hobbystycznie właśnie na implementację z ZIO i zobaczymy bo jestem ciekaw niesamowicie.

Jeśli będzie znacznie lepszy performance to się to samo obroni.
pokaż komentarze (7)
inny_89 2021-06-23 15:36:34 +0
Słuchajcie mam zagadkę. Z zakresu troche fanaberii i sci-fi.

Raczej mniej istotne tło problemu:

Tworzę sobie Wheela w #pythonie i do pełnego wykorzystania tej libki, którą zbuduje jest potrzebna inna libka udostępniana jako plik .JAR.
Lokalnie jak sobie z tym pracuje i odpalam kod w ramach mojego develpmentu na sparku to mam zwyczajnie załączony ten JAR w odpowiedniej lokalizacji i wskazuje go podczas budowania SparkSession. Tak jak na uproszczonym przykłądzie poniżej:

spark = SparkSession.builder.config("spark.jars", "./lib/.jar").getOrCreate()

o odpowiednie dostarczenie tego pliku dba moj prosty skrypt bashowy, ktory sobie dany develper juz sam odpali pdczas konfigurowania lokalnego środowiska develperskiego.

No i teraz problem wlaściwy:
Chce zbudowanego przeze mnie wheela używać an databricksach. Żeby móc to zrobić muszę oprócz mojego zbudowanego wheela zaisntalować też ręcznie na klastrze wspomnianego JARa.

Jak podejść do tematu zarządzenia taką zależnością aby w przyszłości użytkownik nie musiał ręcznie instalować wspomnianego JARa na databricksowych clustrze?
Czy w ogóle byłoby to możliwe aby po instalacji mojego wheela z ADSL'a automatycznie też "dogrywała" się dodatkowa zależność w postaci zewnętrznego JARa z mavena na wybranym klastrze databricksowym? Chciałbym zdjąć tę odpowiedzialność z przyszłego użytkownika mojego pythonowego wheela.

Jak do tego tamatu możnaby podejść?


#apachespark #spark #databricks #python
#jvm (z racji tego, że potrzebuję wspomnianego JARa zaisntalowanego na saprkowym klastrze obok Pythonowego Wheela)
#programowanie
#azure (mam databricksy na cloudzie microsoftu - jeżeli może się to jakkolwiek okazać istotne)
ProfesorBigos 2021-06-23 21:02:32 +0
@inny_89: A nie możesz dołączyć tego JARa do wheela? Możesz go też po prostu pobierać z internetu przy pierwszym uruchomieniu kodu.
Kura_Wasylisa 2021-07-05 18:21:40 +0
@inny_89 init scriptem
pokaż komentarze (1)
mccloud 2021-04-26 16:41:31 +0
Kurcze mam dane 145 kolumn, 100k wierszy. Wrzucam do glue/sparka i mam kilkadziesiat krokow. W wiekszosci cos w stylu a*b itd (testuje sobie).
Większość kodu to funkcje np jak poniższa:

`def handle(gc: GlueContext, df: DynamicFrame) -> DynamicFrame:
return ApplyMapping.apply(frame=df, mappings=t)`


`def t(rec: DynamicRecord) -> DynamicRecord:
rec['test'] = random.randint(0, 9)
return rec`


No i wydajnosc tego to np 2-4 min na taki jeden krok - co mi sie wydaje dosyc dlugo.
Nagle przeprocesowanie 100k i 20 krokow to kwestia godziny (50 workerow). Zwiekszanie workerow nawet powoduje wydłużenie czasu.

I to juz po partycjonowaniu danych - wczesniej to czasy były absurdalnie wysokie.

Ma ktos jakieś rady, Co powinienem sprawdzic/przeczytać?

#awsglue #glue #spark
mccloud 2021-04-27 11:31:19 +2
@inny_89: I chyba juz znalazłem winowajce.
Mam jedna regułe która ma policzyc srednia dla calego zbioru...
Wszystkie joby wcześniejsze są ładnie rozrzucone na executory.
Wszystkie joby po średniej - już idą na jednym executorze.

Dziwne, bo robie sobie kopie ramki, obliczam co mi trzeba i potem dodaje tylko kolumne do oryginalnej ramki. Ale zaraz sie upewnie wywalajac ten krok czy wszystko bedzie ladnie rownolegle dzialac.
mccloud 2021-04-27 23:23:02 +2
@inny_89: Ok, to sobie rozpoznam - wygląda to na dosyć dużę czasy GC, jakby to zmniejszyć to też dobry kwałek ugram.

PS. Wielkie dzięki - wskazówki z dag (AWS ma to pod nazwą to Spark UI) były super pomocne. Tak to bym pewnie w ciemno błądził co jest nie tak. A tak w dzień rozpykane i teraz 100k wierszy robie w 8 min zamiast w 1h.
Problematyczne przekształcenia (średnia i join) - przynajmniej wiem co jest źle, ew mam wytłumaczenie dla klienta, że takie coś powinno być ostatnim krokiem. :)
Dzięki!
pokaż komentarze (17)
inny_89 2021-01-25 21:07:55 +1
Potrzebuję zrobić #hurtowniedanych w #sqlserver ale jako narzędzie do #etl służy mi #spark, a konkretnie #pyspark

Macie może jakieś dobre materiały albo przykładowe kody, żeby podejrzeć jakieś dobre praktyki?

Jak ogarnąć slow changing dimension? Metadane itp.?

Znacie jakieś dobre repo do którego mógłbym zajrzeć?

#data #bazydanych #programowanie
Ark00 2021-01-25 21:43:05 +1
Ark00 2021-01-25 21:47:53 +1
@inny_89: co do scd to co masz dokładnie na myśli? Bo aż musiałem sprawdzić, człowiek pisze w sparku i nie wie co robi ( ͡° ͜ʖ ͡°)
Generalnie to kod powinien być reużywalny i dane wyjściowe powinny móc być odtworzone za pomocą transformerów i danych wejściowych. Spark pozwala nadpisywać dynamicznie popartycjonowane dane, tj. nie musisz całego zbioru za każdym razem przeliczać, jeśli masz dane, które np. musisz przeliczać co jakiś czas.

Jak chcesz to pytaj o coś konkretnego to postaram się odpowiedzieć
pokaż komentarze (3)
p.....k 2021-01-09 17:31:12 +1
#spark #scala #programowanie

Nie działa mi 1 przykład z dokumentacji sparka: https://spark.apache.org/docs/latest/structured-streaming-kafka-integration.html

val df = spark
.readStream
.format("kafka")
.option("kafka.bootstrap.servers", "host1:port1,host2:port2")
.option("subscribe", "topic1")
.load()
df.selectExpr("CAST(key AS STRING)", "CAST(value AS STRING)")
.as[(String, String)]

podkreśla ostatnią linijkę "unable to find encoder (String, String)". An implicit encoder is needed to store (String, String) instances in Dataset
p.....k 2021-01-09 17:33:33 +2
@programista4k: czeba dodać
import sparksession.implicits._ tuż pzred
ale to zejbany język
p.....k 2021-01-03 00:10:57 +1
Tak to jest się uczyć z książki w której przykłady nie działają, bo są bez konfiguracji.
Próbuję zapodać przykładowy structured streaming sparkiem do kafki i same problemy. Większość już rozwiązałem, teraz mam na drodze ten:

org.apache.spark.AnalysisException: value attribute unsupported type bigint. value must be a(n) string or binary;
at org.apche.spark.sql.kafka010.KafkaWriter ...

kod:
val stream = spark.readStream.format("rate").option("rowsPerSecond" 1).load() // to streamuje liczby long co sekundę

val query = stream.writeStream.outputMode(OutputMode.Append()).format("kafka")
.option("kafka.bootstrap.servers", "localhost:9092").option("topic", "myTopic")
.option("checkpointLocation", "/home/programista4k/tmp").option("failOnDataLoss", "false").start()

Streaming który zapodaję to long a nie bigint, ale niech będzie, rozumiem, że muszę to przekonwertować np. do string? Jak to zrobić? Jakiś stream.map(i => i.toString()) by się przydał, ale nie wiem jak to zrobić.



#programowanie #spark #kafka #scala
p.....k 2020-11-11 16:43:22 +1
Najbardziej w #spark wkurza mnie to, że niestosuje się enumów w zapodawaniu opcji.
Weźmy teakie streamowanie:
spark.readStream.option(???, ...)

skąd mam wiedzieć jakie sa możliwe klucze dla option? Googluję i nie ma. Jest dokumentacja opisowa na wiele stron a prostej tabelki nie ma.
#programowanie
eXe1987 2020-11-11 17:02:02 +2
@programista4k: spróbuj może zrekalibrowac albo naładuj kontroler #pdk
Eplan 2020-09-14 20:44:11 +0
Hej
Dzisiaj podczas lotu mój spark po prostu spadł z okoły 20m, według mojej wiedzy nie zrobiłem nic co mogło by to spowodować. Jest teraz błąd. ESC status error, z tego co sie dowiedziałem od youtube płytka od regulacji obrotów na jedym smigle do wymiany(to śmigło się grzeje i nie świeci). Dziwi mnie temat ze w aplikacji DJi assistand 2 nie mam tak wielu opcji jak na fimach na yt i nie moge przetestować motorków w programie. Ogarnia ktoś temat? ;p Da rade gdzieś kupić ta płytke taniej niż na allegro (90zł)
#DJI #dron #spark
schreder 2020-09-14 21:19:42 +4
@inny_89: a nas jak piszecie o apachee Spark zamiast dji spark ( ͡° ͜ʖ ͡°)
Eplan 2020-09-15 11:21:05 +2
pokaż komentarze (26)
Selcouth 2020-09-08 22:33:27 +0
Musiałem ogarnąć syf i wykręciłem blokadę amortyzatora (fox 32) przez co wyciekło trochę oleju. Automatycznie przestała działać blokada skoku, minimalnie blokuje. Moje pytanie czy ten olej, który wyciekł (z góry, z blokady) mam dolać od dołu? Czy od góry? Amortyzator z 2020, świeży!

#rower #szybkiepytanie #pytanie #fox #scott #spark #mountainbike #mtb #serwisrowerowy
Saeglopur 2020-09-08 22:35:24 +2
@Selcouth: Nie tykałbym tego już sam Miras!
bibsz 2020-09-08 22:36:58 +2
@Selcouth:
A manuale serwisowe są dostępne na stronie foxa?
pokaż komentarze (7)
TarruTarru 2020-08-05 16:00:12 +0
Cześć koleżanki i koledzy,

Od jakiś 2 lat mam DJI Spark. Jest sens zmieniać na Mavic Mini? Kusi te pół godziny lotu bo w sparku te 10 minut mija mega szybko.

Dodam ze latanie typowo wakacyjne/rekreacyjne. W sparku zrobiłem ostatnio FCC mod i mam stabilny obraz do tych 1000m.

#drony #dron #dji #mavic #spark
DziQ86 2020-08-05 16:26:50 +4
@TarruTarru: Nie wymieniałbym sparka na mini. Ale to tylko moja opinia. Kamera lepsza ale masa niedoróbek. Następny krok to oczko wyżej (air lub mp1).
BShKF 2020-08-05 18:10:08 +2
@TarruTarru: Mini to zawsze krok do przodu w stosunku do Sparka. Moim zdaniem to bardziej opłacalna wymiana niż na Air 1, który jest już odczuwalnie droższy.
pokaż komentarze (5)
gooway 2020-07-27 20:53:59 +1
może mi ktoś wytłumaczyć w jaki sposób działa fpv w racingowych dronach, które umożliwia płynny podgląd pomimo znajdowania się poza ścianami budynku w którym latają drony? jest masa filmików gdzie ludzie latają po opuszczonych budynkach przemieszczając się między pomieszczeniami na płynnym podglądzie. drony typu spark, mavic urywają podgląd gdy dron chowa się za budynkiem. wytłumaczy mi ktoś jak to działa? czy w Racingowych dronach jest zastosowana inna metoda łączenia fpv niż za pomocą wifi 2,4 lub 5,8 GHz?

#drony #drone #dji #quadcopter #modelarstwo #fizyka #gadzety #wifi #spark #mavic
krolik_wie_lepiej 2020-07-27 21:19:21 +2
@gooway: Generalnie w większości na filmikach masz pokazane nagranie z dodatkowej kamery (która nie nadaje się do podglądu przez lag) Z drugiej strony są mocne systemy analogowe pokroju TBS Unify Pro albo ostatnio cyfrowe jak Dji fpv air unit.
BArtus 2020-07-28 12:25:34 +3
@gooway: w fpv używa się często łączności analogowej a nie cyfrowej, więc obraz zamiast przerywać szumi albo jest mniej wyraźny. Poza tym korzysta się z pasma 900-1200mhz albo nawet 443mhz które znacznie lepiej załamuje się na otworach drzwiowych czy okiennych, w porównaniu do 2.4-5.8ghz które ma problemy nawet z koronkami drzew.
pokaż komentarze (4)