AIOps לניהול פלטפורמת דאטה
פורסם לפני 9 ימים · 0 מועמדים
התפקיד במילים פשוטות
התפקיד כולל תכנון, פריסה וניהול של סביבות Docker ו-Kubernetes, לצד תפעול תשתיתי ואוטומציה בסביבות פיתוח ופרודקשן. העבודה כוללת פריסה ואופטימיזציה של מודלי AI מעל תשתיות GPU, הנגשתם למפתחים, וניהול מערכות ניטור ותקלות.
- Kubernetes architecture experience (at least 2 years): design, setup, RBAC, Network Policies, Ingress, storage solutions
- At least 2 years of experience in day-to-day operations: backups, restores, upgrades, patch management, DR
- Practical knowledge of Linux systems administration and scripting (Bash/Python)
- Deployment and management of containerized applications using Helm and GitOps
- Monitoring and observability setup (logs, trace, dashboards, real-time alerts, root cause analysis)
- Familiarity with Generative AI (LLMs, Embeddings, Agentic AI, RAG)
- Bachelor's degree in Computer Science, Software Engineering, Data Science, or Information Systems
חולץ מתיאור המשרה · מתעדכן אוטומטית
למי זה מתאים
התפקיד מתאים למהנדסי תשתיות עם ניסיון של שנתיים לפחות בארכיטקטורת Kubernetes ובניסיון תפעולי שוטף בסביבות Linux ו-Containers. הוא פחות מתאים למי שאינו בעל ניסיון מעשי בתשתיות אלו או למי שמחפש תפקיד פיתוח תוכנה טהור.
תיאור המשרה המלא
המשרה המקורית · נשמר לעיוןקצת על התפקיד
מהנדס.ת תשתיות ו- AIOps עם ניסיון בתכנון, פריסה וניהול סביבות Docker ו- Kubernetes כולל הקמה מאפס, הקשחה, ניטור ושיפור ביצועים.
הובלת תהליכי אוטומציה ותפעול שוטף לסביבות פיתוח ו- Production,עם אחריות מלאה על יציבות, זמינות ושדרוגים.
במסגרת התפקיד
• פריסת מודלי AI – פריסה ואופטימיזציה של מודלי AI מעל תשתית GPU, כולל ניטור של צריכת הזיכרון, עומסים, ביצועים.
• הנגשה של מודלי AI למפתחים ולמערכות בארגון – מנגנוני ניהול תורים בגישה, ניהול של עומסים וביצועים, ניהול תשתית המודלים: VLLM, TGI וכו' .
• פריסת תשתיות AI מתקדמות (RAG).
• פריסה וניהול תשתית מרכזית לסוכנים: MCP server, ליווי מנהלי מערכות מידע ארגוניות, תזמון וניהול תורים וסוכנים.
מה אנחנו מחפשים?
• ניסיון של שנתיים לפחות בארכיטקטורת Kubernetes: תכנון והקמה, כולל עיצוב Namespaces, ניהול הרשאות (RBAC), מדיניות רשת (Network Policies), Ingress, ופתרונות אחסון.
• ידע מעשי ב- Linux – ניהול מערכות, סקריפטים (Bash/Python).
• ניהול תהליכים: פריסה וניהול יישומי Containers באמצעות Helm ו-GitOps.
• ניטור: הקמה ותחזוקה של מערכות ניטור, איסוף לוגים ו- Trace, יצירת דשבורדים מותאמים אישית, והתראות בזמן אמת. חקירת שורש התקלות לשיפור האמינות.
• אופטימיזציה: שיפור ביצועים באמצעות ניהול משאבים (Requests, Limits), HPA, וכוונון ביצועים.
• ניסיון של שנתיים לפחות בתפעול שוטף: גיבויים, שחזורים, שדרוגים מבוקרים, ניהול עדכונים (Patch management), תכנון המשכיות עסקית (DR).
• אוטומציה CI/CD : , סטנדרטיזציה של תהליכי הפצה.
• תמיכה: טיפול בתקלות Production חקירה שורש הבעיה והקשחת המערכת למניעת תקלות עתידיות.
• היכרות עם עולמות ה- Generative AI: LLM, Embedding, Agentic AI, RAG - יתרון משמעותי.
• תואר ראשון במדעי המחשב / הנדסת תוכנה / מדעי הנתונים / מערכות מידע- יתרון.
למה כדאי לך להצטרף אלינו?
אם את/ה מחפש/ת אתגר טכנולוגי בסביבה דינמית ומתקדמת, ויש לך את הניסיון והתשוקה ל-AI, אנו מזמינים אותך לשלוח אלינו את קורות החיים שלך.
שאלות על המשרה
- המשרה לא ציינה שכר. אנחנו מציגים שכר רק כשהמעסיק מפרסם אותו.
- Kubernetes architecture experience (at least 2 years): design, setup, RBAC, Network Policies, Ingress, storage solutions, At least 2 years of experience in day-to-day operations: backups, restores, upgrades, patch management, DR, Practical knowledge of Linux systems administration and scripting (Bash/Python), Deployment and management of containerized applications using Helm and GitOps, Monitoring and observability setup (logs, trace, dashboards, real-time alerts, root cause analysis)