מושג

סוכני AI ב-local-first

סוכן AI ב-local-first רץ על המחשב שלך, לא בענן של ספק. כאן מסבירים מה זה אומר, איך זה עומד מול תצורות ענן ואירוח עצמי, ולמה זה חשוב לפרטיות, לעלויות ולשליטה.

מה באמת רץ מקומית?

‏local-first זה לא רק איפה תוכנית מתחילה. לסוכן יש ארבעה חלקים נעים: לולאת הבקרה שמתכננת ומחליטה, הזיכרון שמצטבר, הכלים שהוא מריץ והמודל הלשוני שאיתו הוא חושב. ב-Veyllo‏ (VAF) שלושת הראשונים רצים תמיד על החומרה שלך. המודל הוא הנקודה היחידה שבה בוחרים בין מקומי למאורח. ההפרדה הזאת היא כל ההבדל מסוכן ענן, שאצלו כל הארבעה אצל הספק.

ההבדל

ענן, אירוח עצמי ו-local-first

שלוש דרכים להריץ סוכן — ואיפה הנתונים שלך חיים בכל אחת.

סוכן ענן

רץ כולו על שרתים של ספק. נוח להתחיל, אבל הנתונים, ההקשר והמפתחות חיים אצלו — וגם המתג: תקלה, שינוי תנאים או חשבון מושעה עוצרים את הסוכן, לא משנה מה הסיבה.

סוכן באירוח עצמי

רץ על תשתית שאתם מתפעלים, בדרך כלל שרת שאתם מנהלים. השליטה אצלכם — אבל גם השרת: להריץ ולתחזק זה עליכם.

סוכן local-first

רץ על המחשב שלך, בחלון משלו. ההתקנה מסדרת שרת מקומי וחשבון בשבילך, והנתונים נשארים אצלך. בלי תשתית מרוחקת להקים או לתחזק. ככה Veyllo עובד כברירת מחדל.

‏local-first ואירוח עצמי חופפים: בשניהם השליטה אצלך. ‏local-first אומר, ספציפית, שהסוכן רץ איפה שאתם — על המכשיר שלכם. עם Veyllo אפשר את שניהם: לרוץ מקומית, או לארח את ה-harness על שרת משלכם.

מקומי — לא לבד

‏host אחד, כל הצוות.

‏local-first לא אומר אדם אחד. אפילו אפליקציית הדסקטופ נפתחת לרשת במתג אחד, בלי התקנת שרת נפרדת. המחשב שלך, מכונה פנויה בבית או שרת של החברה הופכים ל-host, וכל מי שברשת המקומית מגיע אליו ב-HTTPS.

Server
שיתוף במתג אחד. מעבירים את המתג באפליקציה (או מריצים vaf server on) — ו-VAF זמין ברשת שלכם ב-HTTPS. התקנת דסקטופ רגילה מספיקה; לא צריך שרת נפרד.
חשבון נפרד לכל אחד. לכל אחד מרחב מבודד משלו: זיכרון, משימות והעדפות בנפרד. אף אחד לא רואה של אחרים.
בלי מינוי לכל משתמש. מופע אחד משרת את כל הצוות או הבית. מריצים פעם אחת, במקום לשלם על כל אדם.
למה זה חשוב

מה יוצא לכם מזה.

פרומפטים שלא נוסעים לשום מקום. טקסט שלא עוזב את המחשב אי אפשר לתעד, לשמור, לאמן עליו מודלים או למסור לפי דרישה. עם מודל מקומי זה מכסה את כל שרשרת העיבוד, לא רק את האחסון.
אין ספק ביניכם לבין העבודה. אף אחד לא יכול להעלות מחירים, להוציא לגמלאות את המודל שאתם סומכים עליו, לשנות מגבלות או להשעות חשבון. תצורה שעובדת היום תעבוד גם בשנה הבאה — עם אותם משקלים של המודל.
חשמל במקום טוקנים. למודל מקומי אין חשבון לפי טוקן. הקשרים ארוכים, ריצות חוזרות ועיבודי לילה עולים כמו מחשב במנוחה — וזה מה שהופך משימות מתוזמנות ורב-שלביות למשתלמות.
עובד גם בלי חיבור. ברכבת או ברשת סגורה הסוכן ממשיך עם מודל מקומי — כולל הזיכרון והקבצים.
הבחירה האמיתית היחידה

מודל מקומי או מודל מאורח?

כל השאר בסוכן local-first כבר סגור. זו ההחלטה שבאמת שלכם — ואפשר לשנות אותה אחר כך.

מודל מקומי. רץ על ה-GPU או ה-CPU שלכם. שום דבר לא עוזב את המחשב ואין חשבון טוקנים; מהירות ואיכות הולכות אחרי החומרה. מודלים קטנים מסתדרים יפה עם טיוטות, תקצירים ועבודה על קבצים; הסקה כבדה רוצה GPU חזק.
מודל מאורח. הסוכן ממשיך לרוץ מקומית; רק הקריאה למודל יוצאת החוצה. כך מודלים מתקדמים בהישג יד בלי לקנות חומרה, בחיוב לפי טוקן; הפרומפט והקבצים המצורפים מגיעים לספק המודל.
שניהם — לפי המשימה. רוב התצורות נגמרות מעורבות: מודל מקומי לשגרה ולחומר רגיש, מאורח למקרים הקשים. ההחלפה היא שורת הגדרה אחת, אז הבחירה אף פעם לא סופית.
איך Veyllo עושה את זה

מה Veyllo שם מעל המודל.

‏Veyllo הופך מודל לשוני לסוכן שעובד מקומית: זיכרון וקטורי מתמשך שזוכר בין סשנים, סט כלים מלא (רשת, קוד, קבצים, דפדפן) ועוד כל מה שמחברים דרך MCP, תת-סוכנים להאצלה, והרצת קוד ב-sandbox. מריצים על מודל מקומי, או מפנים אל Veyllo API התואם ל-OpenAI כשרוצים backend בענן. קוד פתוח, AGPL-3.0, עם רישיון מסחרי זמין.

שאלות נפוצות

שאלתם — ענינו.

מה זה סוכן AI ב-local-first?

לולאת הבקרה, הזיכרון והכלים רצים על המכשיר שלך; רק המודל יכול לשבת במקום אחר, אם בחרתם מודל מאורח. סוכן ענן שם את כל זה על שרתי הספק, כולל ההקשר של כל בקשה.

האם local-first זה אותו דבר כמו אירוח עצמי?

הם חופפים במי מחזיק בשליטה, לא באיפה העבודה קורית. אירוח עצמי מעביר את התוכנה לשרת שאתם מנהלים; ‏local-first שם אותה על המחשב שמולכם, בלי שרת בכלל. ‏Veyllo עושה את שניהם, וה-host באירוח עצמי משרת צוות שלם.

צריך לשלוח נתונים לענן כדי להשתמש ב-Veyllo?

לא. ‏Veyllo הוא local-first: אפשר להריץ את הסוכן כולו על המחשב שלכם, כולל המודלים. ‏Veyllo API המאורח הוא אופציה: הוא מספק את המודלים ש-VAF צריך (טקסט, ראייה וקול) אם אתם מעדיפים לא להריץ משלכם.

כמה אנשים יכולים להשתמש בהתקנה אחת של Veyllo?

כן, זה עובד. מדליקים שיתוף רשת — ו-VAF זמין ברשת המקומית ב-HTTPS, אפילו מהתקנת דסקטופ רגילה. לכל אחד חשבון משלו עם זיכרון ומשימות מבודדים; ‏host אחד משרת את כולם, בלי מינוי לכל משתמש.

אפשר להשתמש ב-SDK של OpenAI עם Veyllo API?

כן. ‏Veyllo API תואם ל-OpenAI. מכוונים כל SDK של OpenAI או לקוח HTTP אל api.veyllo.app/v1 ומשתמשים במפתח Veyllo שלכם. צ'אט וראייה נתמכים.

אפשר לבנות סוכני AI משלי עם VAF?

כן. ‏VAF נמצא ב-PyPI: ‏pip install --pre vaf מתקין את הליבה, ועל ה-framework בונים סוכנים, כלים ופתרונות משלכם — כולל harness משלכם. תוספות כמו השרת או מחסנית הזיכרון מותקנות באותה דרך, ומדריך ההטמעה בתיעוד של VAF מלווה צעד-צעד. הדגל ‎--pre נדרש כל עוד VAF באלפא.

באיזה רישיון Veyllo?

‏Veyllo Agentic Framework‏ (VAF) ברישיון כפול: ‏AGPL-3.0 לשימוש בקוד פתוח, ורישיון מסחרי לצוותים שצריכים תנאים אחרים.

אילו מערכות הפעלה נתמכות?

‏Veyllo רץ על macOS‏, Windows ו-Linux — כאפליקציית דסקטופ, על שרת או מהטרמינל.

סוכני AI ב-local-first — ההסבר · Veyllo