DuckDB בתוך Aurora PostgreSQL: שאילתות ישירות על data lakes של Iceberg ו-Parquet

AWS מוחקת הפרדה ותיקה בין נתונים טרנזקציוניים לנתונים אנליטיים. בעקבות ההשקה, שאילתת PostgreSQL אחת ב-Aurora יכולה לבצע join בין טבלאות תפעוליות חיות לבין נתוני Iceberg או Parquet שיושבים ב-S3. עד עכשיו זה דרש לבנות pipelines שמעתיקים נתונים בין מערכות. המנוע האנליטי הוא DuckDB, שמוטמע ישירות בתוך Aurora. הקטלוגים ושכבות האחסון הנתמכים: Glue Data Catalog, S3 רגיל ו-S3 Tables.
Swami Sivasubramanian, סגן נשיא Agentic AI ב-AWS, הציג את זה כך: "מסדי נתונים תפעוליים ו-data lakes תמיד היו עולמות נפרדים... זה משתנה היום." הוא ציין שמכיוון שהיכולת בנויה על DuckDB שהוא open-source, שיפורים עתידיים ב-DuckDB יגיעו גם ל-Aurora.
הזווית של agents: הם צריכים יותר ויותר גם את המצב הנוכחי (הזמנות, tickets, sessions) וגם הקשר היסטורי (נתוני ה-lake) באותו צעד. בלי ETL הנתונים טריים יותר, ויש פחות חלקים נעים בכלים של ה-agent. השקות נוספות מאותו יום מכוונות לאותו כיוון:
- Aurora serverless מתרחב עכשיו בצעדים של 16 ACU בתוך שנייה, ומכוון לעומסי agents שמגיעים בפרצים.
- S3 Tables תומך עכשיו בכל סוגי הנתונים של Iceberg V3.
בהקשר התחרותי, ה-pitch של Fabric ב-Microsoft דומה: איחוד של נתונים תפעוליים ואנליטיים עבור Copilot. Snowflake ו-Databricks מציעות lakehouse federation מהצד האנליטי. ההחלטה להטמיע DuckDB במקום לבנות מנוע קנייני היא בחירה פרגמטית ב-open-source.
הסתייגויות: עדיין לא ידוע איך יתנהגו סריקות lake גדולות מתוך מסד OLTP. שאילתות אנליטיות כבדות על clusters של Aurora בפרודקשן עלולות להתחרות על משאבים עם התעבורה הטרנזקציונית. הנחיות לגבי עלות ו-concurrency יהיו קריטיות.