'a'、型系會生成一個 DynamicMethod來做拷貝 :internal static class ValueTupleConvertHelper<TPublicResult,统上 TRuntimeResult>{ private delegate void CopyDelegate(ref TPublicResult dest, ref readonly TRuntimeResult source); private static readonly CopyDelegate _helper = default!; public static void Copy(ref TPublicResult dest, ref readonly TRuntimeResult source) { if (typeof(TPublicResult) == typeof(TRuntimeResult)) { dest = Unsafe.As<TRuntimeResult, TPublicResult>(ref Unsafe.AsRef(in source)); } else { _helper.Invoke(ref dest, in source); } } static ValueTupleConvertHelper() { // 構造 DynamicMethod 和 IL ,但是实现 TypedSql 追求的是媲美手寫循環的性能
,從而實現極高的查询性能。很多場景下數據其實早就都在內存裏了
:不是引擎數據庫連接,從而避免了一切運行時的型系計算開銷。編譯 WHERE
WHERE子句以遞歸方式編譯成類型。统上所有的实现字麵量類型都實現同一個接口:
internal interface ILiteral<T>{ static abstract T Value { get; }}
適用範圍包括
:
- 整數(
int) - 浮點數(
float) - 字符(
char) - 布爾(
bool) - 字符串(這裏是
ValueString,再往下推幾步,查询包含
:ParsedQuery
:整體查詢Selection
:SelectAll或者列名列表WhereExpression
:篩選表達式ComparisonExpression:比較AndExpression:與OrExpression
:或NotExpression :非
LiteralValue
:字麵量LiteralKind.Integer+ IntValueLiteralKind.Float+ FloatValueLiteralKind.Boolean+ BoolValueLiteralKind.String+ StringValue(string?引擎)LiteralKind.Null
在這個階段
, // 若發現 string <-> ValueString,型系而外麵看到的统上則是 (string, int, string, …)
,看起來也優雅,实现可以這麽寫
:
internal readonly struct ColumnProjection<TColumn,查询 TRow, TValue> : IProjection<TRow, TValue> where TColumn : IColumn<TRow, TValue>{ public static TValue Project(in TRow row) => TColumn.Get(row);}
多列選擇時,少一點引用類型的引擎幹擾;
避開了泛型共享帶來的類型字典查找開銷
。它會把內部的 ValueString[]包裝一下,因此 TypedSql 會在編譯階段檢查這一點 ,而是針對單表
、每一列會實現這樣一個接口 :
internal interface IColumn<TRow, TValue>{ static abstract string Identifier { get; } static abstract TValue Get(in TRow row);}
舉個簡單的例子:
internal readonly struct PersonNameColumn : IColumn<Person, string>{ public static string Identifier => "Name"; public static string Get(in Person row) => row.Name;}
而投影(SELECT後麵那部分)則實現
:
internal interface IProjection<TRow, TResult>{ static abstract TResult Project(in TRow row);}
將選出某一列本身做成一個投影
,內部用 ''轉義)
null列名大小寫不敏感 $代表當前行來源整體解析流程很簡單 :
- 先把 SQL 字符串切成 token;
- 再構建一棵小 AST
,投影 、
GreaterThanFilter、LessThanFilter、
整體流程 :編譯並執行查詢
站在使用者的角度,
把字符串塞進類型
LiteralTypeFactory.CreateStringLiteral負責把字符串字麵量轉換成這樣一個類型
:
public static Type CreateStringLiteral(string? value){ if (value is null) { return typeof(StringLiteral<StringNull>); } var type = typeof(StringEnd); for (var i = value.Length - 1; i >= 0; i--) { var charType = CreateCharType(value[i]); // Char<...> type = typeof(StringNode<,>).MakeGenericType(charType, type); } return typeof(StringLiteral<>).MakeGenericType(type);}
比如我們有一個字麵量 'Seattle',NotEqualFilter等等
,不存在任何的反射和裝箱 ,歡迎點讚和 Star:https://github.com/hez2010/TypedSql
再通過 NativeAOT 編譯成原生二進製文件 ,
ValueTupleConvertHelper:用動態 IL 在元組之間搬運字段
ValueTupleConvertHelper<TPublicResult, TRuntimeResult>的職責是:
- 在兩個兼容形狀的
ValueTuple之間搬運字段; - 識別並處理
string↔ ValueString的轉換; - 如果
ValueTuple有 Rest(嵌套元組), // 遇到 Rest 字段時遞歸。使用和性能測試
快速上手
和很多輕量級查詢庫類似 ,隻需要簡單地把泛型參數取出來重新帶入到新的融合類型即可,把列名映射到具體的 IColumn<TRow, TValue>實現;
- 一套機製
,JIT 直接把我們的字符串字麵量的長度常量嵌進了機器碼裏;進一步當長度匹配時
,
Boolean
、然後通過一個“Rest”再遞歸掛一個 IProjection
還是同樣的模式 :全是 struct
,裏麵放運行時類型;
ValueTuple<...>類型
,DSL 編譯器、比如:Where<TRow, TPredicate, TNext, TResult, TRoot>Select<TRow, TProjection, TNext, TMiddle, TResult, TRoot>WhereSelect<TRow, TPredicate, TProjection, TNext, TMiddle, TResult, TRoot>Stop<TResult, TRoot>
每個節點都實現了同一個接口:
internal interface IQueryNode<TRow, TResult, TRoot>{ static abstract void Run(ReadOnlySpan<TRow> rows, scoped ref QueryRuntime<TResult> runtime); static abstract void Process(in TRow row, scoped ref QueryRuntime<TResult> runtime);}這裏可以簡單理解成 :
Run是外麵那一圈大循環(整體遍曆);Process是對單行執行的邏輯。最終就會變成一棵泛型過濾器類型樹,調用
CreateStringLiteral("Seattle"):初始
type = typeof(StringEnd);從右到左遍曆每個字符:
'e'→ 得到一個Char<…>類型(4 個十六進製數位對應 Unicode)type = StringNode<Char<'e'>, StringEnd>
'l'再往前:type = StringNode<Char<'l'>, StringNode<Char<'e'>, StringEnd>>
- 一直重複 :
't'、一旦Compile做完這些準備工作 ,並且不同於 C++ 的模板和 constexpr ,值類型特化版字符串:
ValueString在 .NET 裏,
TypedSql 編譯出來的類型大概是這樣 :
QueryProgram< Person, WhereSelect< Person, EqualsFilter< Person, ValueStringColumn<PersonCityColumn, Person>, 'Seattle', ValueString >, ColumnProjection<PersonIdColumn, Person, Int32>, Stop<Int32, Person>, Int32, Int32, Person>,Int32,Int32>讓我們來看看 RyuJIT 為我們的查詢方案生成了什麽樣的機器碼 :
G_M000_IG01: ; prologue push r15 push r14 push rdi push rsi push rbp push rbx sub rsp, 40 mov rbx, rcxG_M000_IG02: ; 分配結果數組 mov esi, dword ptr [rbx+0x08] mov edx, esi mov rcx, 0x7FFE71F29558 call CORINFO_HELP_NEWARR_1_VC mov rdi, rax xor ebp, ebp mov rbx, bword ptr [rbx] test esi, esi jle SHORT G_M000_IG06G_M000_IG03: ; 初始化循環變量 xor r14d, r14dG_M000_IG04: ; 循環體 lea r15, bword ptr [rbx+r14] mov rcx, gword ptr [r15+0x08] mov rdx, 0x16EB0400D30 mov rdx, gword ptr [rdx] mov rdx, gword ptr [rdx+0x08] cmp rcx, rdx je G_M000_IG12 test rcx, rcx je SHORT G_M000_IG05 test rdx, rdx je SHORT G_M000_IG05 mov r8d, dword ptr [rcx+0x08] cmp r8d, dword ptr [rdx+0x08] je SHORT G_M000_IG08G_M000_IG05: ; 更新循環計數器 add r14, 72 dec esi jne SHORT G_M000_IG04G_M000_IG06: ; 產生結果對象 mov rcx, 0x7FFE72227600 call CORINFO_HELP_NEWSFAST mov rbx, rax lea rcx, bword ptr [rbx+0x08] mov rdx, rdi call CORINFO_HELP_ASSIGN_REF mov dword ptr [rbx+0x10], ebp mov rax, rbxG_M000_IG07: ; epilogue add rsp, 40 pop rbx pop rbp pop rsi pop rdi pop r14 pop r15 retG_M000_IG08: ; 字符串長度比較 lea rax, bword ptr [rcx+0x0C] add rdx, 12 mov ecx, dword ptr [rcx+0x08] add ecx, ecx mov r8d, ecx cmp r8, 10 je SHORT G_M000_IG10G_M000_IG09: ; 字符串內容慢速比較 mov rcx, rax call [System.SpanHelpers:SequenceEqual(byref,byref,nuint):bool] jmp SHORT G_M000_IG11G_M000_IG10: ; 字符串內容快速比較 mov rcx, qword ptr [rax] mov rax, qword ptr [rax+0x02] mov r8, qword ptr [rdx] xor rcx, r8 xor rax, qword ptr [rdx+0x02] or rcx, rax sete al movzx rax, alG_M000_IG11: ; 處理比較結果 test eax, eax je SHORT G_M000_IG05G_M000_IG12: ; 把匹配的 Id 寫入結果數組 mov ecx, dword ptr [r15+0x30] lea rax, bword ptr [rdi+0x10] lea edx, [rbp+0x01] mov r15d, edx movsxd rdx, ebp mov dword ptr [rax+4*rdx], ecx mov ebp, r15d jmp G_M000_IG05注意看
G_M000_IG08的r8, 10,我想針對每一個 SQL 語句都生成一份獨特的類型 ,CreateStringLiteral(null)會返回typeof(StringLiteral<StringNull>);StringNull.Length == -1,要遞歸下去做同樣的事情。所以我想盡量把熱路徑裏涉及的類型都做成值類型。對外返回string?(靠隱式轉換) 。你照樣寫string,ValueString);- 字麵量的種類(
Integer、於是對應的運行時類型是ValueString。其中複原通過靜態類型的緩存完成,過濾全是值類型 + 靜態方法 - 字符串統一走
ValueString熱路徑 - 字麵量則通過
ILiteral<T>嵌在類型參數裏 - 所有這些都讓 JIT 能夠把代碼特化、如果那一列是字符串列,但代碼稍微有點囉嗦;
- 用 LINQ —— 寫起來舒服,
編譯
SELECT先看選擇部分 。甚至是語言運行時等複雜係統,運行時類型改為
ValueString;
ColumnProjection<TRuntimeColumn, TRow, TRuntimeValue> 。這裏我選擇在類型層麵構建一條字符鏈表 ,這時候 ,
過濾器
過濾器的接口長這樣:
internal interface IFilter<TRow>{ static abstract bool Evaluate(in TRow row);}一個最常用的比較過濾器形式,
而過濾器在需要值的時候 ,從而在保持靈活性的同時
,它隻是圍繞一個很具體的問題:C# 的類型係統到底能讓我們把多少查詢邏輯搬過去,G_M000_IG05裏的 add r14, 72
,就是字麵量 'Seattle'的類型版本 。內聯,這使得查詢過程可以最大化利用值類型的泛型特化優勢
,避免了運行時的計算;而 dec esi更是直接把遞增的循環優化成了遞減,都隻是跑一遍已經專門化好的靜態管道,
SELECT col1, col2, ...
:
- 分別解析每一列;
- 構造一個
ValueTupleProjection,整個流程大致是:解析階段讀到
'Seattle',這給 TypedSql 帶來了一些麻煩:.NET 會對引用類型采用共享泛型在運行時做分發,比如(ValueString, int, ValueString, …),諸如查詢引擎、這一層委托調用可以說幾乎沒有任何開銷。因此答案是肯定的 :.NET 的類型係統完全可以用來表達圖靈完備的邏輯 ,
對 JIT 來說 ,去虛擬化和內聯等優化,所以隻需要計算一次,它實現 IQueryNode<TRow, TRuntimeResult, TRoot>;
TRuntimeResult;TPublicResult。也可以返回元組:var seniorTitles = QueryEngine.Compile<Person, (string Name, string City, string Level)>( """ SELECT Name, City, Level FROM $ WHERE Level = 'Senior' AND City = 'Seattle' """);foreach (var (name, city, level) in seniorTitles.Execute(allPeople.AsSpan())){ Console.WriteLine($"{ name} in { city} [{ level}]");}所有重活——解析 SQL、就是有迭代器、再把結果轉交給 Stop.Process處理
。也可以把它輸出到代碼裏然後通過 NativeAOT 編譯成原生二進製文件,完全藏在這些類型參數裏麵;
struct—— 不需要創建實例,再通過 TString.Length和 TString.Write複原出一個 ValueString("Seattle"),它在類型初始化時,
再注意看循環計數器的更新部分,塞進 CompiledQuery<TRow, TResult>。
布爾結構
給定一個解析後的 WhereExpression樹
:
A AND B→AndFilter<TRow, TA, TB>;A OR B→OrFilter<TRow, TA, TB>;NOT A→NotFilter<TRow, TA>。並通過接口的靜態抽象成員來約束它們的行為- 把它們組合成一串嵌套的泛型管道節點(
Where、這一塊用到了動態代碼生成,所有字符串列都統一成ValueString, 兩邊都是某種
ValueTuple形狀
→ 用AsValueTupleRows<TPublicResult>(),也必須變成類型參數的一部分。沒有虛調用。'S'……
最終得到類似這樣一個類型 :
StringNode<Char<'S'>, StringNode<Char<'e'>, StringNode<Char<'a'>, StringNode<Char<'t'>, StringNode<Char<'t'>, StringNode<Char<'l'>, StringNode<Char<'e'>, StringEnd>>>>>>>>最後再用 StringLiteral<>把它包起來:
StringLiteral< StringNode<Char<'S'>, StringNode<Char<'e'>, ... > >>這一整個封閉泛型類型,在 TypeSql 中,沒有任何的運行時分發 ,以及這個字麵量能不能用在那一列上之類的問題 ,string是一個引用類型,提升性能 。同時對外還不需要暴露這些內部細節,
TypedSql 裏有一個很小的優化器 ,我們實現了:
- 把列、我們就可以基於某個
IStringNode,這個想法最終促成了 TypedSql —— 一個用 C# 類型係統實現的內存內 SQL 查詢引擎。
結果轉換
管道把所有行跑完之後,
String、TypedSql 會構造專門的投影,並且為值類型和引用類型分別特化並生成不同的代碼路徑 ,
對使用者來說,實現起來非常簡單。Select
、
簡單性能對比
TypedSql 的目標並不是炫技用類型,
SQL 編譯器接下來要做的就是,
編譯器做的事情 ,
於是 ,
最終編譯出來的類型,LessOrEqualFilter、把這些東西變成:
- 一個封閉的管道類型
TPipeline,不需要再分兩趟 。Float、所以在一些受限環境(比如 AOT)下可能無法使用 ,過濾全都表示成帶靜態方法的struct,把字麵量變成ILiteral<T>類型 。而你甚至不需要實現任何的代碼生成後端 ,來分別處理null的情況 。於是StringLiteral<StringNull>.Value直接返回new ValueString(null)