chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

eBPF技術(shù)應(yīng)用云原生網(wǎng)絡(luò)實(shí)踐系列之基于socket的service

Linux閱碼場(chǎng) ? 來(lái)源:OpenAnolis龍蜥 ? 作者:秉辰、羽云、滿霸 ? 2021-10-13 10:54 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

背景介紹

Kubernetes 中的網(wǎng)絡(luò)功能,主要包括 POD 網(wǎng)絡(luò),service 網(wǎng)絡(luò)和網(wǎng)絡(luò)策略組成。其中 POD 網(wǎng)絡(luò)和網(wǎng)絡(luò)策略,都是規(guī)定了模型,沒(méi)有提供默認(rèn)實(shí)現(xiàn)。而 service 網(wǎng)絡(luò)作為 Kubernetes 的特色部分,官方版本持續(xù)演進(jìn)了多種實(shí)現(xiàn):

service 實(shí)現(xiàn)說(shuō)明

userspace 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置,用戶態(tài)轉(zhuǎn)發(fā)。

iptables 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置。IPtables 相關(guān)內(nèi)核模塊負(fù)責(zé)轉(zhuǎn)發(fā)。

IPVS 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置。IPVS 相關(guān)內(nèi)核模塊負(fù)責(zé)轉(zhuǎn)發(fā)。

在 Kubernetes 中先后出現(xiàn)的幾種 Service 實(shí)現(xiàn)中,整體都是為了提供更高的性能和擴(kuò)展性。

Service 網(wǎng)絡(luò),本質(zhì)上是一個(gè)分布式的服務(wù)器負(fù)載均衡,通過(guò) daemonset 方式部署的 kube-proxy,監(jiān)聽(tīng) endpoint 和 service 資源,并在 node 本地生成轉(zhuǎn)發(fā)表項(xiàng)。目前在生產(chǎn)環(huán)境中主要是 iptables 和 IPVS 方式,原理如下:

7f2ba892-2bce-11ec-82a8-dac502259ad0.png

在本文中,介紹使用 socket eBPF 在 socket 層面完成負(fù)載均衡的邏輯,消除了逐報(bào)文 NAT 轉(zhuǎn)換處理,進(jìn)一步提升 Service 網(wǎng)絡(luò)的轉(zhuǎn)發(fā)性能。

基于 socket eBPF 的數(shù)據(jù)面實(shí)現(xiàn)

socket eBPF 數(shù)據(jù)面簡(jiǎn)介

無(wú)論 kube-proxy 采用 IPVS 還是 tc eBPF 服務(wù)網(wǎng)絡(luò)加速模式,每個(gè)從 pod 發(fā)出網(wǎng)絡(luò)請(qǐng)求都必然經(jīng)過(guò) IPVS 或者 tc eBPF,即 POD 《--》 Service 《--》 POD,隨著流量的增加必然會(huì)有性能開(kāi)銷, 那么是否可以直接在連接中將 service的clusterIP 的地址直接換成對(duì)應(yīng)的 pod ip?;?Kube-proxy+IPVS 實(shí)現(xiàn)的 service 網(wǎng)絡(luò)服務(wù),是基于逐報(bào)處理 +session 的方式來(lái)實(shí)現(xiàn)。

利用 socket eBPF,可以在不用直接處理報(bào)文和 NAT 轉(zhuǎn)換的前提下,實(shí)現(xiàn)了負(fù)載均衡邏輯。Service 網(wǎng)絡(luò)在同步上優(yōu)化成 POD 《--》 POD,從而使Service 網(wǎng)絡(luò)性能基本等同于 POD 網(wǎng)絡(luò)。軟件結(jié)構(gòu)如下:

7f9c93a4-2bce-11ec-82a8-dac502259ad0.png

Linux 內(nèi)核中,利用 BPF_PROG_TYPE_CGROUP_SOCK 類型的 eBPF hook 可以針對(duì) socket 系統(tǒng)調(diào)用掛接 hook,插入必要的 EBPF 程序。

通過(guò) attach 到特定的 cgroup 的文件描述符,可以控制 hook 接口的作用范圍。

利用 sock eBPF hook,我們可以在 socket 層面劫持特定的 socket 接口,來(lái)完成完成負(fù)載均衡邏輯。

POD-SVC-POD 的轉(zhuǎn)發(fā)行為轉(zhuǎn)換成 POD-POD 的轉(zhuǎn)發(fā)行為。

當(dāng)前 Linux 內(nèi)核中不斷完善相關(guān)的 hook,支持更多的 bpf_attach_type,部分距離如下:BPF_CGROUP_INET_SOCK_CREATEBPF_CGROUP_INET4_BINDBPF_CGROUP_INET4_CONNECTBPF_CGROUP_UDP4_SENDMSGBPF_CGROUP_UDP4_RECVMSGBPF_CGROUP_GETSOCKOPTBPF_CGROUP_INET4_GETPEERNAMEBPF_CGROUP_INET_SOCK_RELEASE

TCP 工作流程

TCP 由于是有基于連接的,所以實(shí)現(xiàn)非常簡(jiǎn)明,只需要 hook connect 系統(tǒng)調(diào)用即可,如下所示:

80c7c974-2bce-11ec-82a8-dac502259ad0.png

connect 系統(tǒng)調(diào)用劫持邏輯:

1. 從 connect 調(diào)用上下文中取 dip+dport,查找 svc 表。找不到則不處理返回。

2. 查找親和性會(huì)話,如果找到,得到 backend_id,轉(zhuǎn) 4。否則轉(zhuǎn) 3。

3. 隨機(jī)調(diào)度,分配一個(gè) backend。

4. 根據(jù) backend_id,查 be 表,得到 be 的 IP+ 端口。

5. 更新親和性信息。

6. 修改 connect 調(diào)用上下文中的 dip+dport 為 be 的 ip+port。

7. 完成。

在 socket 層面就完成了端口轉(zhuǎn)換,對(duì)于 TCP 的 clusterip 訪問(wèn),基本上可以等同于 POD 之間東西向的通信,將 clusterip 的開(kāi)銷降到最低。

不需要逐包的 dnat 行為。

不需要逐包的查找 svc 的行為。

UDP 工作流程

UDP 由于是無(wú)連接的,實(shí)現(xiàn)要復(fù)雜一些,如下圖所示:

nat_sk 表的定義參見(jiàn):LB4_REVERSE_NAT_SK_MAP

815d1c0e-2bce-11ec-82a8-dac502259ad0.png

劫持 connect 和 sendmsg 系統(tǒng)調(diào)用:

1. 從系統(tǒng)調(diào)用調(diào)用上下文中取 dip+dport,查找 svc 表。找不到則不處理返回。

2. 查找親和性會(huì)話,如果找到,得到 backend_id,轉(zhuǎn) 4,否則轉(zhuǎn) 3。

3. 隨機(jī)調(diào)度,分配一個(gè) backend。

4. 根據(jù) backend_id,查 be 表,得到 be 的 IP+端口。

5. 更新親和性的相關(guān)表。

6. 更新 nat_sk 表,key 為 be 的 ip+port,value 為 svc的vip+vport。

7. 修改系統(tǒng)調(diào)用上下文中的 dip+dport 為 be 的 ip + port。

8. 完成。劫持 recvmsg 系統(tǒng)調(diào)用

1. 從系統(tǒng)調(diào)用上下文中遠(yuǎn)端 IP+port,查找 NAT_SK 表,找不到則不處理返回。

2. 找到,取出其中的 IP+port,用來(lái)查找 svc 表,找不到,則刪除 nat_sk 對(duì)應(yīng)表項(xiàng),返回。

3. 使用 nat_sk 中找到的 ip+port,設(shè)置系統(tǒng)調(diào)用上下文中遠(yuǎn)端的 IP+port。

4. 完成。關(guān)于地址修正問(wèn)題

基于 socket eBPF 實(shí)現(xiàn)的 clusterIP,在上述基本轉(zhuǎn)發(fā)原理之外,還有一些特殊的細(xì)節(jié)需要考慮,其中一個(gè)需要特殊考慮就是 peer address 的問(wèn)題。和 IPVS之類的實(shí)現(xiàn)不同,在 socket eBPF 的 clusterIP 上,client 是和直接和 backend 通信的,中間的 service 被旁路了。

此時(shí),如果 client 上的 APP 調(diào)用 getpeername 之類的接口查詢 peer address,這個(gè)時(shí)候獲取到的地址和 connect 發(fā)起的地址是不一致的,如果 app對(duì)于 peeraddr 有判斷或者特殊用途,可能會(huì)有意外情況。

針對(duì)這種情況,我們同樣可以通過(guò) eBPF 在 socket 層面來(lái)修正:

1、在guest kernel 上新增 bpf_attach_type,可以對(duì) getpeername 和 getsockname 增加 hook 處理。

2、發(fā)起連接的時(shí)候,在相應(yīng)的 socket hook 處理中,定義 map 記錄響應(yīng)的VIP:VPort 和 RSIP:RSPort 的對(duì)用關(guān)系。

3、當(dāng) APP 要調(diào)用 getpeername/getsockname 接口的時(shí)候,利用 eBPF 程序修正返回的數(shù)據(jù):修改上下文中的遠(yuǎn)端的 IP+port為vip+vport。

總結(jié)

和TC-EBPF/IPVS性能對(duì)比

測(cè)試環(huán)境:4vcpu + 8G mem 的安全容器實(shí)例,單 client + 單 clusterip + 12 backend。socket BPF:基于 socket ebpf 的 service 實(shí)現(xiàn)。tc eBPF:基于 cls-bpf 的 service 實(shí)現(xiàn),目前已經(jīng)在 ack 服務(wù)中應(yīng)用。IPVS-raw:去掉所有安全組規(guī)則和 veth 之類開(kāi)銷,只有 IPVS 轉(zhuǎn)發(fā)邏輯的 service 實(shí)現(xiàn)。socket BPF 在所有性能指標(biāo)上,均有不同程度提升。大量并發(fā)的短連接,基本上吞吐提升 15%,時(shí)延降低 20%。

繼續(xù)演進(jìn)eBPF does to Linux what JavaScript does to HTML.-- Brendan Gregg

基于 socket eBPF 實(shí)現(xiàn)的 service,大大簡(jiǎn)化了負(fù)載均衡的邏輯實(shí)現(xiàn),充分體現(xiàn)了 eBPF 靈活、小巧的特點(diǎn)。eBPF 的這些特點(diǎn)也很契合云原生場(chǎng)景,目前,該技術(shù)已在阿里云展開(kāi)實(shí)踐,加速了 kubernetes 服務(wù)網(wǎng)絡(luò)。我們會(huì)繼續(xù)探索和完善更多的 eBPF 的應(yīng)用案例,比如 IPv6、network policy 等。

編輯:jq

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 數(shù)據(jù)
    +關(guān)注

    關(guān)注

    8

    文章

    7317

    瀏覽量

    94107
  • Linux
    +關(guān)注

    關(guān)注

    88

    文章

    11635

    瀏覽量

    218152
  • 服務(wù)器
    +關(guān)注

    關(guān)注

    13

    文章

    10114

    瀏覽量

    91017
  • IPv6
    +關(guān)注

    關(guān)注

    6

    文章

    729

    瀏覽量

    62383
  • TCP
    TCP
    +關(guān)注

    關(guān)注

    8

    文章

    1418

    瀏覽量

    83081

原文標(biāo)題:eBPF技術(shù)應(yīng)用云原生網(wǎng)絡(luò)實(shí)踐系列之基于socket的service | 龍蜥技術(shù)

文章出處:【微信號(hào):LinuxDev,微信公眾號(hào):Linux閱碼場(chǎng)】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    socket是什么

    于在不同計(jì)算機(jī)之間傳輸數(shù)據(jù)。Socket技術(shù)可以用于實(shí)現(xiàn)各種網(wǎng)絡(luò)應(yīng)用,例如客戶端-服務(wù)器應(yīng)用,點(diǎn)對(duì)點(diǎn)應(yīng)用等。 在計(jì)算機(jī)網(wǎng)絡(luò)中,Socket
    發(fā)表于 12-03 08:27

    技術(shù)分享】Systemd原生服務(wù)配置最佳實(shí)踐(下)

    上期我們說(shuō)到sysv的規(guī)范,創(chuàng)建以及示例,那么我們今天就來(lái)講講Systemd的原生服務(wù)配置。為何要遷移到Systemd原生服務(wù)?盡管規(guī)范化的SysV腳本可臨時(shí)解決問(wèn)題,但可能存在以下缺陷:效率低下
    的頭像 發(fā)表于 10-29 11:40 ?290次閱讀
    【<b class='flag-5'>技術(shù)</b>分享】Systemd<b class='flag-5'>原生</b>服務(wù)配置最佳<b class='flag-5'>實(shí)踐</b>(下)

    華為林偉亮相NetworkX 2025并發(fā)表主題演講

    在電信網(wǎng)絡(luò)盛會(huì) Network X 2025 期間,華為云核心網(wǎng)智能電信云領(lǐng)域總裁林偉發(fā)表了題為 《從電信云原生到AI原生:加速電信業(yè)務(wù)AI創(chuàng)新》 的主題演講,系統(tǒng)闡述了移動(dòng)AI時(shí)代對(duì)電信基礎(chǔ)設(shè)施提出的新挑戰(zhàn),并分享了華為在關(guān)鍵
    的頭像 發(fā)表于 10-17 11:45 ?577次閱讀

    GraniStudio : TCP/IP(Socket)協(xié)議深度剖析

    在工業(yè)自動(dòng)化與物聯(lián)網(wǎng)領(lǐng)域,TCP/IP(Socket)協(xié)議作為應(yīng)用最廣泛的網(wǎng)絡(luò)通信標(biāo)準(zhǔn),是實(shí)現(xiàn)設(shè)備間數(shù)據(jù)交互的核心技術(shù)。GraniStudio 軟件作為工業(yè)級(jí)零代碼開(kāi)發(fā)平臺(tái),其內(nèi)置的 TCP/IP
    的頭像 發(fā)表于 08-03 22:20 ?934次閱讀
    GraniStudio : TCP/IP(<b class='flag-5'>Socket</b>)協(xié)議深度剖析

    基于eBPF的Kubernetes網(wǎng)絡(luò)異常檢測(cè)系統(tǒng)

    作為一名在云原生領(lǐng)域深耕多年的運(yùn)維工程師,我見(jiàn)過(guò)太多因?yàn)?b class='flag-5'>網(wǎng)絡(luò)問(wèn)題導(dǎo)致的生產(chǎn)事故。傳統(tǒng)的監(jiān)控手段往往是事后諸葛亮,當(dāng)你發(fā)現(xiàn)問(wèn)題時(shí),用戶已經(jīng)在抱怨了。今天,我將分享如何利用 eBPF 這一革命性
    的頭像 發(fā)表于 07-24 14:09 ?532次閱讀

    Linux網(wǎng)絡(luò)管理的關(guān)鍵技術(shù)和最佳實(shí)踐

    在大型互聯(lián)網(wǎng)企業(yè)中,Linux網(wǎng)絡(luò)管理是運(yùn)維工程師的核心技能之一。面對(duì)海量服務(wù)器、復(fù)雜網(wǎng)絡(luò)拓?fù)洹⒏卟l(fā)流量,運(yùn)維人員需要掌握從基礎(chǔ)網(wǎng)絡(luò)配置到高級(jí)網(wǎng)絡(luò)優(yōu)化的全套
    的頭像 發(fā)表于 07-09 09:53 ?723次閱讀

    云原生環(huán)境里Nginx的故障排查思路

    本文聚焦于云原生環(huán)境下Nginx的故障排查思路。隨著云原生技術(shù)的廣泛應(yīng)用,Nginx作為常用的高性能Web服務(wù)器和反向代理服務(wù)器,在容器化和編排的環(huán)境中面臨著新的故障場(chǎng)景和挑戰(zhàn)。
    的頭像 發(fā)表于 06-17 13:53 ?669次閱讀
    <b class='flag-5'>云原生</b>環(huán)境里Nginx的故障排查思路

    開(kāi)放生態(tài)+極簡(jiǎn)運(yùn)維:多租戶園區(qū)網(wǎng)絡(luò)云原生管理實(shí)踐

    新一代云化園區(qū)網(wǎng)解決方案,創(chuàng)新性地將數(shù)據(jù)中心級(jí)的Spine/Leaf架構(gòu)以及“全三層”、“云架構(gòu)”、“超堆疊”、“云漫游”等設(shè)計(jì)理念應(yīng)用于園區(qū)場(chǎng)景,顯著提升網(wǎng)絡(luò)服務(wù)質(zhì)量和運(yùn)維水平。面對(duì)多租戶場(chǎng)景下更嚴(yán)苛的資源隔離、安全保障和自動(dòng)化運(yùn)維需求,本方案提供了系統(tǒng)性解決思路
    的頭像 發(fā)表于 06-16 16:28 ?800次閱讀
    開(kāi)放生態(tài)+極簡(jiǎn)運(yùn)維:多租戶園區(qū)<b class='flag-5'>網(wǎng)絡(luò)</b>的<b class='flag-5'>云原生</b>管理<b class='flag-5'>實(shí)踐</b>

    網(wǎng)絡(luò)可視化為矛,AI告警為盾:新一代園區(qū)運(yùn)維方案破局實(shí)踐

    隨著企業(yè)數(shù)字化轉(zhuǎn)型加速,傳統(tǒng)園區(qū)網(wǎng)絡(luò)架構(gòu)在運(yùn)維效率、成本控制等方面面臨嚴(yán)峻挑戰(zhàn)。星融元基于云原生理念打造的園區(qū)網(wǎng)絡(luò)解決方案,通過(guò)前兩階段的技術(shù)架構(gòu)革新,已成功實(shí)現(xiàn)中大型園區(qū)基礎(chǔ)
    的頭像 發(fā)表于 05-19 17:48 ?534次閱讀
    <b class='flag-5'>網(wǎng)絡(luò)</b>可視化為矛,AI告警為盾:新一代園區(qū)運(yùn)維方案破局<b class='flag-5'>實(shí)踐</b>

    從 Java 到 Go:面向?qū)ο蟮木奕伺c云原生的輕騎兵

    (Goroutine/Channel) 在 云原生基礎(chǔ)設(shè)施領(lǐng)域 占據(jù)主導(dǎo)地位,它也是 Java 開(kāi)發(fā)者探索云原生技術(shù)棧的關(guān)鍵補(bǔ)
    的頭像 發(fā)表于 04-25 11:13 ?529次閱讀

    Snap Store開(kāi)發(fā)者工具圖譜:從全棧到云原生,一張圖解鎖Linux開(kāi)發(fā)新姿勢(shì)!

    PyCharm+Postman構(gòu)建微服務(wù),還是云原生新人嘗試Kubectl+Helm馴服K8s,SnapStore早已備好全套裝備。本文作為《UbuntuSnap》系列的第三彈
    的頭像 發(fā)表于 03-25 09:22 ?662次閱讀
    Snap Store開(kāi)發(fā)者工具圖譜:從全棧到<b class='flag-5'>云原生</b>,一張圖解鎖Linux開(kāi)發(fā)新姿勢(shì)!

    云原生在汽車行業(yè)的優(yōu)勢(shì)

    近年來(lái),“云原生”已成為科技領(lǐng)域的高頻熱詞。從企業(yè)數(shù)字化轉(zhuǎn)型到智能化產(chǎn)業(yè)布局,各行各業(yè)對(duì)云原生技術(shù)的需求呈現(xiàn)爆發(fā)式增長(zhǎng),向云計(jì)算轉(zhuǎn)型已成為一大趨勢(shì)。根據(jù)Gartner的預(yù)測(cè),到2025年,超過(guò)95%的新數(shù)字工作負(fù)載將遷移至云端,
    的頭像 發(fā)表于 02-21 09:20 ?1490次閱讀

    云原生AI服務(wù)怎么樣

    云原生AI服務(wù),是指采用云原生的原則和技術(shù)來(lái)構(gòu)建、部署和管理人工智能應(yīng)用及工作負(fù)載的方法和模式。那么,云原生AI服務(wù)怎么樣呢?下面,AI部落小編帶您了解。
    的頭像 發(fā)表于 01-23 10:47 ?789次閱讀

    云原生LLMOps平臺(tái)作用

    云原生LLMOps平臺(tái)是一種基于云計(jì)算基礎(chǔ)設(shè)施和開(kāi)發(fā)工具,專門用于構(gòu)建、部署和管理大型語(yǔ)言模型(LLM)全生命周期的平臺(tái)。以下,是對(duì)云原生LLMOps平臺(tái)作用的梳理,由AI部落小編整理。
    的頭像 發(fā)表于 01-06 10:21 ?727次閱讀

    如何選擇云原生機(jī)器學(xué)習(xí)平臺(tái)

    當(dāng)今,云原生機(jī)器學(xué)習(xí)平臺(tái)因其彈性擴(kuò)展、高效部署、低成本運(yùn)營(yíng)等優(yōu)勢(shì),逐漸成為企業(yè)構(gòu)建和部署機(jī)器學(xué)習(xí)應(yīng)用的首選。然而,市場(chǎng)上的云原生機(jī)器學(xué)習(xí)平臺(tái)種類繁多,功能各異,如何選擇云原生機(jī)器學(xué)習(xí)平臺(tái)呢?下面,AI部落小編帶您探討。
    的頭像 發(fā)表于 12-25 11:54 ?714次閱讀